Qwen3-4B-Instruct-2507-GGUF:F16 на Tesla v100 32gb sxm2 ×1

Llama.cpp 7717 · ctx 40k · 10 парал. · 04.02.2026

подбор ключей
Модель
unsloth/Qwen3-4B-Instruct-2507-GGUF:F16
Связка карт
Tesla v100 32gb sxm2 ×1
Движок
Llama.cpp 7717
Контекст
40960 токенов
Параллельных
10
Карт занято
1
Слои на CPU
нет, всё в VRAM
Квантование
Сборка движка
Дата замера
04.02.2026
Пропускная без SO
190.2 ток/сек
Пропускная с SO
213.5 ток/сек
Последовательная без SO
81.8 ток/сек
Последовательная с SO
80.4 ток/сек
Параллельная без SO
39 ток/сек
Параллельная с SO
40.2 ток/сек
Команда запуска
CUDA_VISIBLE_DEVICES=1 ./build/bin/llama-server -hf unsloth/Qwen3-4B-Instruct-2507-GGUF:F16 --host 0.0.0.0 --port 8080 --threads 4 --parallel 10 --ctx-size 40960 -b 8192 -ub 4096
Ключи подбора
--threads 4 --batch 8192 --ubatch 4096
Слой нагрузки — контекст, число параллельных запросов, занятые карты и выгрузка на процессор — задаёт сам замер, поэтому такие прогоны стоят в таблице отдельными строками. Слой подбора настраивает то же задание и сворачивается в варианты одной строки. Как это устроено.