Qwen3-4B-Instruct-2507-GGUF:F16 на RTX 5070 Ti 16Gb ×2
Llama.cpp 7973 · ctx 32k · 12 парал. · 15.02.2026
подбор ключей
Модель
unsloth/Qwen3-4B-Instruct-2507-GGUF:F16
Связка карт
RTX 5070 Ti 16Gb ×2
Движок
Llama.cpp 7973
Контекст
32768 токенов
Параллельных
12
Карт занято
2
Слои на CPU
нет, всё в VRAM
Квантование
—
Сборка движка
—
Дата замера
15.02.2026
Пропускная без SO
261.9 ток/сек
Пропускная с SO
330.6 ток/сек
Последовательная без SO
89.7 ток/сек
Последовательная с SO
89.1 ток/сек
Параллельная без SO
48.7 ток/сек
Параллельная с SO
49.5 ток/сек
Команда запуска
CUDA_VISIBLE_DEVICES=0,1 ./build/bin/llama-server -hf unsloth/Qwen3-4B-Instruct-2507-GGUF:F16 --host 0.0.0.0 --port 8000 --ctx-size 32768 -b 16384 -ub 8192 --threads 12 --parallel 12 -ngl 999
Ключи подбора
--batch 16384 --ubatch 8192 --threads 12 Слой нагрузки — контекст, число параллельных запросов, занятые карты и выгрузка на процессор — задаёт сам замер, поэтому такие прогоны стоят в таблице отдельными строками. Слой подбора настраивает то же задание и сворачивается в варианты одной строки. Как это устроено.