Qwen3.6-27B-NVFP4 на RTX 5070 Ti 16Gb ×2
vLLM 0.26.0 · ctx 32k · 8 парал. · 05.08.2026
подбор ключей
Модель
nvidia/Qwen3.6-27B-NVFP4
Связка карт
RTX 5070 Ti 16Gb ×2
Движок
vLLM 0.26.0
Контекст
32768 токенов
Параллельных
8
Карт занято
2
Слои на CPU
нет, всё в VRAM
Квантование
—
Сборка движка
—
Дата замера
05.08.2026
Пропускная без SO
399.3 ток/сек
Пропускная с SO
483.1 ток/сек
Последовательная без SO
135.7 ток/сек
Последовательная с SO
140 ток/сек
Параллельная без SO
60.4 ток/сек
Параллельная с SO
64.8 ток/сек
TTFT, короткий промпт (6-15 ток.)
0.29 сек
TTFT, деловой промпт (~450 ток.)
0.48 сек
Prefill — обработка входа
849.3 ток/сек
Генерация от начала запроса
130.7 ток/сек
Декодирование после TTFT
237.8 ток/сек
Кэш префикса
Кэш работает, выигрыш по TTFT ×2.0, срабатывает от 5265 токенов
Команда запуска
CUDA_DEVICE_ORDER=PCI_BUS_ID CUDA_VISIBLE_DEVICES=1,2 FLASHINFER_DISABLE_VERSION_CHECK=1 vllm serve nvidia/Qwen3.6-27B-NVFP4 --max-model-len 32768 --tensor-parallel-size 2 --gpu-memory-utilization 0.95 --attention-backend TRITON_ATTN --max-num-seqs 8 --max-num-batched-tokens 2048 --speculative-config '{"method":"mtp","num_speculative_tokens":4,"attention_backend":"TRITON_ATTN"}' --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --enable-prefix-caching --limit-mm-per-prompt '{"image":0,"video":0}' --host 0.0.0.0 --port 8000Ключи подбора
--gpu-memory-utilization 0.95 --attention-backend TRITON_ATTN --batch-tokens 2048 --speculative '{"method":"mtp","num_speculative_tokens":4,"attention_backend":"TRITON_ATTN"}' --reasoning-parser qwen3 --enable-auto-tool-choice on --tool-call-parser qwen3_coder --enable-prefix-caching on --limit-mm-per-prompt '{"image":0,"video":0}' Слой нагрузки — контекст, число параллельных запросов, занятые карты и выгрузка на процессор — задаёт сам замер, поэтому такие прогоны стоят в таблице отдельными строками. Слой подбора настраивает то же задание и сворачивается в варианты одной строки. Как это устроено.