Qwen3.6-35B-A3B-NVFP4 на RTX 5070 Ti ×2
vLLM 0.27.1 · ctx 197k · 4 парал. · 30.08.2026
подбор ключей
замер: local
методика v4
Модель
nvidia/Qwen3.6-35B-A3B-NVFP4
Связка карт
RTX 5070 Ti ×2
Движок
vLLM 0.27.1
Контекст
202160 токенов
Параллельных
4
Карт занято
2
Слои на CPU
нет, всё в VRAM
Квантование
—
Сборка движка
—
Дата замера
30.08.2026
Пропускная без SO
0 ток/сек
Пропускная с SO
0 ток/сек
Последовательная без SO
259.5 ток/сек
Последовательная с SO
188.4 ток/сек
Параллельная без SO
0 ток/сек
Параллельная с SO
0 ток/сек
TTFT, короткий промпт (6-15 ток.)
0.04 сек
TTFT, деловой промпт (~450 ток.)
0.19 сек
Prefill — обработка входа
11267 ток/сек
Генерация от начала запроса
252.4 ток/сек
Декодирование после TTFT
278.2 ток/сек
Лестница префилла
Сверху — время до первого токена на растущем промпте, снизу — префилл, то есть скорость чтения этого промпта. Считается на участке от предыдущей ступени к этой, (N₂ − N₁) / (t₂ − t₁): постоянные накладные расходы сидят в обоих временах одинаково и вычитаются сами, а поточечное «токены ÷ время» давало бы горб на коротком промпте. Ровный нижний ряд означает, что сводное число честное; убывающие вправо столбики — что на длинном промпте движок читает вход медленнее. Подписи оси — фактическая длина промпта: её считает токенизатор движка, и она всегда чуть меньше заказанной.
Время до первого токена
Скорость префилла на отрезкеНаклон по всей лестнице — 11267 ток/сек, постоянные издержки 0.05 сек, R² 0.998
У первой ступени столбика нет: скорость меряется на участке от предыдущей ступени, а до первой участка нет.
Итоговый балл
85 балл
Структурированный вывод
100 балл
Задачи
100 балл
Язык ответа
100 балл
Повторяемость
40 балл
проверено до 121k — это верхняя ступень лестницы, выше не мерили
Скорость на ступенях длины: сверху — префилл (чтение входа), снизу — выдача токенов. Столбик ниже соседнего слева показывает, на какой длине сборка начинает сдавать. Подписи оси — фактическая длина промпта, её считает токенизатор движка. Префилл здесь — та же величина и та же формула, что на лестнице префилла, но снят он на запросах этого теста: стог с иголкой, два сообщения и длинный ответ вместо короткого. Поэтому числа двух лестниц не обязаны совпадать.
Скорость префилла на отрезкеПросадка prefill: на 21 % медленнее с каждым удвоением длины
У первой ступени столбика нет: скорость меряется на участке от предыдущей ступени, а до первой участка нет.
Выдача токенов (декодирование)Просадка декодирования: на 25 % медленнее с каждым удвоением длины
Точность вызова инструментов
96.2 %
Рост TTFT по ходам
0.9 ×
Медиана хода (сек)
0.74 сек
Кэш префикса
Кэш работает, выигрыш по TTFT ×3.4, срабатывает от 1656 токенов
Команда запуска
/home/ilya/ai/vllm/.venv/bin/python3 /home/ilya/ai/vllm/.venv/bin/vllm serve nvidia/Qwen3.6-35B-A3B-NVFP4 --max-model-len 202160 --tensor-parallel-size 2 --gpu-memory-utilization 0.96 --attention-backend TRITON_ATTN --moe-backend marlin --max-num-seqs 4 --max-num-batched-tokens 4096 --speculative-config {"method":"mtp","num_speculative_tokens":3,"attention_backend":"TRITON_ATTN","moe_backend":"triton"} --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --enable-chunked-prefill --limit-mm-per-prompt {"image":0,"video":0} --host 0.0.0.0 --port 8000 --async-scheduling --enable-prefix-caching --mamba-ssm-cache-dtype bfloat16 --mamba-cache-mode all --mamba-block-size 560 --chat-template /home/ilya/ai/qwen36-35b-a3b-nvfp4-fixed.jinjaКлючи подбора
--gpu-memory-utilization 0.96 --attention-backend TRITON_ATTN --moe-backend marlin --batch-tokens 4096 --speculative {"method":"mtp","num_speculative_tokens":3,"attention_backend":"TRITON_ATTN","moe_backend":"triton"} --reasoning-parser qwen3 --enable-auto-tool-choice on --tool-call-parser qwen3_coder --enable-chunked-prefill on --limit-mm-per-prompt {"image":0,"video":0} --async-scheduling on --enable-prefix-caching on --mamba-ssm-cache-dtype bfloat16 --mamba-cache-mode all --mamba-block-size 560 Слой нагрузки — контекст, число параллельных запросов, занятые карты и выгрузка на процессор — задаёт сам замер, поэтому такие прогоны стоят в таблице отдельными строками. Слой подбора настраивает то же задание и сворачивается в варианты одной строки. Как это устроено.
Стенд
Со слов автораRyzen 5 3600, 64Gb G.Skill 3600, PCIe 4 CUDA 13.2 NVIDIA-SMI 595.71.05 Ubuntu 26.04
DIMM_A2: тайминги ОЗУ неизвестны: память работает на 3800 MT/s, а в SPD таких профилей нет (JEDEC 2666, XMP 1 3600) — частоту и тайминги задали в BIOS вручную
Видеокарты под нагрузкой
NVIDIA GeForce RTX 5070 Ti
0000:08:00.0
PCIe 4.0 ×8из PCIe 4.0 ×16
Карта работает на 8 линиях из 16: ограничивает слот материнской платы. На двух и более картах это упирает обмен между ними.
Видеопамять15.3 из 15.9 GB
Температура47 → 56 °C
Потребление10 → 83 W из 300
vBIOS98.03.58.40.B6
NVIDIA GeForce RTX 5070 Ti
0000:09:00.0
PCIe 4.0 ×8из PCIe 4.0 ×16
Карта работает на 8 линиях из 16: ограничивает слот материнской платы. На двух и более картах это упирает обмен между ними.
Видеопамять15.3 из 15.9 GB
Температура48 → 51 °C
Потребление12 → 89 W из 300
vBIOS98.03.58.00.78
Машина
- Процессор
- AMD Ryzen 5 3600 6-Core Processor, 6 ядер / 12 потоков
- ОЗУ
- 60 GB DDR4, 3800 MT/s, 2 из 4 слотов
- Пропускная память
- копирование 45.6, чтение 48.1, запись 30.2 ГБ/с (2 пот.)
- Материнская плата
- ASUSTeK COMPUTER INC. ROG STRIX X570-F GAMING, BIOS 5044 от 01/04/2026
- Операционная система
- Ubuntu 26.04 LTS
- Ядро
- Linux 7.0.0-30-generic x86_64
- Драйвер NVIDIA
- 595.71.05
- CUDA
- 13.2
Движок как он поднялся
- Движок
- vLLM 0.27.1
- Потолок контекста
- 202160 токенов /v1/models → data[].max_model_len
- Режим замера
- локально на стенде