Qwen3.6-35B-A3B-NVFP4: на каком железе и с какой скоростью

Замеры Qwen3.6-35B-A3B-NVFP4 на 1 связке карт, движки SGLang, vLLM

Замеры модели nvidia/Qwen3.6-35B-A3B-NVFP4 на локальном железе: 2 прогона на 1 связке карт, движки SGLang, vLLM. Строку задаёт связка карт и нагрузка — длина контекста и число параллельных запросов; варианты подбора ключей свёрнуты внутрь строки.

Замеров
2
Связок карт
1
Лучшая на один запрос
309 ток/сек
Лучшая пропускная
876 ток/сек
Что важно
Замер
Движок
Последовательная без SO
TTFT, деловой промпт (~450 ток.)
Декодирование после TTFT
RTX 5070 Ti 16Gb ×2
ctx 32k · modelopt_fp4
SGLang 0.5.16
подбор
309.10.172527.5Прогон
RTX 5070 Ti 16Gb ×2
ctx 32k · 8 парал.
vLLM 0.26.0
подбор
273.50.21787.3Прогон
Поднимаете эту модель у себя?

На курсе разбираем, как поднять локальную LLM и подключить её к рабочей системе через собственный сервис — от выбора движка до интеграции с 1С.

Курс «ИИ и 1С»

Другие модели в замерах