Qwen3.6-27B-NVFP4: на каком железе и с какой скоростью
Замеры Qwen3.6-27B-NVFP4 на 1 связке карт, движки SGLang, vLLM
Замеры модели nvidia/Qwen3.6-27B-NVFP4 на локальном железе: 2 прогона на 1 связке карт, движки SGLang, vLLM. Строку задаёт связка карт и нагрузка — длина контекста и число параллельных запросов; варианты подбора ключей свёрнуты внутрь строки.
Замеров
2
Связок карт
1
Лучшая на один запрос
136 ток/сек
Лучшая пропускная
399 ток/сек
Что важно
Поднимаете эту модель у себя?
На курсе разбираем, как поднять локальную LLM и подключить её к рабочей системе через собственный сервис — от выбора движка до интеграции с 1С.
Курс «ИИ и 1С»