Qwen3.8-27B: на каком железе и с какой скоростью

Замеры Qwen3.8-27B на 2 связках карт, движки vLLM

Замеры модели Qwen3.8-27B на локальном железе: 4 прогона на 2 связках карт, движки vLLM. Строку задаёт связка карт и нагрузка — длина контекста и число параллельных запросов; варианты подбора ключей свёрнуты внутрь строки.

Замеров
4
Связок карт
2
Лучшая на один запрос
125 ток/сек
Лучшая пропускная
Что важно
Замер
Движок
Последовательная без SO
TTFT, деловой промпт (~450 ток.)
Декодирование после TTFT
RTX 3090 ×1 + RTX 5070 Ti ×2
ctx 128k · 4 парал.
vLLM 0.27.1
подбор
125.50.17107.8 Прогон
RTX 3090 ×1 + RTX 5070 Ti ×2
ctx 64k · 8 парал.
vLLM 0.27.1
подбор
111.60.17101 Прогон
RTX 3090 ×1 + RTX 5070 Ti ×2
ctx 167k · 8 парал.
vLLM 0.27.1
подбор
55.20.1456.5 Прогон
RTX 3090 ×1 + RTX 5070 Ti ×2
ctx 256k · 4 парал.
vLLM 0.27.1
подбор
53.50.1455 Прогон
Последовательная без SO
больше — лучше, ток/сек · Qwen3.8-27B: все замеры
лидер быстрее худшего в ×2.3
Поднимаете эту модель у себя?

На курсе разбираем, как поднять локальную LLM и подключить её к рабочей системе через собственный сервис — от выбора движка до интеграции с 1С.

Курс «ИИ и 1С»

Другие модели в замерах