Qwen3.8-27B: на каком железе и с какой скоростью
Замеры Qwen3.8-27B на 2 связках карт, движки vLLM
Замеры модели Qwen3.8-27B на локальном железе: 4 прогона на 2 связках карт, движки vLLM. Строку задаёт связка карт и нагрузка — длина контекста и число параллельных запросов; варианты подбора ключей свёрнуты внутрь строки.
Замеров
4
Связок карт
2
Лучшая на один запрос
125 ток/сек
Лучшая пропускная
—
Что важно
Замер | Движок | Последовательная без SO | TTFT, деловой промпт (~450 ток.) | Декодирование после TTFT | ||
|---|---|---|---|---|---|---|
RTX 3090 ×1 + RTX 5070 Ti ×2 ctx 128k · 4 парал. | vLLM 0.27.1 подбор | 125.5 | 0.17 | 107.8 | Прогон | |
RTX 3090 ×1 + RTX 5070 Ti ×2 ctx 64k · 8 парал. | vLLM 0.27.1 подбор | 111.6 | 0.17 | 101 | Прогон | |
RTX 3090 ×1 + RTX 5070 Ti ×2 ctx 167k · 8 парал. | vLLM 0.27.1 подбор | 55.2 | 0.14 | 56.5 | Прогон | |
RTX 3090 ×1 + RTX 5070 Ti ×2 ctx 256k · 4 парал. | vLLM 0.27.1 подбор | 53.5 | 0.14 | 55 | Прогон |
Последовательная без SO
больше — лучше, ток/сек · Qwen3.8-27B: все замеры
лидер быстрее худшего в ×2.3
Поднимаете эту модель у себя?
На курсе разбираем, как поднять локальную LLM и подключить её к рабочей системе через собственный сервис — от выбора движка до интеграции с 1С.
Курс «ИИ и 1С»