Qwen3.8-Flash-Next: на каком железе и с какой скоростью

Замеры Qwen3.8-Flash-Next на 2 связках карт, движки llama.cpp

Замеры модели Qwen3.8-Flash-Next на локальном железе: 1 прогон на 2 связках карт, движки llama.cpp. Строку задаёт связка карт и нагрузка — длина контекста и число параллельных запросов; варианты подбора ключей свёрнуты внутрь строки.

Замеров
1
Связок карт
2
Лучшая на один запрос
22 ток/сек
Лучшая пропускная
Что важно
Замер
Движок
Последовательная без SO
TTFT, деловой промпт (~450 ток.)
Декодирование после TTFT
RTX 3090 ×1 + RTX 5070 Ti ×2
ctx 256k · 1 парал.
llama.cpp b10669-6c5afc86a
подбор
22.32.1329.6 Прогон
Поднимаете эту модель у себя?

На курсе разбираем, как поднять локальную LLM и подключить её к рабочей системе через собственный сервис — от выбора движка до интеграции с 1С.

Курс «ИИ и 1С»

Другие модели в замерах