Qwen3.8-Flash-Next: на каком железе и с какой скоростью
Замеры Qwen3.8-Flash-Next на 2 связках карт, движки llama.cpp
Замеры модели Qwen3.8-Flash-Next на локальном железе: 1 прогон на 2 связках карт, движки llama.cpp. Строку задаёт связка карт и нагрузка — длина контекста и число параллельных запросов; варианты подбора ключей свёрнуты внутрь строки.
Замеров
1
Связок карт
2
Лучшая на один запрос
22 ток/сек
Лучшая пропускная
—
Что важно
Замер | Движок | Последовательная без SO | TTFT, деловой промпт (~450 ток.) | Декодирование после TTFT | ||
|---|---|---|---|---|---|---|
RTX 3090 ×1 + RTX 5070 Ti ×2 ctx 256k · 1 парал. | llama.cpp b10669-6c5afc86a подбор | 22.3 | 2.13 | 29.6 | Прогон |
Поднимаете эту модель у себя?
На курсе разбираем, как поднять локальную LLM и подключить её к рабочей системе через собственный сервис — от выбора движка до интеграции с 1С.
Курс «ИИ и 1С»