RTX 3090: скорость на локальных LLM

Замеры токенов в секунду на RTX 3090: 2 моделей, движки vLLM, llama.cpp

Сколько токенов в секунду выдаёт RTX 3090 на локальных нейросетях: 5 прогонов на движках vLLM, llama.cpp. Ниже — по строке на замер: модель, длина контекста и число параллельных запросов задают строку, варианты подбора ключей свёрнуты внутрь.

Замеров
5
Моделей проверено
2
Лучшая пропускная
Максимальный контекст
262144 токенов
Что важно
Замер
Движок
Последовательная без SO
TTFT, деловой промпт (~450 ток.)
Декодирование после TTFT
Qwen3.8-27B-NVFP4
ctx 128k · 4 парал.
vLLM 0.27.1
подбор
125.50.17107.8 Прогон
Qwen3.8-27B-NVFP4
ctx 64k · 8 парал.
vLLM 0.27.1
подбор
111.60.17101 Прогон
Qwen3.8-27B-NVFP4
ctx 167k · 8 парал.
vLLM 0.27.1
подбор
55.20.1456.5 Прогон
Qwen3.8-27B-NVFP4
ctx 256k · 4 парал.
vLLM 0.27.1
подбор
53.50.1455 Прогон
Qwen3.8-Flash-Next:UD-Q3_K_XL
ctx 256k · 1 парал.
llama.cpp b10669-6c5afc86a
подбор
22.32.1329.6 Прогон
Собираете контур на этой карте?

На курсе разбираем, как поднять локальную LLM и подключить её к рабочей системе через собственный сервис — от выбора движка до интеграции с 1С.

Курс «ИИ и 1С»

Другие карты в замерах