RTX 3090: скорость на локальных LLM
Замеры токенов в секунду на RTX 3090: 2 моделей, движки vLLM, llama.cpp
Сколько токенов в секунду выдаёт RTX 3090 на локальных нейросетях: 5 прогонов на движках vLLM, llama.cpp. Ниже — по строке на замер: модель, длина контекста и число параллельных запросов задают строку, варианты подбора ключей свёрнуты внутрь.
Замеров
5
Моделей проверено
2
Лучшая пропускная
—
Максимальный контекст
262144 токенов
Что важно
Замер | Движок | Последовательная без SO | TTFT, деловой промпт (~450 ток.) | Декодирование после TTFT | |
|---|---|---|---|---|---|
Qwen3.8-27B-NVFP4 ctx 128k · 4 парал. | vLLM 0.27.1 подбор | 125.5 | 0.17 | 107.8 | Прогон |
Qwen3.8-27B-NVFP4 ctx 64k · 8 парал. | vLLM 0.27.1 подбор | 111.6 | 0.17 | 101 | Прогон |
Qwen3.8-27B-NVFP4 ctx 167k · 8 парал. | vLLM 0.27.1 подбор | 55.2 | 0.14 | 56.5 | Прогон |
Qwen3.8-27B-NVFP4 ctx 256k · 4 парал. | vLLM 0.27.1 подбор | 53.5 | 0.14 | 55 | Прогон |
Qwen3.8-Flash-Next:UD-Q3_K_XL ctx 256k · 1 парал. | llama.cpp b10669-6c5afc86a подбор | 22.3 | 2.13 | 29.6 | Прогон |
Собираете контур на этой карте?
На курсе разбираем, как поднять локальную LLM и подключить её к рабочей системе через собственный сервис — от выбора движка до интеграции с 1С.
Курс «ИИ и 1С»