RTX 3090 24Gb: скорость на локальных LLM
Замеры токенов в секунду на RTX 3090 24Gb: 2 моделей, движки vLLM, Llama.cpp
Сколько токенов в секунду выдаёт RTX 3090 24Gb на локальных нейросетях: 4 прогона на движках vLLM, Llama.cpp. Ниже — по строке на замер: модель, длина контекста и число параллельных запросов задают строку, варианты подбора ключей свёрнуты внутрь.
Замеров
4
Моделей проверено
2
Лучшая пропускная
419 ток/сек
Максимальный контекст
40960 токенов
Что важно
Замер | Движок | Последовательная без SO | |
|---|---|---|---|
Qwen3-4B-Instruct-2507 ctx 16k | vLLM 0.14.0 опорный | 100.9 | Прогон |
Qwen3-4B-Instruct-2507-GGUF:F16 ctx 40k · 10 парал. | Llama.cpp 7717 подбор | 90.6 | Прогон |
Qwen3-4B-Instruct-2507-GGUF:F16 ctx 40k · 20 парал. | Llama.cpp 7717 подбор | 84.6 | Прогон |
Qwen3-4B-Instruct-2507 ctx 16k | vLLM 0.14.0 опорный | 83.9 | Прогон |
Собираете контур на этой карте?
На курсе разбираем, как поднять локальную LLM и подключить её к рабочей системе через собственный сервис — от выбора движка до интеграции с 1С.
Курс «ИИ и 1С»