RTX 5060 Ti 16Gb: скорость на локальных LLM
Замеры токенов в секунду на RTX 5060 Ti 16Gb: 4 моделей, движки Llama.cpp, vLLM
Сколько токенов в секунду выдаёт RTX 5060 Ti 16Gb на локальных нейросетях: 6 прогонов на движках Llama.cpp, vLLM. Ниже — по строке на замер: модель, длина контекста и число параллельных запросов задают строку, варианты подбора ключей свёрнуты внутрь.
Замеров
6
Моделей проверено
4
Лучшая пропускная
414 ток/сек
Максимальный контекст
40960 токенов
Что важно
Замер | Движок | Последовательная без SO | |
|---|---|---|---|
gpt-oss-20b ctx 16k | vLLM 0.15.1 подбор | 146.1 | Прогон |
Qwen3-4B-Instruct-2507 ctx 16k | vLLM 0.15.1 подбор | 78.1 | Прогон |
Qwen3-4B-Instruct-2507-GGUF:F16 ctx 40k · 20 парал. | Llama.cpp 7973 подбор | 48.3 | Прогон |
Qwen3-4B-Instruct-2507-GGUF:F16 ctx 40k · 10 парал. | Llama.cpp 7973 подбор | 48.2 | Прогон |
Qwen3-4B-Instruct-2507 ctx 16k | vLLM 0.15.1 подбор | 47.7 | Прогон |
gpt-oss-120b-GGUF ctx 16k · часть слоёв на CPU | Llama.cpp 7717 подбор | 24 | Прогон |
Собираете контур на этой карте?
На курсе разбираем, как поднять локальную LLM и подключить её к рабочей системе через собственный сервис — от выбора движка до интеграции с 1С.
Курс «ИИ и 1С»