RTX 5060 Ti 16Gb: скорость на локальных LLM

Замеры токенов в секунду на RTX 5060 Ti 16Gb: 4 моделей, движки Llama.cpp, vLLM

Сколько токенов в секунду выдаёт RTX 5060 Ti 16Gb на локальных нейросетях: 6 прогонов на движках Llama.cpp, vLLM. Ниже — по строке на замер: модель, длина контекста и число параллельных запросов задают строку, варианты подбора ключей свёрнуты внутрь.

Замеров
6
Моделей проверено
4
Лучшая пропускная
414 ток/сек
Максимальный контекст
40960 токенов
Что важно
Замер
Движок
Последовательная без SO
gpt-oss-20b
ctx 16k
vLLM 0.15.1
подбор
146.1Прогон
Qwen3-4B-Instruct-2507
ctx 16k
vLLM 0.15.1
подбор
78.1Прогон
Qwen3-4B-Instruct-2507-GGUF:F16
ctx 40k · 20 парал.
Llama.cpp 7973
подбор
48.3Прогон
Qwen3-4B-Instruct-2507-GGUF:F16
ctx 40k · 10 парал.
Llama.cpp 7973
подбор
48.2Прогон
Qwen3-4B-Instruct-2507
ctx 16k
vLLM 0.15.1
подбор
47.7Прогон
gpt-oss-120b-GGUF
ctx 16k · часть слоёв на CPU
Llama.cpp 7717
подбор
24Прогон
Собираете контур на этой карте?

На курсе разбираем, как поднять локальную LLM и подключить её к рабочей системе через собственный сервис — от выбора движка до интеграции с 1С.

Курс «ИИ и 1С»

Другие карты в замерах