RTX 5070 Ti 16Gb: скорость на локальных LLM

Замеры токенов в секунду на RTX 5070 Ti 16Gb: 5 моделей, движки SGLang, vLLM, Llama.cpp

Сколько токенов в секунду выдаёт RTX 5070 Ti 16Gb на локальных нейросетях: 8 прогонов на движках SGLang, vLLM, Llama.cpp. Ниже — по строке на замер: модель, длина контекста и число параллельных запросов задают строку, варианты подбора ключей свёрнуты внутрь.

Замеров
8
Моделей проверено
5
Лучшая пропускная
672 ток/сек
Максимальный контекст
32768 токенов
Что важно
Замер
Движок
Последовательная без SO
TTFT, деловой промпт (~450 ток.)
Декодирование после TTFT
gpt-oss-20b
ctx 16k
vLLM 0.15.1
подбор
222.4 Прогон
Qwen3.6-27B-NVFP4
ctx 32k · 8 парал.
vLLM 0.26.0
подбор
135.70.48237.8 Прогон
Qwen3.6-27B-NVFP4
ctx 16k · modelopt_mixed
SGLang 0.5.16
подбор
135.40.31218 Прогон
Qwen3-4B-Instruct-2507
ctx 16k
vLLM 0.15.1
подбор
131.7 Прогон
Qwen3-4B-Instruct-2507
ctx 16k
vLLM 0.15.1
подбор
90.4 Прогон
Qwen3-4B-Instruct-2507-GGUF:F16
ctx 32k · 12 парал.
Llama.cpp 7973
подбор
89.7 Прогон
Qwen3-4B-Instruct-2507-GGUF:F16
ctx 8k · 6 парал.
Llama.cpp 7973
подбор
89.5 Прогон
gpt-oss-120b-GGUF
ctx 16k · часть слоёв на CPU
Llama.cpp 7717
подбор
26.6 Прогон
Собираете контур на этой карте?

На курсе разбираем, как поднять локальную LLM и подключить её к рабочей системе через собственный сервис — от выбора движка до интеграции с 1С.

Курс «ИИ и 1С»

Другие карты в замерах