RTX 5070 Ti 16Gb: скорость на локальных LLM

Замеры токенов в секунду на RTX 5070 Ti 16Gb: 6 моделей, движки SGLang, vLLM, Llama.cpp

Сколько токенов в секунду выдаёт RTX 5070 Ti 16Gb на локальных нейросетях: 10 прогонов на движках SGLang, vLLM, Llama.cpp. Ниже — по строке на замер: модель, длина контекста и число параллельных запросов задают строку, варианты подбора ключей свёрнуты внутрь.

Замеров
10
Моделей проверено
6
Лучшая пропускная
876 ток/сек
Максимальный контекст
32768 токенов
Что важно
Замер
Движок
Последовательная без SO
TTFT, деловой промпт (~450 ток.)
Декодирование после TTFT
Qwen3.6-35B-A3B-NVFP4
ctx 32k · modelopt_fp4
SGLang 0.5.16
подбор
309.10.172527.5Прогон
Qwen3.6-35B-A3B-NVFP4
ctx 32k · 8 парал.
vLLM 0.26.0
подбор
273.50.21787.3Прогон
gpt-oss-20b
ctx 16k
vLLM 0.15.1
подбор
222.4Прогон
Qwen3.6-27B-NVFP4
ctx 32k · 8 парал.
vLLM 0.26.0
подбор
135.70.48237.8Прогон
Qwen3.6-27B-NVFP4
ctx 16k · modelopt_mixed
SGLang 0.5.16
подбор
135.40.31218Прогон
Qwen3-4B-Instruct-2507
ctx 16k
vLLM 0.15.1
подбор
131.7Прогон
Qwen3-4B-Instruct-2507
ctx 16k
vLLM 0.15.1
подбор
90.4Прогон
Qwen3-4B-Instruct-2507-GGUF:F16
ctx 32k · 12 парал.
Llama.cpp 7973
подбор
89.7Прогон
Qwen3-4B-Instruct-2507-GGUF:F16
ctx 8k · 6 парал.
Llama.cpp 7973
подбор
89.5Прогон
gpt-oss-120b-GGUF
ctx 16k · часть слоёв на CPU
Llama.cpp 7717
подбор
26.6Прогон
Собираете контур на этой карте?

На курсе разбираем, как поднять локальную LLM и подключить её к рабочей системе через собственный сервис — от выбора движка до интеграции с 1С.

Курс «ИИ и 1С»

Другие карты в замерах