RTX 5070 Ti: скорость на локальных LLM

Замеры токенов в секунду на RTX 5070 Ti: 3 моделей, движки SGLang, vLLM, llama.cpp

Сколько токенов в секунду выдаёт RTX 5070 Ti на локальных нейросетях: 7 прогонов на движках SGLang, vLLM, llama.cpp. Ниже — по строке на замер: модель, длина контекста и число параллельных запросов задают строку, варианты подбора ключей свёрнуты внутрь.

Замеров
7
Моделей проверено
3
Лучшая пропускная
Максимальный контекст
262144 токенов
Что важно
Замер
Движок
Последовательная без SO
TTFT, деловой промпт (~450 ток.)
Декодирование после TTFT
Qwen3.6-35B-A3B-NVFP4
ctx 256k · modelopt_fp4
SGLang 0.5.17
подбор
268.90.11314 Прогон
Qwen3.6-35B-A3B-NVFP4
ctx 197k · 4 парал.
vLLM 0.27.1
подбор
259.50.19278.2 Прогон
Qwen3.8-27B-NVFP4
ctx 128k · 4 парал.
vLLM 0.27.1
подбор
125.50.17107.8 Прогон
Qwen3.8-27B-NVFP4
ctx 64k · 8 парал.
vLLM 0.27.1
подбор
111.60.17101 Прогон
Qwen3.8-27B-NVFP4
ctx 167k · 8 парал.
vLLM 0.27.1
подбор
55.20.1456.5 Прогон
Qwen3.8-27B-NVFP4
ctx 256k · 4 парал.
vLLM 0.27.1
подбор
53.50.1455 Прогон
Qwen3.8-Flash-Next:UD-Q3_K_XL
ctx 256k · 1 парал.
llama.cpp b10669-6c5afc86a
подбор
22.32.1329.6 Прогон
Собираете контур на этой карте?

На курсе разбираем, как поднять локальную LLM и подключить её к рабочей системе через собственный сервис — от выбора движка до интеграции с 1С.

Курс «ИИ и 1С»

Другие карты в замерах