RTX 5070 Ti 16Gb: скорость на локальных LLM
Замеры токенов в секунду на RTX 5070 Ti 16Gb: 6 моделей, движки SGLang, vLLM, Llama.cpp
Сколько токенов в секунду выдаёт RTX 5070 Ti 16Gb на локальных нейросетях: 10 прогонов на движках SGLang, vLLM, Llama.cpp. Ниже — по строке на замер: модель, длина контекста и число параллельных запросов задают строку, варианты подбора ключей свёрнуты внутрь.
Замеров
10
Моделей проверено
6
Лучшая пропускная
876 ток/сек
Максимальный контекст
32768 токенов
Что важно
Замер | Движок | Последовательная без SO | TTFT, деловой промпт (~450 ток.) | Декодирование после TTFT | |
|---|---|---|---|---|---|
Qwen3.6-35B-A3B-NVFP4 ctx 32k · modelopt_fp4 | SGLang 0.5.16 подбор | 309.1 | 0.17 | 2527.5 | Прогон |
Qwen3.6-35B-A3B-NVFP4 ctx 32k · 8 парал. | vLLM 0.26.0 подбор | 273.5 | 0.2 | 1787.3 | Прогон |
gpt-oss-20b ctx 16k | vLLM 0.15.1 подбор | 222.4 | — | — | Прогон |
Qwen3.6-27B-NVFP4 ctx 32k · 8 парал. | vLLM 0.26.0 подбор | 135.7 | 0.48 | 237.8 | Прогон |
Qwen3.6-27B-NVFP4 ctx 16k · modelopt_mixed | SGLang 0.5.16 подбор | 135.4 | 0.31 | 218 | Прогон |
Qwen3-4B-Instruct-2507 ctx 16k | vLLM 0.15.1 подбор | 131.7 | — | — | Прогон |
Qwen3-4B-Instruct-2507 ctx 16k | vLLM 0.15.1 подбор | 90.4 | — | — | Прогон |
Qwen3-4B-Instruct-2507-GGUF:F16 ctx 32k · 12 парал. | Llama.cpp 7973 подбор | 89.7 | — | — | Прогон |
Qwen3-4B-Instruct-2507-GGUF:F16 ctx 8k · 6 парал. | Llama.cpp 7973 подбор | 89.5 | — | — | Прогон |
gpt-oss-120b-GGUF ctx 16k · часть слоёв на CPU | Llama.cpp 7717 подбор | 26.6 | — | — | Прогон |
Собираете контур на этой карте?
На курсе разбираем, как поднять локальную LLM и подключить её к рабочей системе через собственный сервис — от выбора движка до интеграции с 1С.
Курс «ИИ и 1С»