Бенчмарк видеокарт для нейросетей

Сколько токенов в секунду выдают видеокарты на локальных LLM — замеры на реальном железе

Здесь собраны замеры скорости локальных нейросетей: какая видеокарта для LLM сколько токенов в секунду выдаёт на связке vLLM и llama.cpp. Каждый прогон — это конкретная связка карт, версия движка инференса и модель, прогнанные одним и тем же скриптом: последовательный запрос, параллельная нагрузка, структурированный вывод. Цифры сырые, без округления в свою пользу — по ним видно, где два GPU дают прирост, а где упираются в память и шину.

Фильтры
GPU
Модель
Инференс
Docker
Метрика сравнения
Пропускная без SO
Пропускная с SO
Последовательная без SO
Последовательная с SO
Параллельная без SO
Параллельная с SO
TTFT, короткий промпт
TTFT, деловой промпт
Prefill — обработка входа
Генерация от начала запроса
Декодирование после TTFT
Пропускная без SO
больше — лучше, ток/сек
лидер быстрее худшего в ×6.6
Пропускная способность
4 прогонов, порядок общий для всех панелей
Пропускная без SO
ток/сек · больше — лучше
Пропускная с SO
ток/сек · больше — лучше
Последовательная без SO
ток/сек · больше — лучше
Последовательная с SO
ток/сек · больше — лучше
Параллельная без SO
ток/сек · больше — лучше
Параллельная с SO
ток/сек · больше — лучше
Латентность
4 прогонов, порядок общий для всех панелей
TTFT, короткий промпт
сек · меньше — лучше
TTFT, деловой промпт
сек · меньше — лучше
Prefill — обработка входа
ток/сек · больше — лучше
Генерация от начала запроса
ток/сек · больше — лучше
Декодирование после TTFT
ток/сек · больше — лучше
Цена структурированного вывода
насколько меняется скорость при включённом SO, % к прогону без SO
Последовательная
влево — SO замедляет вправо — ускоряет
Параллельная
влево — SO замедляет вправо — ускоряет
Пропускная
влево — SO замедляет вправо — ускоряет
Отзывчивость против скорости
левее и выше — лучше: меньше ждать первого токена и быстрее декодирование. Подписаны прогоны, которых никто не обходит сразу по обеим осям
Кэш префикса
повторный запрос с тем же началом промпта: подтвердил ли движок попадание
Модель / GPU
Инференс
Seq без SO
Par без SO
Пропускная
TTFT, сек
Декод
Кэш
nvidia/Qwen3.6-35B-A3B-NVFP4
ASUS GeForce RTX 5070 Ti PRIME OC Edition 16Gb ×2
SGLang 0.5.16309.0686.07314.340.172527.5 ✓ ×2.5
nvidia/Qwen3.6-27B-NVFP4
ASUS GeForce RTX 5070 Ti PRIME OC Edition 16Gb ×2
SGLang 0.5.16135.4132.92133.020.31218 ✓ ×8.6
nvidia/Qwen3.6-35B-A3B-NVFP4
ASUS GeForce RTX 5070 Ti PRIME OC Edition 16Gb ×2
vLLM 0.26.0273.51120.53875.820.21787.3 ✓ ×4.1
nvidia/Qwen3.6-27B-NVFP4
ASUS GeForce RTX 5070 Ti PRIME OC Edition 16Gb ×2
vLLM 0.26.0135.7360.39399.330.48237.8 ✓ ×2.0

Как проводятся замеры

Все прогоны выполнены на одном стенде и одним скриптом, поэтому цифры между собой сравнимы. Модель поднимается на выбранном движке (vLLM или llama.cpp нужной версии), затем прогоняются три сценария: одиночный запрос, пачка параллельных запросов и то же самое со структурированным выводом (SO — ответ по JSON-схеме). Результат — токены в секунду, а не «ощущается быстрее».

Видеокарты берутся потребительские и серверные: RTX-поколения и Tesla. Связка из двух карт указана в конфигурации отдельно — прирост от второй карты почти никогда не двукратный, и в таблице это видно по конкретным числам.

Что означают метрики

Последовательная скорость
Токены в секунду для одного запроса без соседей. Это то, что чувствует один человек в чате.
Параллельная и пропускная
Суммарная скорость под нагрузкой из нескольких одновременных запросов. Главная цифра, когда модель обслуживает сервис, а не одного пользователя.
Без SO / с SO
Структурированный вывод: ответ, загнанный в JSON-схему. Он всегда стоит скорости — разница между парой колонок и есть цена строгого формата.
TTFT
Время до первого токена. Для интерфейса важнее пропускной способности: пользователь видит задержку до начала ответа, а не общий счётчик токенов.
Prefill и декодирование
Prefill — обработка входного промпта, декодирование — генерация после первого токена. Длинный системный промпт бьёт по prefill, длинный ответ — по декодированию.
Кэш префикса
Движок переиспользует уже посчитанное начало промпта. Если он работает, повторные запросы с одинаковым системным промптом стартуют в разы быстрее.

Разборы замеров

Таблица отвечает на вопрос «сколько», статьи — на вопрос «почему столько»:

Частые вопросы

Собираете свой ИИ-контур?

Железо — половина дела: дальше модель нужно связать с рабочей системой. На курсе разбираем, как поднять локальную LLM и подключить её к 1С через собственный сервис.

Курс «ИИ и 1С»