Бенчмарк видеокарт для нейросетей
Сколько токенов в секунду выдают видеокарты на локальных LLM — замеры на реальном железе
Здесь собраны замеры скорости локальных нейросетей: какая видеокарта для LLM сколько токенов в секунду выдаёт на связке vLLM и llama.cpp. Каждый прогон — это конкретная связка карт, версия движка инференса и модель, прогнанные одним и тем же скриптом: последовательный запрос, параллельная нагрузка, структурированный вывод. Цифры сырые, без округления в свою пользу — по ним видно, где два GPU дают прирост, а где упираются в память и шину.
Модель / GPU | Инференс | Seq без SO | Par без SO | Пропускная | TTFT, сек | Декод | Кэш | |
|---|---|---|---|---|---|---|---|---|
nvidia/Qwen3.6-35B-A3B-NVFP4 ASUS GeForce RTX 5070 Ti PRIME OC Edition 16Gb ×2 | SGLang 0.5.16 | 309.06 | 86.07 | 314.34 | 0.17 | 2527.5 | ✓ ×2.5 | |
nvidia/Qwen3.6-27B-NVFP4 ASUS GeForce RTX 5070 Ti PRIME OC Edition 16Gb ×2 | SGLang 0.5.16 | 135.41 | 32.92 | 133.02 | 0.31 | 218 | ✓ ×8.6 | |
nvidia/Qwen3.6-35B-A3B-NVFP4 ASUS GeForce RTX 5070 Ti PRIME OC Edition 16Gb ×2 | vLLM 0.26.0 | 273.51 | 120.53 | 875.82 | 0.2 | 1787.3 | ✓ ×4.1 | |
nvidia/Qwen3.6-27B-NVFP4 ASUS GeForce RTX 5070 Ti PRIME OC Edition 16Gb ×2 | vLLM 0.26.0 | 135.73 | 60.39 | 399.33 | 0.48 | 237.8 | ✓ ×2.0 |
Как проводятся замеры
Все прогоны выполнены на одном стенде и одним скриптом, поэтому цифры между собой сравнимы. Модель поднимается на выбранном движке (vLLM или llama.cpp нужной версии), затем прогоняются три сценария: одиночный запрос, пачка параллельных запросов и то же самое со структурированным выводом (SO — ответ по JSON-схеме). Результат — токены в секунду, а не «ощущается быстрее».
Видеокарты берутся потребительские и серверные: RTX-поколения и Tesla. Связка из двух карт указана в конфигурации отдельно — прирост от второй карты почти никогда не двукратный, и в таблице это видно по конкретным числам.
Что означают метрики
- Последовательная скорость
- Токены в секунду для одного запроса без соседей. Это то, что чувствует один человек в чате.
- Параллельная и пропускная
- Суммарная скорость под нагрузкой из нескольких одновременных запросов. Главная цифра, когда модель обслуживает сервис, а не одного пользователя.
- Без SO / с SO
- Структурированный вывод: ответ, загнанный в JSON-схему. Он всегда стоит скорости — разница между парой колонок и есть цена строгого формата.
- TTFT
- Время до первого токена. Для интерфейса важнее пропускной способности: пользователь видит задержку до начала ответа, а не общий счётчик токенов.
- Prefill и декодирование
- Prefill — обработка входного промпта, декодирование — генерация после первого токена. Длинный системный промпт бьёт по prefill, длинный ответ — по декодированию.
- Кэш префикса
- Движок переиспользует уже посчитанное начало промпта. Если он работает, повторные запросы с одинаковым системным промптом стартуют в разы быстрее.
Разборы замеров
Таблица отвечает на вопрос «сколько», статьи — на вопрос «почему столько»:
- RTX 5070 Ti против RTX 3090 на LLM
- RTX 3090 против RTX 5060 Ti: что брать под инференс
- vLLM или llama.cpp — чем отличаются движки инференса
- Бенчмарк локального инференса: методика и результаты
- Сборка GPU-сервера под локальные нейросети
- Установка vLLM на RTX 3090 и Tesla V100
Частые вопросы
Железо — половина дела: дальше модель нужно связать с рабочей системой. На курсе разбираем, как поднять локальную LLM и подключить её к 1С через собственный сервис.
Курс «ИИ и 1С»