Tesla v100 32gb sxm2: скорость на локальных LLM

Замеры токенов в секунду на Tesla v100 32gb sxm2: 2 моделей, движки vLLM, Llama.cpp

Сколько токенов в секунду выдаёт Tesla v100 32gb sxm2 на локальных нейросетях: 4 прогона на движках vLLM, Llama.cpp. Ниже — по строке на замер: модель, длина контекста и число параллельных запросов задают строку, варианты подбора ключей свёрнуты внутрь.

Замеров
4
Моделей проверено
2
Лучшая пропускная
381 ток/сек
Максимальный контекст
40960 токенов
Что важно
Замер
Движок
Последовательная без SO
Qwen3-4B-Instruct-2507
ctx 16k
vLLM 0.14.0
опорный
100.9Прогон
Qwen3-4B-Instruct-2507-GGUF:F16
ctx 40k · 20 парал.
Llama.cpp 7717
подбор
84.6Прогон
Qwen3-4B-Instruct-2507-GGUF:F16
ctx 40k · 10 парал.
Llama.cpp 7717
подбор
81.8Прогон
Qwen3-4B-Instruct-2507
ctx 16k
vLLM 0.14.0
опорный
67.4Прогон
Собираете контур на этой карте?

На курсе разбираем, как поднять локальную LLM и подключить её к рабочей системе через собственный сервис — от выбора движка до интеграции с 1С.

Курс «ИИ и 1С»

Другие карты в замерах