Qwen3-4B-Instruct-2507 на Tesla v100 32gb sxm2 ×1
vLLM 0.14.0 · ctx 16k · 05.02.2026
опорный профиль
Модель
Qwen/Qwen3-4B-Instruct-2507
Связка карт
Tesla v100 32gb sxm2 ×1
Движок
vLLM 0.14.0
Контекст
16384 токенов
Параллельных
10
Карт занято
1
Слои на CPU
нет, всё в VRAM
Квантование
—
Сборка движка
—
Дата замера
05.02.2026
Пропускная без SO
284.2 ток/сек
Пропускная с SO
283.7 ток/сек
Последовательная без SO
67.4 ток/сек
Последовательная с SO
65.8 ток/сек
Параллельная без SO
45.1 ток/сек
Параллельная с SO
44.1 ток/сек
Команда запуска
CUDA_DEVICE_ORDER=PCI_BUS_ID CUDA_VISIBLE_DEVICES=1 vllm serve Qwen/Qwen3-4B-Instruct-2507 --gpu-memory-utilization 0.9 --max-model-len 16384
Ключи подбора
--gpu-memory-utilization 0.9 Слой нагрузки — контекст, число параллельных запросов, занятые карты и выгрузка на процессор — задаёт сам замер, поэтому такие прогоны стоят в таблице отдельными строками. Слой подбора настраивает то же задание и сворачивается в варианты одной строки. Как это устроено.