Qwen3-4B-Instruct-2507 на Tesla v100 32gb sxm2 ×1 + RTX 3090 24Gb ×1

vLLM 0.14.0 · ctx 16k · 05.02.2026

опорный профиль
Модель
Qwen/Qwen3-4B-Instruct-2507
Связка карт
Tesla v100 32gb sxm2 ×1 + RTX 3090 24Gb ×1
Движок
vLLM 0.14.0
Контекст
16384 токенов
Параллельных
10
Карт занято
2
Слои на CPU
нет, всё в VRAM
Квантование
Сборка движка
Дата замера
05.02.2026
Пропускная без SO
380.6 ток/сек
Пропускная с SO
402 ток/сек
Последовательная без SO
100.9 ток/сек
Последовательная с SO
98.1 ток/сек
Параллельная без SO
60.5 ток/сек
Параллельная с SO
58.8 ток/сек
Команда запуска
CUDA_DEVICE_ORDER=PCI_BUS_ID CUDA_VISIBLE_DEVICES=1,0 vllm serve Qwen/Qwen3-4B-Instruct-2507 --tensor-parallel-size 2 --gpu-memory-utilization 0.9 --max-model-len 16384
Ключи подбора
--gpu-memory-utilization 0.9
Слой нагрузки — контекст, число параллельных запросов, занятые карты и выгрузка на процессор — задаёт сам замер, поэтому такие прогоны стоят в таблице отдельными строками. Слой подбора настраивает то же задание и сворачивается в варианты одной строки. Как это устроено.