Qwen3-4B-Instruct-2507 на RTX 5060 Ti 16Gb ×2
vLLM 0.15.1 · ctx 16k · 09.02.2026
подбор ключей
Модель
Qwen/Qwen3-4B-Instruct-2507
Связка карт
RTX 5060 Ti 16Gb ×2
Движок
vLLM 0.15.1
Контекст
16384 токенов
Параллельных
10
Карт занято
2
Слои на CPU
нет, всё в VRAM
Квантование
—
Сборка движка
—
Дата замера
09.02.2026
Пропускная без SO
414.1 ток/сек
Пропускная с SO
401.4 ток/сек
Последовательная без SO
78.1 ток/сек
Последовательная с SO
76.2 ток/сек
Параллельная без SO
67.1 ток/сек
Параллельная с SO
66.3 ток/сек
Команда запуска
vllm serve Qwen/Qwen3-4B-Instruct-2507 --tensor-parallel-size 2 --gpu-memory-utilization 0.85 --max-model-len 16384 --attention-backend TRITON_ATTN
Ключи подбора
--gpu-memory-utilization 0.85 --attention-backend TRITON_ATTN Слой нагрузки — контекст, число параллельных запросов, занятые карты и выгрузка на процессор — задаёт сам замер, поэтому такие прогоны стоят в таблице отдельными строками. Слой подбора настраивает то же задание и сворачивается в варианты одной строки. Как это устроено.