Qwen3-4B-Instruct-2507 на RTX 5060 Ti 16Gb ×1

vLLM 0.15.1 · ctx 16k · 09.02.2026

подбор ключей
Модель
Qwen/Qwen3-4B-Instruct-2507
Связка карт
RTX 5060 Ti 16Gb ×1
Движок
vLLM 0.15.1
Контекст
16384 токенов
Параллельных
10
Карт занято
1
Слои на CPU
нет, всё в VRAM
Квантование
Сборка движка
Дата замера
09.02.2026
Пропускная без SO
263 ток/сек
Пропускная с SO
259.1 ток/сек
Последовательная без SO
47.7 ток/сек
Последовательная с SO
47 ток/сек
Параллельная без SO
43.4 ток/сек
Параллельная с SO
43 ток/сек
Команда запуска
vllm serve Qwen/Qwen3-4B-Instruct-2507 --tensor-parallel-size 1 --gpu-memory-utilization 0.9 --max-model-len 16384 --attention-backend TRITON_ATTN
Ключи подбора
--gpu-memory-utilization 0.9 --attention-backend TRITON_ATTN
Слой нагрузки — контекст, число параллельных запросов, занятые карты и выгрузка на процессор — задаёт сам замер, поэтому такие прогоны стоят в таблице отдельными строками. Слой подбора настраивает то же задание и сворачивается в варианты одной строки. Как это устроено.