Qwen3-4B-Instruct-2507 на RTX 5070 Ti 16Gb ×1

vLLM 0.15.1 · ctx 16k · 14.02.2026

подбор ключей
Модель
Qwen/Qwen3-4B-Instruct-2507
Связка карт
RTX 5070 Ti 16Gb ×1
Движок
vLLM 0.15.1
Контекст
16384 токенов
Параллельных
10
Карт занято
1
Слои на CPU
нет, всё в VRAM
Квантование
Сборка движка
Дата замера
14.02.2026
Пропускная без SO
480.7 ток/сек
Пропускная с SO
587.2 ток/сек
Последовательная без SO
90.4 ток/сек
Последовательная с SO
87.8 ток/сек
Параллельная без SO
81.9 ток/сек
Параллельная с SO
81.3 ток/сек
Команда запуска
vllm serve Qwen/Qwen3-4B-Instruct-2507 --tensor-parallel-size 1 --gpu-memory-utilization 0.9 --max-model-len 16384 --attention-backend TRITON_ATTN
Ключи подбора
--gpu-memory-utilization 0.9 --attention-backend TRITON_ATTN
Слой нагрузки — контекст, число параллельных запросов, занятые карты и выгрузка на процессор — задаёт сам замер, поэтому такие прогоны стоят в таблице отдельными строками. Слой подбора настраивает то же задание и сворачивается в варианты одной строки. Как это устроено.