gpt-oss-20b на RTX 5070 Ti 16Gb ×2

vLLM 0.15.1 · ctx 16k · 14.02.2026

подбор ключей
Модель
openai/gpt-oss-20b
Связка карт
RTX 5070 Ti 16Gb ×2
Движок
vLLM 0.15.1
Контекст
16384 токенов
Параллельных
10
Карт занято
2
Слои на CPU
нет, всё в VRAM
Квантование
Сборка движка
Дата замера
14.02.2026
Пропускная без SO
659.9 ток/сек
Пропускная с SO
462 ток/сек
Последовательная без SO
222.4 ток/сек
Последовательная с SO
213.3 ток/сек
Параллельная без SO
123.8 ток/сек
Параллельная с SO
125.2 ток/сек
Команда запуска
vllm serve openai/gpt-oss-20b --tensor-parallel-size 2 --gpu-memory-utilization 0.8 --enable-auto-tool-choice --tool-call-parser openai --max-model-len 16384 --async-scheduling
Ключи подбора
--gpu-memory-utilization 0.8 --enable-auto-tool-choice on --tool-call-parser openai --async-scheduling on
Слой нагрузки — контекст, число параллельных запросов, занятые карты и выгрузка на процессор — задаёт сам замер, поэтому такие прогоны стоят в таблице отдельными строками. Слой подбора настраивает то же задание и сворачивается в варианты одной строки. Как это устроено.