Qwen3.8-27B-NVFP4 на RTX 3090 ×1 + RTX 5070 Ti ×2
vLLM 0.27.1 · ctx 167k · 8 парал. · 29.08.2026
подбор ключей
замер: local
методика v4
Модель
unsloth/Qwen3.8-27B-NVFP4
Связка карт
RTX 3090 ×1 + RTX 5070 Ti ×2
Движок
vLLM 0.27.1
Контекст
170912 токенов
Параллельных
8
Карт занято
2
Слои на CPU
нет, всё в VRAM
Квантование
—
Сборка движка
—
Дата замера
29.08.2026
Пропускная без SO
0 ток/сек
Пропускная с SO
0 ток/сек
Последовательная без SO
55.2 ток/сек
Последовательная с SO
50.2 ток/сек
Параллельная без SO
0 ток/сек
Параллельная с SO
0 ток/сек
TTFT, короткий промпт (6-15 ток.)
0.13 сек
TTFT, деловой промпт (~450 ток.)
0.14 сек
Prefill — обработка входа
3343.2 ток/сек
Генерация от начала запроса
55.6 ток/сек
Декодирование после TTFT
56.5 ток/сек
Лестница префилла
Сверху — время до первого токена на растущем промпте, снизу — префилл, то есть скорость чтения этого промпта. Считается на участке от предыдущей ступени к этой, (N₂ − N₁) / (t₂ − t₁): постоянные накладные расходы сидят в обоих временах одинаково и вычитаются сами, а поточечное «токены ÷ время» давало бы горб на коротком промпте. Ровный нижний ряд означает, что сводное число честное; убывающие вправо столбики — что на длинном промпте движок читает вход медленнее. Подписи оси — фактическая длина промпта: её считает токенизатор движка, и она всегда чуть меньше заказанной.
Время до первого токена
Скорость префилла на отрезкеНаклон по всей лестнице — 3343 ток/сек, постоянные издержки -0.01 сек, R² 0.999
У первой ступени столбика нет: скорость меряется на участке от предыдущей ступени, а до первой участка нет.
Итоговый балл
100 балл
Структурированный вывод
100 балл
Задачи
100 балл
Язык ответа
100 балл
Повторяемость
100 балл
проверено до 121k — это верхняя ступень лестницы, выше не мерили
Скорость на ступенях длины: сверху — префилл (чтение входа), снизу — выдача токенов. Столбик ниже соседнего слева показывает, на какой длине сборка начинает сдавать. Подписи оси — фактическая длина промпта, её считает токенизатор движка. Префилл здесь — та же величина и та же формула, что на лестнице префилла, но снят он на запросах этого теста: стог с иголкой, два сообщения и длинный ответ вместо короткого. Поэтому числа двух лестниц не обязаны совпадать.
Скорость префилла на отрезкеПросадка prefill: на 14 % медленнее с каждым удвоением длины
У первой ступени столбика нет: скорость меряется на участке от предыдущей ступени, а до первой участка нет.
Выдача токенов (декодирование)Просадка декодирования: на 1 % медленнее с каждым удвоением длины
Точность вызова инструментов
84.6 %
Переиспользование кэша
88.1 %
Рост TTFT по ходам
0.8 ×
Медиана хода (сек)
1.94 сек
Кэш префикса
Кэш работает, выигрыш по TTFT ×3.2, срабатывает от 1656 токенов
Команда запуска
/home/ilya/ai/vllm/unsloth-nvfp4-env/bin/python3 /home/ilya/ai/vllm/unsloth-nvfp4-env/bin/vllm serve unsloth/Qwen3.8-27B-NVFP4 --host 0.0.0.0 --port 8000 --tensor-parallel-size 2 --gpu-memory-utilization 0.965 --language-model-only --max-num-seqs 8 --max-num-batched-tokens 1024 --kv-cache-dtype fp8_e4m3 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --enable-prefix-caching --enable-prompt-tokens-details --max-model-len 170912 --chat-template /home/ilya/ai/qwen38-nvfp4-fixed.jinja
Ключи подбора
--gpu-memory-utilization 0.965 --language-model-only on --batch-tokens 1024 --kv-cache-dtype fp8_e4m3 --reasoning-parser qwen3 --enable-auto-tool-choice on --tool-call-parser qwen3_coder --enable-prefix-caching on --enable-prompt-tokens-details on Слой нагрузки — контекст, число параллельных запросов, занятые карты и выгрузка на процессор — задаёт сам замер, поэтому такие прогоны стоят в таблице отдельными строками. Слой подбора настраивает то же задание и сворачивается в варианты одной строки. Как это устроено.
Стенд
Со слов автораRyzen 5 3600, 64Gb G.Skill 3600, PCIe 4 CUDA 13.2 NVIDIA-SMI 595.71.05 Ubuntu 26.04
DIMM_A1: тайминги ОЗУ неизвестны: память работает на 3266 MT/s, а в SPD таких профилей нет (JEDEC 2666, XMP 1 3600) — частоту и тайминги задали в BIOS вручную
DIMM_A2: тайминги ОЗУ неизвестны: память работает на 3266 MT/s, а в SPD таких профилей нет (JEDEC 2133, XMP 1 4000, XMP 2 3866) — частоту и тайминги задали в BIOS вручную
Видеокарты под нагрузкой
NVIDIA GeForce RTX 3090
0000:04:00.0
PCIe 1.0 ×4из PCIe 4.0 ×16
Карта работает на 4 линиях из 16: ограничивает слот материнской платы. На двух и более картах это упирает обмен между ними.
Видеопамять0.0 из 24.0 GB
Температура50 → 49 °C
Потребление30 → 30 W из 370
vBIOS94.02.42.00.F1
Простой — карта не была нагружена
NVIDIA GeForce RTX 5070 Ti
0000:09:00.0
PCIe 4.0 ×8из PCIe 4.0 ×16
Карта работает на 8 линиях из 16: ограничивает слот материнской платы. На двух и более картах это упирает обмен между ними.
Видеопамять15.4 из 15.9 GB
Температура44 → 59 °C
Потребление9 → 158 W из 300
vBIOS98.03.58.40.B6
NVIDIA GeForce RTX 5070 Ti
0000:0a:00.0
PCIe 4.0 ×8из PCIe 4.0 ×16
Карта работает на 8 линиях из 16: ограничивает слот материнской платы. На двух и более картах это упирает обмен между ними.
Видеопамять15.4 из 15.9 GB
Температура43 → 55 °C
Потребление12 → 168 W из 300
vBIOS98.03.58.00.78
Машина
- Процессор
- AMD Ryzen 5 3600 6-Core Processor, 6 ядер / 12 потоков
- ОЗУ
- 76 GB DDR4, 3266 MT/s, 4 из 4 слотов
- Пропускная память
- копирование 40.0, чтение 42.5, запись 26.0 ГБ/с (2 пот.)
- Материнская плата
- ASUSTeK COMPUTER INC. ROG STRIX X570-F GAMING, BIOS 5044 от 01/04/2026
- Операционная система
- Ubuntu 26.04 LTS
- Ядро
- Linux 7.0.0-30-generic x86_64
- Драйвер NVIDIA
- 595.71.05
- CUDA
- 13.2
Движок как он поднялся
- Движок
- vLLM 0.27.1
- Потолок контекста
- 170912 токенов /v1/models → data[].max_model_len
- Режим замера
- локально на стенде