Qwen3.8-27B-NVFP4 на RTX 3090 ×1 + RTX 5070 Ti ×2

vLLM 0.27.1 · ctx 128k · 4 парал. · 29.08.2026

подбор ключей
замер: local
методика v4
Модель
unsloth/Qwen3.8-27B-NVFP4
Связка карт
RTX 3090 ×1 + RTX 5070 Ti ×2
Движок
vLLM 0.27.1
Контекст
131072 токенов
Параллельных
4
Карт занято
2
Слои на CPU
нет, всё в VRAM
Квантование
Сборка движка
Дата замера
29.08.2026
Пропускная без SO
0 ток/сек
Пропускная с SO
0 ток/сек
Последовательная без SO
125.5 ток/сек
Последовательная с SO
100.8 ток/сек
Параллельная без SO
0 ток/сек
Параллельная с SO
0 ток/сек
TTFT, короткий промпт (6-15 ток.)
0.09 сек
TTFT, деловой промпт (~450 ток.)
0.17 сек
Prefill — обработка входа
3131.4 ток/сек
Генерация от начала запроса
103.8 ток/сек
Декодирование после TTFT
107.8 ток/сек
Лестница префилла
Сверху — время до первого токена на растущем промпте, снизу — префилл, то есть скорость чтения этого промпта. Считается на участке от предыдущей ступени к этой, (N₂ − N₁) / (t₂ − t₁): постоянные накладные расходы сидят в обоих временах одинаково и вычитаются сами, а поточечное «токены ÷ время» давало бы горб на коротком промпте. Ровный нижний ряд означает, что сводное число честное; убывающие вправо столбики — что на длинном промпте движок читает вход медленнее. Подписи оси — фактическая длина промпта: её считает токенизатор движка, и она всегда чуть меньше заказанной.
Время до первого токена
Скорость префилла на отрезкеНаклон по всей лестнице — 3131 ток/сек, постоянные издержки -0.01 сек, R² 1.000
У первой ступени столбика нет: скорость меряется на участке от предыдущей ступени, а до первой участка нет.
Итоговый балл
100 балл
Структурированный вывод
100 балл
Задачи
100 балл
Язык ответа
100 балл
Повторяемость
100 балл
проверено до 121k — это верхняя ступень лестницы, выше не мерили
Скорость на ступенях длины: сверху — префилл (чтение входа), снизу — выдача токенов. Столбик ниже соседнего слева показывает, на какой длине сборка начинает сдавать. Подписи оси — фактическая длина промпта, её считает токенизатор движка. Префилл здесь — та же величина и та же формула, что на лестнице префилла, но снят он на запросах этого теста: стог с иголкой, два сообщения и длинный ответ вместо короткого. Поэтому числа двух лестниц не обязаны совпадать.
Скорость префилла на отрезкеПросадка prefill: на 15 % медленнее с каждым удвоением длины
У первой ступени столбика нет: скорость меряется на участке от предыдущей ступени, а до первой участка нет.
Выдача токенов (декодирование)Просадка декодирования: скорость почти не зависит от длины
Точность вызова инструментов
92.3 %
Переиспользование кэша
82.4 %
Рост TTFT по ходам
0.9 ×
Медиана хода (сек)
1.5 сек
Кэш префикса
Кэш работает, выигрыш по TTFT ×1.6, срабатывает от 2856 токенов
Команда запуска
/home/ilya/ai/vllm/unsloth-nvfp4-env/bin/python3 /home/ilya/ai/vllm/unsloth-nvfp4-env/bin/vllm serve unsloth/Qwen3.8-27B-NVFP4 --host 0.0.0.0 --port 8000 --tensor-parallel-size 2 --gpu-memory-utilization 0.965 --language-model-only --max-num-seqs 4 --max-num-batched-tokens 1024 --kv-cache-dtype fp8_e4m3 --mamba-ssm-cache-dtype bfloat16 --speculative-config {"method": "mtp", "num_speculative_tokens": 4} --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --enable-prefix-caching --enable-prompt-tokens-details --max-model-len 131072 --chat-template /home/ilya/ai/qwen38-nvfp4-fixed.jinja
Ключи подбора
--gpu-memory-utilization 0.965 --language-model-only on --batch-tokens 1024 --kv-cache-dtype fp8_e4m3 --mamba-ssm-cache-dtype bfloat16 --speculative {"method": --reasoning-parser qwen3 --enable-auto-tool-choice on --tool-call-parser qwen3_coder --enable-prefix-caching on --enable-prompt-tokens-details on
Слой нагрузки — контекст, число параллельных запросов, занятые карты и выгрузка на процессор — задаёт сам замер, поэтому такие прогоны стоят в таблице отдельными строками. Слой подбора настраивает то же задание и сворачивается в варианты одной строки. Как это устроено.
Стенд
Со слов автораRyzen 5 3600, 64Gb G.Skill 3600, PCIe 4 CUDA 13.2 NVIDIA-SMI 595.71.05 Ubuntu 26.04
Видеокарты под нагрузкой
NVIDIA GeForce RTX 3090
0000:04:00.0
Видеопамять0.0 из 24.0 GB
Температура41 → 40 °C
Потребление18 → 18 W из 370
vBIOS94.02.42.00.F1
Простой — карта не была нагружена
NVIDIA GeForce RTX 5070 Ti
0000:09:00.0
Видеопамять15.0 из 15.9 GB
Температура47 → 56 °C
Потребление10 → 144 W из 300
vBIOS98.03.58.40.B6
NVIDIA GeForce RTX 5070 Ti
0000:0a:00.0
Видеопамять15.0 из 15.9 GB
Температура44 → 53 °C
Потребление12 → 152 W из 300
vBIOS98.03.58.00.78
Машина
Процессор
AMD Ryzen 5 3600 6-Core Processor, 6 ядер / 12 потоков
ОЗУ
76 GB DDR4, 3266 MT/s, 4 из 4 слотов
Пропускная память
копирование 37.1, чтение 43.2, запись 26.0 ГБ/с (4 пот.)
Материнская плата
ASUSTeK COMPUTER INC. ROG STRIX X570-F GAMING, BIOS 5044 от 01/04/2026
Операционная система
Ubuntu 26.04 LTS
Ядро
Linux 7.0.0-30-generic x86_64
Драйвер NVIDIA
595.71.05
CUDA
13.2
Движок как он поднялся
Движок
vLLM 0.27.1
Потолок контекста
131072 токенов /v1/models → data[].max_model_len
Режим замера
локально на стенде