Qwen3.6-35B-A3B-NVFP4 на RTX 5070 Ti ×2

SGLang 0.5.17 · ctx 256k · modelopt_fp4 · 30.08.2026

подбор ключей
замер: local
методика v4
Модель
nvidia/Qwen3.6-35B-A3B-NVFP4
Связка карт
RTX 5070 Ti ×2
Движок
SGLang 0.5.17
Контекст
262144 токенов
Параллельных
1
Карт занято
2
Слои на CPU
нет, всё в VRAM
Квантование
modelopt_fp4
Сборка движка
Дата замера
30.08.2026
Пропускная без SO
0 ток/сек
Пропускная с SO
0 ток/сек
Последовательная без SO
268.9 ток/сек
Последовательная с SO
269.4 ток/сек
Параллельная без SO
0 ток/сек
Параллельная с SO
0 ток/сек
TTFT, короткий промпт (6-15 ток.)
0.14 сек
TTFT, деловой промпт (~450 ток.)
0.11 сек
Prefill — обработка входа
11000.8 ток/сек
Генерация от начала запроса
284 ток/сек
Декодирование после TTFT
314 ток/сек
Лестница префилла
Сверху — время до первого токена на растущем промпте, снизу — префилл, то есть скорость чтения этого промпта. Считается на участке от предыдущей ступени к этой, (N₂ − N₁) / (t₂ − t₁): постоянные накладные расходы сидят в обоих временах одинаково и вычитаются сами, а поточечное «токены ÷ время» давало бы горб на коротком промпте. Ровный нижний ряд означает, что сводное число честное; убывающие вправо столбики — что на длинном промпте движок читает вход медленнее. Подписи оси — фактическая длина промпта: её считает токенизатор движка, и она всегда чуть меньше заказанной.
Время до первого токена
Скорость префилла на отрезкеНаклон по всей лестнице — 11001 ток/сек, постоянные издержки 0.03 сек, R² 0.997
У первой ступени столбика нет: скорость меряется на участке от предыдущей ступени, а до первой участка нет.
Итоговый балл
72.5 балл
Структурированный вывод
70 балл
Задачи
100 балл
Язык ответа
100 балл
Повторяемость
20 балл
проверено до 15k — это верхняя ступень лестницы, выше не мерили
Скорость на ступенях длины: сверху — префилл (чтение входа), снизу — выдача токенов. Столбик ниже соседнего слева показывает, на какой длине сборка начинает сдавать. Подписи оси — фактическая длина промпта, её считает токенизатор движка. Префилл здесь — та же величина и та же формула, что на лестнице префилла, но снят он на запросах этого теста: стог с иголкой, два сообщения и длинный ответ вместо короткого. Поэтому числа двух лестниц не обязаны совпадать.
Скорость префилла на отрезкеПросадка prefill: на 8 % медленнее с каждым удвоением длины
У первой ступени столбика нет: скорость меряется на участке от предыдущей ступени, а до первой участка нет.
Выдача токенов (декодирование)Просадка декодирования: на 7 % медленнее с каждым удвоением длины
Точность вызова инструментов
65.4 %
Переиспользование кэша
92.2 %
Рост TTFT по ходам
0.5 ×
Медиана хода (сек)
0.27 сек
Кэш префикса
Кэш работает, выигрыш по TTFT ×2.0, срабатывает от 656 токенов
Команда запуска
python3 -m sglang.launch_server --model-path nvidia/Qwen3.6-35B-A3B-NVFP4 --host 0.0.0.0 --port 8000 --tp-size 2 --context-length 262144 --language-only --quantization modelopt_fp4 --moe-runner-backend flashinfer_cutlass --fp4-gemm-backend marlin --attention-backend flashinfer --linear-attn-backend triton --speculative-algorithm NEXTN --speculative-draft-model-path nvidia/Qwen3.6-35B-A3B-NVFP4 --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 4 --mamba-ssm-dtype bfloat16 --chunked-prefill-size 2048 --max-running-requests 1 --cuda-graph-max-bs-decode 1 --mem-fraction-static 0.95 --reasoning-parser qwen3 --tool-call-parser qwen3_coder --enable-metrics --enable-cache-report --stream-interval 1
Ключи подбора
--language-only on --moe-backend flashinfer_cutlass --fp4-gemm-backend marlin --attention-backend flashinfer --linear-attn-backend triton --speculative-algorithm NEXTN --speculative-draft-model-path nvidia/Qwen3.6-35B-A3B-NVFP4 --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 4 --mamba-ssm-dtype bfloat16 --chunked-prefill-size 2048 --max-running-requests 1 --cuda-graph-max-bs-decode 1 --gpu-memory-utilization 0.95 --reasoning-parser qwen3 --tool-call-parser qwen3_coder --enable-metrics on --enable-cache-report on --stream-interval 1
Слой нагрузки — контекст, число параллельных запросов, занятые карты и выгрузка на процессор — задаёт сам замер, поэтому такие прогоны стоят в таблице отдельными строками. Слой подбора настраивает то же задание и сворачивается в варианты одной строки. Как это устроено.
Стенд
Со слов автораRyzen 5 3600, 64Gb G.Skill 3600, PCIe 4 CUDA 13.2 NVIDIA-SMI 595.71.05 Ubuntu 26.04
Видеокарты под нагрузкой
NVIDIA GeForce RTX 5070 Ti
0000:08:00.0
Видеопамять14.6 из 15.9 GB
Температура40 → 52 °C
Потребление4 → 46 W из 300
vBIOS98.03.58.40.B6
NVIDIA GeForce RTX 5070 Ti
0000:09:00.0
Видеопамять13.4 из 15.9 GB
Температура41 → 51 °C
Потребление12 → 59 W из 300
vBIOS98.03.58.00.78
Машина
Процессор
AMD Ryzen 5 3600 6-Core Processor, 6 ядер / 12 потоков
ОЗУ
60 GB DDR4, 3800 MT/s, 2 из 4 слотов
Пропускная память
копирование 44.6, чтение 46.9, запись 30.2 ГБ/с (2 пот.)
Материнская плата
ASUSTeK COMPUTER INC. ROG STRIX X570-F GAMING, BIOS 5044 от 01/04/2026
Операционная система
Ubuntu 26.04 LTS
Ядро
Linux 7.0.0-30-generic x86_64
Драйвер NVIDIA
595.71.05
CUDA
13.2
Движок как он поднялся
Движок
SGLang 0.5.17
Квантование
MODELOPT_FP4
Потолок контекста
262144 токенов /v1/models → data[].max_model_len
Режим замера
локально на стенде