Qwen3.6-35B-A3B-NVFP4 на RTX 5070 Ti 16Gb ×2

SGLang 0.5.16 · ctx 32k · modelopt_fp4 · 05.08.2026

подбор ключей
Модель
nvidia/Qwen3.6-35B-A3B-NVFP4
Связка карт
RTX 5070 Ti 16Gb ×2
Движок
SGLang 0.5.16
Контекст
32768 токенов
Параллельных
10
Карт занято
2
Слои на CPU
нет, всё в VRAM
Квантование
modelopt_fp4
Сборка движка
Дата замера
05.08.2026
Пропускная без SO
314.3 ток/сек
Пропускная с SO
264.2 ток/сек
Последовательная без SO
309.1 ток/сек
Последовательная с SO
257.3 ток/сек
Параллельная без SO
86.1 ток/сек
Параллельная с SO
65.9 ток/сек
TTFT, короткий промпт (6-15 ток.)
0.18 сек
TTFT, деловой промпт (~450 ток.)
0.17 сек
Prefill — обработка входа
2326.7 ток/сек
Генерация от начала запроса
248.2 ток/сек
Декодирование после TTFT
2527.5 ток/сек
Кэш префикса
Кэш работает, выигрыш по TTFT ×2.5, срабатывает от 668 токенов
Команда запуска
CUDA_DEVICE_ORDER=PCI_BUS_ID CUDA_VISIBLE_DEVICES=1,2 FLASHINFER_DISABLE_VERSION_CHECK=1 python3 -m sglang.launch_server --model-path nvidia/Qwen3.6-35B-A3B-NVFP4 --host 0.0.0.0 --port 8000 --tp-size 2 --context-length 32768 --language-only --quantization modelopt_fp4 --moe-runner-backend flashinfer_cutlass --fp4-gemm-backend marlin --attention-backend flashinfer --linear-attn-backend triton --speculative-algorithm NEXTN --speculative-draft-model-path nvidia/Qwen3.6-35B-A3B-NVFP4 --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 4 --mamba-ssm-dtype bfloat16 --chunked-prefill-size 2048 --max-running-requests 1 --cuda-graph-max-bs-decode 1  --mem-fraction-static 0.92 --reasoning-parser qwen3 --tool-call-parser qwen3_coder --enable-metrics --enable-cache-report --stream-interval 1
Ключи подбора
--language-only on --moe-backend flashinfer_cutlass --fp4-gemm-backend marlin --attention-backend flashinfer --linear-attn-backend triton --speculative-algorithm NEXTN --speculative-draft-model-path nvidia/Qwen3.6-35B-A3B-NVFP4 --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 4 --mamba-ssm-dtype bfloat16 --chunked-prefill-size 2048 --max-running-requests 1 --cuda-graph-max-bs-decode 1 --gpu-memory-utilization 0.92 --reasoning-parser qwen3 --tool-call-parser qwen3_coder --enable-metrics on --enable-cache-report on --stream-interval 1
Слой нагрузки — контекст, число параллельных запросов, занятые карты и выгрузка на процессор — задаёт сам замер, поэтому такие прогоны стоят в таблице отдельными строками. Слой подбора настраивает то же задание и сворачивается в варианты одной строки. Как это устроено.