Qwen3.6-27B-NVFP4 на RTX 5070 Ti 16Gb ×2
SGLang 0.5.16 · ctx 16k · modelopt_mixed · 05.08.2026
подбор ключей
Модель
nvidia/Qwen3.6-27B-NVFP4
Связка карт
RTX 5070 Ti 16Gb ×2
Движок
SGLang 0.5.16
Контекст
16384 токенов
Параллельных
10
Карт занято
2
Слои на CPU
нет, всё в VRAM
Квантование
modelopt_mixed
Сборка движка
—
Дата замера
05.08.2026
Пропускная без SO
133 ток/сек
Пропускная с SO
117.2 ток/сек
Последовательная без SO
135.4 ток/сек
Последовательная с SO
122.2 ток/сек
Параллельная без SO
32.9 ток/сек
Параллельная с SO
30.2 ток/сек
TTFT, короткий промпт (6-15 ток.)
0.33 сек
TTFT, деловой промпт (~450 ток.)
0.31 сек
Prefill — обработка входа
1319.8 ток/сек
Генерация от начала запроса
120.8 ток/сек
Декодирование после TTFT
218 ток/сек
Кэш префикса
Кэш работает, выигрыш по TTFT ×8.6, срабатывает от 667 токенов
Команда запуска
CUDA_DEVICE_ORDER=PCI_BUS_ID CUDA_VISIBLE_DEVICES=1,2 FLASHINFER_DISABLE_VERSION_CHECK=1 PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True python3 -m sglang.launch_server --model-path nvidia/Qwen3.6-27B-NVFP4 --host 0.0.0.0 --port 8000 --tp-size 2 --quantization modelopt_mixed --language-only --attention-backend flashinfer --linear-attn-backend triton --mamba-ssm-dtype bfloat16 --speculative-algorithm NEXTN --speculative-draft-model-path nvidia/Qwen3.6-27B-NVFP4 --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 4 --context-length 16384 --max-running-requests 1 --max-mamba-cache-size 5 --cuda-graph-max-bs-decode 1 --chunked-prefill-size 2048 --mem-fraction-static 0.995 --reasoning-parser qwen3 --tool-call-parser qwen3_coder --enable-metrics --enable-cache-report --stream-interval 1
Ключи подбора
--language-only on --attention-backend flashinfer --linear-attn-backend triton --mamba-ssm-dtype bfloat16 --speculative-algorithm NEXTN --speculative-draft-model-path nvidia/Qwen3.6-27B-NVFP4 --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 4 --max-running-requests 1 --max-mamba-cache-size 5 --cuda-graph-max-bs-decode 1 --chunked-prefill-size 2048 --gpu-memory-utilization 0.995 --reasoning-parser qwen3 --tool-call-parser qwen3_coder --enable-metrics on --enable-cache-report on --stream-interval 1 Слой нагрузки — контекст, число параллельных запросов, занятые карты и выгрузка на процессор — задаёт сам замер, поэтому такие прогоны стоят в таблице отдельными строками. Слой подбора настраивает то же задание и сворачивается в варианты одной строки. Как это устроено.