Qwen3.8-27B: требования к видеопамяти, кванты и запуск локально

Замеры Qwen3.8-27B на 1 связке карт, движки vLLM

Справочник по Qwen3.8-27B: что это за модель, сколько весит каждый квант, на каком железе она поднимется, чем её запускать и с какой скоростью она печатает. Всё, что помечено здесь как замер, снято на нашем стенде — две RTX 5070 Ti по 16 GB, vLLM 0.27.1, четыре прогона в общей базе; размеры, которые мы не проверяли руками, помечены отдельно, выдуманных цифр на странице нет. Разборы отдельных сценариев — максимальный контекст, спекулятивное декодирование — вынесены в статьи, ссылки на них ниже.

Что за модель

Qwen3.8-27B — плотная модель на 27 миллиардов параметров, открытые веса которой Alibaba выложила в августе 2026 года под лицензией Apache 2.0. Внимание гибридное: 64 слоя, где на каждые три блока линейного Gated DeltaNet приходится один блок обычного внимания, плюс vision-энкодер и обученная голова MTP для спекулятивного декодирования. Нативный контекст — 262 144 токена; берут её как рабочую локальную модель под код, агентов и длинные документы.

Параметров
27 млрд
Архитектура
dense, гибридное внимание (Gated DeltaNet + Gated Attention), vision-энкодер
Контекст
262 144 токенов
Лицензия
Apache 2.0
Дата выхода
14 августа 2026 г.

Требования по VRAM

КвантВес весовМинимум VRAMКомфортноПримечание
BF16 (оригинальные веса)55.6 GB64 GB80 GBРазмер по карточке Qwen/Qwen3.8-27B на Hugging Face: 18 шардов, 55.6 GB вместе с vision-энкодером. У нас не замерялся — на стенде из двух карт по 16 GB такие веса не поднять; требования по VRAM расчётные.
NVFP4 (vLLM)23.4 GB32 GB48 GBЗамерено: 4 прогона на двух RTX 5070 Ti по 16 GB, vLLM 0.27.1, тензорный параллелизм на две карты, сборка unsloth/Qwen3.8-27B-NVFP4. Чекпойнт 21.81 GiB, на карту ложится около 11 GiB весов из 15.47 GiB полезных — на KV-кэш остаётся примерно 3 GiB, отсюда весь торг за длину контекста в рецептах ниже. Комфортные 48 GB расчётные: на таких картах мы не мерили.
Q8_0 (GGUF)29 GB32 GB48 GBРазмер файла Qwen3.8-27B-Q8_0.gguf по карточке unsloth/Qwen3.8-27B-GGUF. У нас не замерялся: llama.cpp и Ollama с этой моделью мы не гоняли, требования по VRAM расчётные.
Q5_K_M (GGUF)19.8 GB24 GB32 GBРазмер файла Qwen3.8-27B-UD-Q5_K_M.gguf по карточке unsloth/Qwen3.8-27B-GGUF. У нас не замерялся; требования по VRAM расчётные: на карте 24 GB под KV-кэш остаётся около 4 GB, то есть контекст в десятки тысяч токенов, а не в сотни.
Q4_K_M (GGUF)16.5 GB24 GB32 GBРазмер файла Qwen3.8-27B-UD-Q4_K_M.gguf по карточке unsloth/Qwen3.8-27B-GGUF. У нас не замерялся; требования по VRAM расчётные — это самый ходовой вариант для одной карты на 24 GB.
IQ4_XS (GGUF)14.3 GB16 GB24 GBРазмер файла Qwen3.8-27B-UD-IQ4_XS.gguf по карточке unsloth/Qwen3.8-27B-GGUF. У нас не замерялся; требования расчётные: в одну карту на 16 GB файл формально влезает, но на KV-кэш почти ничего не остаётся.

Как запустить

vLLM 0.27.1 — рабочая по умолчанию, со спекуляцией MTP
PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True \
  CUDA_DEVICE_ORDER=PCI_BUS_ID CUDA_VISIBLE_DEVICES=0,1 \
  vllm serve unsloth/Qwen3.8-27B-NVFP4 --host 0.0.0.0 --port 8000 \
  --tensor-parallel-size 2 --gpu-memory-utilization 0.965 \
  --language-model-only --max-num-seqs 4 --max-num-batched-tokens 1024 \
  --kv-cache-dtype fp8_e4m3 --mamba-ssm-cache-dtype bfloat16 \
  --speculative-config '{"method": "mtp", "num_speculative_tokens": 4}' \
  --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder \
  --enable-prefix-caching --enable-prompt-tokens-details --max-model-len 131072 \
  --chat-template ./qwen38-nvfp4-fixed.jinja

Прогон 43: 125.47 ток/с — столько модель печатает одному пользователю, без соседей и без строгого формата ответа; это и есть цифра из таблицы замеров ниже. Рядом с ней в той же строке стоят 107.8 ток/с декодирования — это печать уже после паузы, замеренная отдельной пробой на одиночном запросе, — и 0.170 с самой паузы до первого слова на деловом промпте. Три числа снимаются разными пробами, поэтому сходятся не буквально: первое отвечает на вопрос «с какой скоростью идёт ответ», два других разбирают его на паузу и на саму печать. Подтверждённый контекст — 123 848 токенов из заявленных 131 072, и это +127 % к скорости прогона 42, где той же спекуляции нет. Флаг --chat-template подставляет правленый шаблон чата: без него ломается случай, когда системное сообщение идёт в запросе не первым. Файл кладут рядом с командой — в рецептах он указан относительным путём.

vLLM 0.27.1 — максимальный контекст
PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True \
  CUDA_DEVICE_ORDER=PCI_BUS_ID CUDA_VISIBLE_DEVICES=0,1 \
  vllm serve unsloth/Qwen3.8-27B-NVFP4 --host 0.0.0.0 --port 8000 \
  --tensor-parallel-size 2 --gpu-memory-utilization 0.965 \
  --kv-cache-dtype turboquant_4bit_nc --language-model-only \
  --kv-cache-memory-bytes 2400000000 \
  --max-num-seqs 4 --max-num-batched-tokens 1024 \
  --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder \
  --enable-prefix-caching --enable-prompt-tokens-details --max-model-len 262144 \
  --chat-template ./qwen38-nvfp4-fixed.jinja

Прогон 45: подтверждённый контекст 248 380 токенов — почти весь нативный, и это потолок двух карт по 16 GB. Платим скоростью: 53.49 ток/с против 125.47 у прогона 43 (чистая печать 55.0, пауза до первого слова 0.137 с). Держится всё на четырёхбитном KV-кэше и вручную урезанном до 2.4 GB пуле.

vLLM 0.27.1 — максимум на честном восьмибитном кэше
PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True \
  CUDA_DEVICE_ORDER=PCI_BUS_ID CUDA_VISIBLE_DEVICES=0,1 \
  vllm serve unsloth/Qwen3.8-27B-NVFP4 --host 0.0.0.0 --port 8000 \
  --tensor-parallel-size 2 --gpu-memory-utilization 0.965 \
  --language-model-only --max-num-seqs 8 --max-num-batched-tokens 1024 \
  --kv-cache-dtype fp8_e4m3 \
  --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder \
  --enable-prefix-caching --enable-prompt-tokens-details --max-model-len 170912 \
  --chat-template ./qwen38-nvfp4-fixed.jinja

Прогон 42: 55.16 ток/с (чистая печать 56.5, пауза до первого слова 0.138 с), проверка контекста дошла до 123 848 токенов. Число 170912 не круглое, потому что его называет сама vLLM: заявляешь заведомо недостижимую длину и берёшь estimated maximum model length из её отказа. Округлять вверх нельзя — запрос чуть короче лимита виснет насмерть.

vLLM 0.27.1 — модель целиком, вместе с vision
PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True \
  CUDA_DEVICE_ORDER=PCI_BUS_ID CUDA_VISIBLE_DEVICES=0,1 \
  vllm serve unsloth/Qwen3.8-27B-NVFP4 --host 0.0.0.0 --port 8000 \
  --tensor-parallel-size 2 --max-num-seqs 8 --max-num-batched-tokens 4096 \
  --kv-cache-dtype fp8_e4m3 --gpu-memory-utilization 0.965 \
  --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder \
  --enable-prefix-caching \
  --speculative-config '{"method": "mtp", "num_speculative_tokens": 4}' \
  --enable-prompt-tokens-details --max-model-len 65536 \
  --chat-template ./qwen38-nvfp4-fixed.jinja

Прогон 44: единственная из четырёх конфигураций без флага --language-model-only, то есть с поднятой vision-частью. 111.56 ток/с (чистая печать 101.0, пауза до первого слова 0.171 с), подтверждённый контекст 61 533 токена из заявленных 65 536. За картинки платим контекстом.

Замеры модели Qwen3.8-27B на локальном железе: 4 прогона на 1 связке карт, движки vLLM. Строку задаёт связка карт и нагрузка — длина контекста и число параллельных запросов; варианты подбора ключей свёрнуты внутрь строки.

Замеров
4
Связок карт
1
Лучшая на один запрос
125 ток/сек
Лучшая пропускная
Что важно
Замер
Движок
Последовательная без SO
TTFT, деловой промпт (~450 ток.)
Декодирование после TTFT
RTX 5070 Ti ×2
ctx 128k · 4 парал.
vLLM 0.27.1
подбор
125.50.17107.8 Прогон
RTX 5070 Ti ×2
ctx 64k · 8 парал.
vLLM 0.27.1
подбор
111.60.17101 Прогон
RTX 5070 Ti ×2
ctx 167k · 8 парал.
vLLM 0.27.1
подбор
55.20.1456.5 Прогон
RTX 5070 Ti ×2
ctx 256k · 4 парал.
vLLM 0.27.1
подбор
53.50.1455 Прогон
Последовательная без SO
больше — лучше, ток/сек · Qwen3.8-27B: все замеры
лидер быстрее худшего в ×2.3
Поднимаете эту модель у себя?

На курсе разбираем, как поднять локальную LLM и подключить её к рабочей системе через собственный сервис — от выбора движка до интеграции с 1С.

Курс «ИИ и 1С»

Другие модели в замерах

Разборы

Частые вопросы