Qwen3.8-27B: требования к видеопамяти, кванты и запуск локально
Замеры Qwen3.8-27B на 1 связке карт, движки vLLM
Справочник по Qwen3.8-27B: что это за модель, сколько весит каждый квант, на каком железе она поднимется, чем её запускать и с какой скоростью она печатает. Всё, что помечено здесь как замер, снято на нашем стенде — две RTX 5070 Ti по 16 GB, vLLM 0.27.1, четыре прогона в общей базе; размеры, которые мы не проверяли руками, помечены отдельно, выдуманных цифр на странице нет. Разборы отдельных сценариев — максимальный контекст, спекулятивное декодирование — вынесены в статьи, ссылки на них ниже.
Что за модель
Qwen3.8-27B — плотная модель на 27 миллиардов параметров, открытые веса которой Alibaba выложила в августе 2026 года под лицензией Apache 2.0. Внимание гибридное: 64 слоя, где на каждые три блока линейного Gated DeltaNet приходится один блок обычного внимания, плюс vision-энкодер и обученная голова MTP для спекулятивного декодирования. Нативный контекст — 262 144 токена; берут её как рабочую локальную модель под код, агентов и длинные документы.
Требования по VRAM
| Квант | Вес весов | Минимум VRAM | Комфортно | Примечание |
|---|---|---|---|---|
| BF16 (оригинальные веса) | 55.6 GB | 64 GB | 80 GB | Размер по карточке Qwen/Qwen3.8-27B на Hugging Face: 18 шардов, 55.6 GB вместе с vision-энкодером. У нас не замерялся — на стенде из двух карт по 16 GB такие веса не поднять; требования по VRAM расчётные. |
| NVFP4 (vLLM) | 23.4 GB | 32 GB | 48 GB | Замерено: 4 прогона на двух RTX 5070 Ti по 16 GB, vLLM 0.27.1, тензорный параллелизм на две карты, сборка unsloth/Qwen3.8-27B-NVFP4. Чекпойнт 21.81 GiB, на карту ложится около 11 GiB весов из 15.47 GiB полезных — на KV-кэш остаётся примерно 3 GiB, отсюда весь торг за длину контекста в рецептах ниже. Комфортные 48 GB расчётные: на таких картах мы не мерили. |
| Q8_0 (GGUF) | 29 GB | 32 GB | 48 GB | Размер файла Qwen3.8-27B-Q8_0.gguf по карточке unsloth/Qwen3.8-27B-GGUF. У нас не замерялся: llama.cpp и Ollama с этой моделью мы не гоняли, требования по VRAM расчётные. |
| Q5_K_M (GGUF) | 19.8 GB | 24 GB | 32 GB | Размер файла Qwen3.8-27B-UD-Q5_K_M.gguf по карточке unsloth/Qwen3.8-27B-GGUF. У нас не замерялся; требования по VRAM расчётные: на карте 24 GB под KV-кэш остаётся около 4 GB, то есть контекст в десятки тысяч токенов, а не в сотни. |
| Q4_K_M (GGUF) | 16.5 GB | 24 GB | 32 GB | Размер файла Qwen3.8-27B-UD-Q4_K_M.gguf по карточке unsloth/Qwen3.8-27B-GGUF. У нас не замерялся; требования по VRAM расчётные — это самый ходовой вариант для одной карты на 24 GB. |
| IQ4_XS (GGUF) | 14.3 GB | 16 GB | 24 GB | Размер файла Qwen3.8-27B-UD-IQ4_XS.gguf по карточке unsloth/Qwen3.8-27B-GGUF. У нас не замерялся; требования расчётные: в одну карту на 16 GB файл формально влезает, но на KV-кэш почти ничего не остаётся. |
Как запустить
PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True \
CUDA_DEVICE_ORDER=PCI_BUS_ID CUDA_VISIBLE_DEVICES=0,1 \
vllm serve unsloth/Qwen3.8-27B-NVFP4 --host 0.0.0.0 --port 8000 \
--tensor-parallel-size 2 --gpu-memory-utilization 0.965 \
--language-model-only --max-num-seqs 4 --max-num-batched-tokens 1024 \
--kv-cache-dtype fp8_e4m3 --mamba-ssm-cache-dtype bfloat16 \
--speculative-config '{"method": "mtp", "num_speculative_tokens": 4}' \
--reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder \
--enable-prefix-caching --enable-prompt-tokens-details --max-model-len 131072 \
--chat-template ./qwen38-nvfp4-fixed.jinjaПрогон 43: 125.47 ток/с — столько модель печатает одному пользователю, без соседей и без строгого формата ответа; это и есть цифра из таблицы замеров ниже. Рядом с ней в той же строке стоят 107.8 ток/с декодирования — это печать уже после паузы, замеренная отдельной пробой на одиночном запросе, — и 0.170 с самой паузы до первого слова на деловом промпте. Три числа снимаются разными пробами, поэтому сходятся не буквально: первое отвечает на вопрос «с какой скоростью идёт ответ», два других разбирают его на паузу и на саму печать. Подтверждённый контекст — 123 848 токенов из заявленных 131 072, и это +127 % к скорости прогона 42, где той же спекуляции нет. Флаг --chat-template подставляет правленый шаблон чата: без него ломается случай, когда системное сообщение идёт в запросе не первым. Файл кладут рядом с командой — в рецептах он указан относительным путём.
PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True \
CUDA_DEVICE_ORDER=PCI_BUS_ID CUDA_VISIBLE_DEVICES=0,1 \
vllm serve unsloth/Qwen3.8-27B-NVFP4 --host 0.0.0.0 --port 8000 \
--tensor-parallel-size 2 --gpu-memory-utilization 0.965 \
--kv-cache-dtype turboquant_4bit_nc --language-model-only \
--kv-cache-memory-bytes 2400000000 \
--max-num-seqs 4 --max-num-batched-tokens 1024 \
--reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder \
--enable-prefix-caching --enable-prompt-tokens-details --max-model-len 262144 \
--chat-template ./qwen38-nvfp4-fixed.jinjaПрогон 45: подтверждённый контекст 248 380 токенов — почти весь нативный, и это потолок двух карт по 16 GB. Платим скоростью: 53.49 ток/с против 125.47 у прогона 43 (чистая печать 55.0, пауза до первого слова 0.137 с). Держится всё на четырёхбитном KV-кэше и вручную урезанном до 2.4 GB пуле.
PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True \
CUDA_DEVICE_ORDER=PCI_BUS_ID CUDA_VISIBLE_DEVICES=0,1 \
vllm serve unsloth/Qwen3.8-27B-NVFP4 --host 0.0.0.0 --port 8000 \
--tensor-parallel-size 2 --gpu-memory-utilization 0.965 \
--language-model-only --max-num-seqs 8 --max-num-batched-tokens 1024 \
--kv-cache-dtype fp8_e4m3 \
--reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder \
--enable-prefix-caching --enable-prompt-tokens-details --max-model-len 170912 \
--chat-template ./qwen38-nvfp4-fixed.jinjaПрогон 42: 55.16 ток/с (чистая печать 56.5, пауза до первого слова 0.138 с), проверка контекста дошла до 123 848 токенов. Число 170912 не круглое, потому что его называет сама vLLM: заявляешь заведомо недостижимую длину и берёшь estimated maximum model length из её отказа. Округлять вверх нельзя — запрос чуть короче лимита виснет насмерть.
PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True \
CUDA_DEVICE_ORDER=PCI_BUS_ID CUDA_VISIBLE_DEVICES=0,1 \
vllm serve unsloth/Qwen3.8-27B-NVFP4 --host 0.0.0.0 --port 8000 \
--tensor-parallel-size 2 --max-num-seqs 8 --max-num-batched-tokens 4096 \
--kv-cache-dtype fp8_e4m3 --gpu-memory-utilization 0.965 \
--reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder \
--enable-prefix-caching \
--speculative-config '{"method": "mtp", "num_speculative_tokens": 4}' \
--enable-prompt-tokens-details --max-model-len 65536 \
--chat-template ./qwen38-nvfp4-fixed.jinjaПрогон 44: единственная из четырёх конфигураций без флага --language-model-only, то есть с поднятой vision-частью. 111.56 ток/с (чистая печать 101.0, пауза до первого слова 0.171 с), подтверждённый контекст 61 533 токена из заявленных 65 536. За картинки платим контекстом.
Замеры модели Qwen3.8-27B на локальном железе: 4 прогона на 1 связке карт, движки vLLM. Строку задаёт связка карт и нагрузка — длина контекста и число параллельных запросов; варианты подбора ключей свёрнуты внутрь строки.
Замер | Движок | Последовательная без SO | TTFT, деловой промпт (~450 ток.) | Декодирование после TTFT | ||
|---|---|---|---|---|---|---|
RTX 5070 Ti ×2 ctx 128k · 4 парал. | vLLM 0.27.1 подбор | 125.5 | 0.17 | 107.8 | Прогон | |
RTX 5070 Ti ×2 ctx 64k · 8 парал. | vLLM 0.27.1 подбор | 111.6 | 0.17 | 101 | Прогон | |
RTX 5070 Ti ×2 ctx 167k · 8 парал. | vLLM 0.27.1 подбор | 55.2 | 0.14 | 56.5 | Прогон | |
RTX 5070 Ti ×2 ctx 256k · 4 парал. | vLLM 0.27.1 подбор | 53.5 | 0.14 | 55 | Прогон |
На курсе разбираем, как поднять локальную LLM и подключить её к рабочей системе через собственный сервис — от выбора движка до интеграции с 1С.
Курс «ИИ и 1С»Другие модели в замерах
- Qwen3-4B-Instruct-2507
- Qwen3.6-35B-A3B
- Qwen3.6-27B
- gpt-oss-120b
- gpt-oss-20b
- Qwen3.8-Flash-Next
- Все замеры и методика