Qwen3.8-Flash-Next:UD-Q3_K_XL на RTX 3090 ×1 + RTX 5070 Ti ×2
llama.cpp b10669-6c5afc86a · ctx 256k · 1 парал. · 28.08.2026
подбор ключей
замер: local
методика v4
Модель
Qwen3.8-Flash-Next:UD-Q3_K_XL
Связка карт
RTX 3090 ×1 + RTX 5070 Ti ×2
Движок
llama.cpp b10669-6c5afc86a
Контекст
262144 токенов
Параллельных
1
Карт занято
—
Слои на CPU
нет, всё в VRAM
Квантование
—
Сборка движка
—
Дата замера
28.08.2026
Пропускная без SO
0 ток/сек
Пропускная с SO
0 ток/сек
Последовательная без SO
22.3 ток/сек
Последовательная с SO
28.1 ток/сек
Параллельная без SO
0 ток/сек
Параллельная с SO
0 ток/сек
TTFT, короткий промпт (6-15 ток.)
0.43 сек
TTFT, деловой промпт (~450 ток.)
2.13 сек
Prefill — обработка входа
293.8 ток/сек
Генерация от начала запроса
28 ток/сек
Декодирование после TTFT
29.6 ток/сек
Лестница префилла
Сверху — время до первого токена на растущем промпте, снизу — префилл, то есть скорость чтения этого промпта. Считается на участке от предыдущей ступени к этой, (N₂ − N₁) / (t₂ − t₁): постоянные накладные расходы сидят в обоих временах одинаково и вычитаются сами, а поточечное «токены ÷ время» давало бы горб на коротком промпте. Ровный нижний ряд означает, что сводное число честное; убывающие вправо столбики — что на длинном промпте движок читает вход медленнее. Подписи оси — фактическая длина промпта: её считает токенизатор движка, и она всегда чуть меньше заказанной.
Время до первого токена
Скорость префилла на отрезкеНаклон по всей лестнице — 294 ток/сек, постоянные издержки 0.80 сек, R² 1.000
У первой ступени столбика нет: скорость меряется на участке от предыдущей ступени, а до первой участка нет.
Итоговый балл
95 балл
Структурированный вывод
80 балл
Задачи
100 балл
Язык ответа
100 балл
Повторяемость
100 балл
проверено до 15k — это верхняя ступень лестницы, выше не мерили
Скорость на ступенях длины: сверху — префилл (чтение входа), снизу — выдача токенов. Столбик ниже соседнего слева показывает, на какой длине сборка начинает сдавать. Подписи оси — фактическая длина промпта, её считает токенизатор движка. Префилл здесь — та же величина и та же формула, что на лестнице префилла, но снят он на запросах этого теста: стог с иголкой, два сообщения и длинный ответ вместо короткого. Поэтому числа двух лестниц не обязаны совпадать.
Скорость префилла на отрезкеПросадка prefill: на 3 % медленнее с каждым удвоением длины
У первой ступени столбика нет: скорость меряется на участке от предыдущей ступени, а до первой участка нет.
Выдача токенов (декодирование)Просадка декодирования: на 4 % медленнее с каждым удвоением длины
Точность вызова инструментов
96.2 %
Переиспользование кэша
93.9 %
Рост TTFT по ходам
0.3 ×
Медиана хода (сек)
11.09 сек
Кэш префикса
Кэш работает, выигрыш по TTFT ×42.8, срабатывает от 656 токенов
Команда запуска
./build/bin/llama-server -m /opt/hf-cache/gguf/Qwen3.8-Flash-Next-GGUF/UD-Q3_K_XL/Qwen3.8-Flash-Next-UD-Q3_K_XL-00001-of-00003.gguf -a Qwen3.8-Flash-Next:UD-Q3_K_XL --host 0.0.0.0 --port 8000 --ctx-size 262144 --parallel 1 --cache-type-k q8_0 --cache-type-v q8_0 --flash-attn on --n-gpu-layers auto --split-mode layer --batch-size 2048 --ubatch-size 512 --jinja --log-file /home/ilya/ai/benchmark-logs/engine.log --log-colors off --log-timestamps --verbosity 4
Ключи подбора
--a Qwen3.8-Flash-Next:UD-Q3_K_XL --cache-type-k q8_0 --cache-type-v q8_0 --flash-attn on --split-mode layer --batch 2048 --ubatch 512 --jinja on --log-colors off --log-timestamps on --verbosity 4 Слой нагрузки — контекст, число параллельных запросов, занятые карты и выгрузка на процессор — задаёт сам замер, поэтому такие прогоны стоят в таблице отдельными строками. Слой подбора настраивает то же задание и сворачивается в варианты одной строки. Как это устроено.
Стенд
Со слов автораRyzen 5 3600, 64Gb G.Skill 3600, PCIe 4 CUDA 13.2 NVIDIA-SMI 595.71.05 Ubuntu 26.04
DIMM_A1: тайминги ОЗУ неизвестны: память работает на 3266 MT/s, а в SPD таких профилей нет (JEDEC 2666, XMP 1 3600) — частоту и тайминги задали в BIOS вручную
DIMM_A2: тайминги ОЗУ неизвестны: память работает на 3266 MT/s, а в SPD таких профилей нет (JEDEC 2133, XMP 1 4000, XMP 2 3866) — частоту и тайминги задали в BIOS вручную
Видеокарты под нагрузкой
NVIDIA GeForce RTX 3090
0000:04:00.0
PCIe 4.0 ×4из PCIe 4.0 ×16
Карта работает на 4 линиях из 16: ограничивает слот материнской платы. На двух и более картах это упирает обмен между ними.
Видеопамять22.6 из 24.0 GB
Температура50 → 63 °C
Потребление30 → 164 W из 370
vBIOS94.02.42.00.F1
NVIDIA GeForce RTX 5070 Ti
0000:09:00.0
PCIe 4.0 ×8из PCIe 4.0 ×16
Карта работает на 8 линиях из 16: ограничивает слот материнской платы. На двух и более картах это упирает обмен между ними.
Видеопамять14.3 из 15.9 GB
Температура44 → 55 °C
Потребление9 → 49 W из 300
vBIOS98.03.58.40.B6
NVIDIA GeForce RTX 5070 Ti
0000:0a:00.0
PCIe 4.0 ×8из PCIe 4.0 ×16
Карта работает на 8 линиях из 16: ограничивает слот материнской платы. На двух и более картах это упирает обмен между ними.
Видеопамять14.2 из 15.9 GB
Температура40 → 50 °C
Потребление11 → 73 W из 300
vBIOS98.03.58.00.78
Машина
- Процессор
- AMD Ryzen 5 3600 6-Core Processor, 6 ядер / 12 потоков
- ОЗУ
- 76 GB DDR4, 3266 MT/s, 4 из 4 слотов
- Пропускная память
- копирование 40.0, чтение 42.5, запись 26.0 ГБ/с (2 пот.)
- Материнская плата
- ASUSTeK COMPUTER INC. ROG STRIX X570-F GAMING, BIOS 5044 от 01/04/2026
- Операционная система
- Ubuntu 26.04 LTS
- Ядро
- Linux 7.0.0-30-generic x86_64
- Драйвер NVIDIA
- 595.71.05
- CUDA
- 13.2
Движок как он поднялся
- Движок
- llama.cpp b10669-6c5afc86a
- Квантование
- Q3_K
- Потолок контекста
- 262144 токенов /props → default_generation_settings.n_ctx
- Слотов
- 1
- Режим замера
- локально на стенде