gpt-oss-120b-GGUF на RTX 5070 Ti 16Gb ×2

Llama.cpp 7717 · ctx 16k · часть слоёв на CPU · 14.02.2026

подбор ключей
Модель
ggml-org/gpt-oss-120b-GGUF
Связка карт
RTX 5070 Ti 16Gb ×2
Движок
Llama.cpp 7717
Контекст
16384 токенов
Параллельных
10
Карт занято
2
Слои на CPU
да, часть выгружена
Квантование
Сборка движка
Дата замера
14.02.2026
Пропускная без SO
21.4 ток/сек
Пропускная с SO
19.4 ток/сек
Последовательная без SO
26.6 ток/сек
Последовательная с SO
24 ток/сек
Параллельная без SO
3.3 ток/сек
Параллельная с SO
2.7 ток/сек
Команда запуска
CUDA_VISIBLE_DEVICES=0,1 ./build/bin/llama-server -hf ggml-org/gpt-oss-120b-GGUF --host 0.0.0.0 --port 8000 -fa 1 -ncmoe 20 -ngl 99 --ctx-size 16384 --jinja --tensor-split 3,1 -ub 64
Ключи подбора
--flash-attn 1 --jinja on --ubatch 64
Слой нагрузки — контекст, число параллельных запросов, занятые карты и выгрузка на процессор — задаёт сам замер, поэтому такие прогоны стоят в таблице отдельными строками. Слой подбора настраивает то же задание и сворачивается в варианты одной строки. Как это устроено.