gpt-oss-120b-GGUF на RTX 5060 Ti 16Gb ×2
Llama.cpp 7717 · ctx 16k · часть слоёв на CPU · 12.02.2026
подбор ключей
Модель
ggml-org/gpt-oss-120b-GGUF
Связка карт
RTX 5060 Ti 16Gb ×2
Движок
Llama.cpp 7717
Контекст
16384 токенов
Параллельных
10
Карт занято
2
Слои на CPU
да, часть выгружена
Квантование
—
Сборка движка
—
Дата замера
12.02.2026
Пропускная без SO
17.5 ток/сек
Пропускная с SO
24.5 ток/сек
Последовательная без SO
24 ток/сек
Последовательная с SO
18.8 ток/сек
Параллельная без SO
2.9 ток/сек
Параллельная с SO
3.3 ток/сек
Команда запуска
CUDA_VISIBLE_DEVICES=0,1 ./build/bin/llama-server -hf ggml-org/gpt-oss-120b-GGUF --host 0.0.0.0 --port 8000 -fa 1 -ncmoe 20 -ngl 99 --ctx-size 16384 --jinja --tensor-split 3,1 -ub 64
Ключи подбора
--flash-attn 1 --jinja on --ubatch 64 Слой нагрузки — контекст, число параллельных запросов, занятые карты и выгрузка на процессор — задаёт сам замер, поэтому такие прогоны стоят в таблице отдельными строками. Слой подбора настраивает то же задание и сворачивается в варианты одной строки. Как это устроено.