gpt-oss-120b: на каком железе и с какой скоростью

Замеры gpt-oss-120b на 2 связках карт, движки Llama.cpp

Замеры модели gpt-oss-120b на локальном железе: 2 прогона на 2 связках карт, движки Llama.cpp. Строку задаёт связка карт и нагрузка — длина контекста и число параллельных запросов; варианты подбора ключей свёрнуты внутрь строки.

Замеров
2
Связок карт
2
Лучшая на один запрос
27 ток/сек
Лучшая пропускная
21 ток/сек
Что важно
Замер
Движок
Последовательная без SO
RTX 5070 Ti 16Gb ×2
ctx 16k · часть слоёв на CPU
Llama.cpp 7717
подбор
26.6 Прогон
RTX 5060 Ti 16Gb ×2
ctx 16k · часть слоёв на CPU
Llama.cpp 7717
подбор
24 Прогон
Последовательная без SO
больше — лучше, ток/сек · gpt-oss-120b: все замеры
лидер быстрее худшего в ×1.1
Поднимаете эту модель у себя?

На курсе разбираем, как поднять локальную LLM и подключить её к рабочей системе через собственный сервис — от выбора движка до интеграции с 1С.

Курс «ИИ и 1С»

Другие модели в замерах