Qwen3-4B-Instruct-2507-GGUF:F16: на каком железе и с какой скоростью
Замеры Qwen3-4B-Instruct-2507-GGUF:F16 на 4 связках карт, движки Llama.cpp
Замеры модели unsloth/Qwen3-4B-Instruct-2507-GGUF:F16 на локальном железе: 7 прогонов на 4 связках карт, движки Llama.cpp. Строку задаёт связка карт и нагрузка — длина контекста и число параллельных запросов; варианты подбора ключей свёрнуты внутрь строки.
Замеров
7
Связок карт
4
Лучшая на один запрос
91 ток/сек
Лучшая пропускная
292 ток/сек
Что важно
Замер | Движок | Последовательная без SO | |
|---|---|---|---|
RTX 3090 24Gb ×1 ctx 40k · 10 парал. | Llama.cpp 7717 подбор | 90.6 | Прогон |
RTX 5070 Ti 16Gb ×2 ctx 32k · 12 парал. | Llama.cpp 7973 подбор | 89.7 | Прогон |
RTX 5070 Ti 16Gb ×1 ctx 8k · 6 парал. | Llama.cpp 7973 подбор | 89.5 | Прогон |
Tesla v100 32gb sxm2 ×1 + RTX 3090 24Gb ×1 ctx 40k · 20 парал. | Llama.cpp 7717 подбор | 84.6 | Прогон |
Tesla v100 32gb sxm2 ×1 ctx 40k · 10 парал. | Llama.cpp 7717 подбор | 81.8 | Прогон |
RTX 5060 Ti 16Gb ×2 ctx 40k · 20 парал. | Llama.cpp 7973 подбор | 48.3 | Прогон |
RTX 5060 Ti 16Gb ×1 ctx 40k · 10 парал. | Llama.cpp 7973 подбор | 48.2 | Прогон |
Поднимаете эту модель у себя?
На курсе разбираем, как поднять локальную LLM и подключить её к рабочей системе через собственный сервис — от выбора движка до интеграции с 1С.
Курс «ИИ и 1С»