Qwen3-4B-Instruct-2507: на каком железе и с какой скоростью

Замеры Qwen3-4B-Instruct-2507 на 4 связках карт, движки Llama.cpp, vLLM

Замеры модели Qwen3-4B-Instruct-2507 на локальном железе: 14 прогонов на 4 связках карт, движки Llama.cpp, vLLM. Строку задаёт связка карт и нагрузка — длина контекста и число параллельных запросов; варианты подбора ключей свёрнуты внутрь строки.

Замеров
14
Связок карт
4
Лучшая на один запрос
132 ток/сек
Лучшая пропускная
672 ток/сек
Что важно
Замер
Движок
Последовательная без SO
RTX 5070 Ti 16Gb ×2
ctx 16k
vLLM 0.15.1
подбор
131.7 Прогон
Tesla v100 32gb sxm2 ×1 + RTX 3090 24Gb ×1
ctx 16k
vLLM 0.14.0
опорный
100.9 Прогон
RTX 3090 24Gb ×1
ctx 40k · 10 парал.
Llama.cpp 7717
подбор
90.6 Прогон
RTX 5070 Ti 16Gb ×1
ctx 16k
vLLM 0.15.1
подбор
90.4 Прогон
RTX 5070 Ti 16Gb ×2
ctx 32k · 12 парал.
Llama.cpp 7973
подбор
89.7 Прогон
RTX 5070 Ti 16Gb ×1
ctx 8k · 6 парал.
Llama.cpp 7973
подбор
89.5 Прогон
Tesla v100 32gb sxm2 ×1 + RTX 3090 24Gb ×1
ctx 40k · 20 парал.
Llama.cpp 7717
подбор
84.6 Прогон
RTX 3090 24Gb ×1
ctx 16k
vLLM 0.14.0
опорный
83.9 Прогон
Tesla v100 32gb sxm2 ×1
ctx 40k · 10 парал.
Llama.cpp 7717
подбор
81.8 Прогон
RTX 5060 Ti 16Gb ×2
ctx 16k
vLLM 0.15.1
подбор
78.1 Прогон
Tesla v100 32gb sxm2 ×1
ctx 16k
vLLM 0.14.0
опорный
67.4 Прогон
RTX 5060 Ti 16Gb ×2
ctx 40k · 20 парал.
Llama.cpp 7973
подбор
48.3 Прогон
RTX 5060 Ti 16Gb ×1
ctx 40k · 10 парал.
Llama.cpp 7973
подбор
48.2 Прогон
RTX 5060 Ti 16Gb ×1
ctx 16k
vLLM 0.15.1
подбор
47.7 Прогон
Последовательная без SO
больше — лучше, ток/сек · Qwen3-4B-Instruct-2507: все замеры
лидер быстрее худшего в ×2.8

Сборки этой модели

СборкаФормат весовЗамеровПоследовательная без SO
Qwen3-4B-Instruct-2507-GGUF:F16790.6
Qwen3-4B-Instruct-25077131.7
Поднимаете эту модель у себя?

На курсе разбираем, как поднять локальную LLM и подключить её к рабочей системе через собственный сервис — от выбора движка до интеграции с 1С.

Курс «ИИ и 1С»

Другие модели в замерах