Блог: 1С, Искусственный Интеллект, ChatGPT, GigaChat

Узнайте, как запустить модель GPT OSS 120b на видеокартах RTX 3090 и Tesla V100 с помощью llama.cpp и получить 34 токена в секунду. Пошаговое руководство и рекомендации по ускорению.
Узнайте, как собрать мощный GPU‑сервер с RTX 3090 и Tesla V100, какие расходы и настройки BIOS понадобятся, и как решить проблемы с vllm и PyTorch.
Узнайте, как построить ИИ сервис для группировки товаров по прайсу: LLM, spaCy, FastAPI, Docker. Быстрая обработка 20 000 позиций за минуту.
Сравнение производительности LLM inference на llama cpp и vllm. Узнайте, какой движок быстрее под нагрузкой и где лучше использовать.
Проведённый тест сравнивает скорость и пропускную способность llama.cpp и vllm при работе с Qwen3‑8B‑4bit на RTX 3090. Выбирайте инференс под свои задачи.