Зарегистрироваться 8 (800) 350-01-20

Дайджест бархатного сезона: 2 месяца мощных апдейтов в облаке mClouds

Александр
Автор:  Александр Опубликовано:  06 октября, 2025
Как сократить расходы на ИИ: выбираем GPU для Qwen и других LLM Как сократить расходы на ИИ: выбираем GPU для Qwen и других LLM

Разобрали, как оптимально подойди к выбору GPU для LLM и где можно сэкономить на инфраструктуре и работе с нейросетями в принципе, особенно если вы платите за токены по API. 

02 октября, 2026
Как правильно оценить объем VRAM для запуска LLM Как правильно оценить объем VRAM для запуска LLM

Что именно определяет расход видеопамяти и почему подобрать GPU только по объему памяти для работы с LLM не всегда сработает. Разберем влияние длины контекста, KV-кэш, количество одновременно обрабатываемых запросов, batch size и другие параметры.

09 сентября, 2026
Как запустить локальную LLM с RAG системой на своем сервере Как запустить локальную LLM с RAG системой на своем сервере

Пошагово разбираем, как развернуть локальную RAG-систему на своем GPU-сервере, для примера будем использовать наши облачные GPU-серверы с NVIDIA L4 24GB. Для запуска моделей локально, будем использовать vLLM, для работы с базой знаний и запросами — Open WebUI.

27 августа, 2026
Продолжая использовать сайт, вы соглашаетесь с использованием файлов cookie, а также подтверждаете, что ознакомлены и принимаете условия Политики конфиденциальности.
Принимаю