Как сократить расходы на ИИ: выбираем GPU для Qwen и других LLM
Для собственного чат-бота компании, поиска по документам или транскрибации голоса, не всегда нужен сервер с самой дорогой видеокартой. Иногда задачу можно закрыть недорогими GPU, например NVIDIA L4 с 24 ГБ памяти. Если LLM модель крупнее или нужна бОльшая скорость, то стоит посмотреть на L40S с 48 ГБ или RTX PRO 6000 Blackwell Server Edition с 96 ГБ.
Разберём, как оптимально подойди к выбору GPU для LLM и где можно сэкономить на инфраструктуре и работе с нейросетями в принципе, особенно если вы платите за токены по API.
Существенным плюсом при прямой аренде GPU - экономия на токенах. Развернув свою LLM в облаке или у себя в инфраструктуре, вы не платите за каждый входной и выходной токен, а лимиты по API, включенные в тарифы сокращаются все чаще. Если вы работаете с ИИ каждый день и модель выдаёт нужное качество и скорость, то своя инфраструктура может обходиться дешевле внешнего API.
Еще один важный фактор - ваши данные остаются у вас, и не уходят за периметр в коммерческие ИИ, не используются кем-то еще, что существенно повышает безопасность хранения и обработки данных. Свою LLM в облаке mClouds можно настроить так, чтобы данные обрабатывались только внутри вашего контура без отправки в зарубежный API. Важно при этом, проверить всю цепочку: внешние инструменты, логирование и другие интеграции тоже могут передавать данные за его пределы.
Выбираем видеокарту для Qwen и других открытых моделей
В mClouds наиболее часто для работы с нейросетями выбирают видеокарты NVIDIA A16, L4, L40S и RTX PRO 6000 Blackwell Server Edition. В таблице отразили наиболее типовые сценарии использования.
|
GPU |
Видеопамять |
Пропускная способность памяти |
Для каких задач и моделей стоит рассмотреть |
|
NVIDIA A16 |
16 ГБ на GPU |
До 200 ГБ/с на GPU |
Компактные чат-боты, небольшие RAG системы — Qwen3.5-2B, Qwen3.5-4B в 16-битном формате. Подойдет также для Qwen3-8B и Gemma 4. |
|
NVIDIA L4 |
24 ГБ |
300 ГБ/с |
Корпоративные помощники, транскрибация в Whisper, суммаризация текстов и ответы по базе знаний с RAG — Qwen3.5-9B с FP8-квантизацией. Для отдельного сервиса эмбеддингов — Qwen3-Embedding-4B. |
|
NVIDIA L40S |
48 ГБ |
864 ГБ/с |
Транскрипция с анализом в Whisper. Обработка документов в DeepSeek-OCR-2, более тяжелые RAG и агенты — Qwen3.6-35B-A3B-FP8 или Qwen3.8-27B. |
|
NVIDIA RTX PRO 6000 Blackwell Server Edition |
96 ГБ |
Около 1,6 ТБ/с |
Более крупные модели на одном GPU — Qwen3.6-27B или Qwen3.8-27B. Вариант для задач, которым недостаточно 48 ГБ памяти. Активная работа с кодом в Qwen3 или DeepSeek. |
В mClouds A16 предоставляется через vGPU, поэтому доступная память определяется выбранным профилем. На одной A16 доступны отдельные 4 GPU с объемом памяти в 16GB. NVIDIA L4 передаётся виртуальной машине целиком через passthrough, без разделения на vGPU.
FP8: как разместить модель на более доступном GPU
FP8 — 8-битный формат с плавающей точкой. L4, L40S и RTX PRO 6000 Blackwell поддерживают аппаратные FP8-вычисления. Чтобы ими воспользоваться, нужны совместимые модель, движок и схема квантизации.
Переход с 16 на 8 бит примерно вдвое сокращает объём квантизируемых весов. Но это не значит, что вся модель займёт вдвое меньше vRAM: часть слоёв может остаться в другом формате, а кэш и рабочие буферы тоже требуют памяти. Но требования к объему памяти на GPU сокращаются значительно.
Для ряда моделей уже есть готовые версии — например, Qwen3.6-35B-A3B-FP8 и Qwen3.8-27B-FP8. Для поддерживаемых моделей vLLM также умеет выполнять квантизацию при загрузке. В обоих случаях важно проверить, сохранилось ли нужное качество выдачи результата.
У A16 аппаратных FP8-вычислений нет. Поэтому в наших примерах для неё выбраны компактные модели в 16-битном формате. Другие способы квантизации тоже можно использовать, если их поддерживает ваш программный стек. NVIDIA A16 с 16GB подойдет для базовых сценариев работы с ИИ и часто используются, так как показывает более экономичные показатели владения и умеет работать с профилями vGPU , позволяя работать с профилями от 4GB до 16GB.
Объем памяти GPU: почему недостаточно загрузить веса
Модель должна не только поместиться на GPU, но и оставить место для работы. Помимо весов, видеопамять занимают промежуточные данные, рабочие буферы и KV-кэш — данные механизма внимания, используемые при генерации текста.
Например, веса модели на 8 млрд параметров в 16-битном формате занимают около 16 ГБ. GPU с 16 ГБ VRAM уже не даст достаточного запаса для остальных данных и уже нужно смотреть в сторону 24GB или выше.
Посмотрим на Qwen3.8-27B. Объём файлов исходной версии составляет около 55,6 ГБ, а FP8-версии — 30,9 ГБ. Это размер файлов , а не точное потребление RAM на GPU, но разница помогает выбрать направление: на L40S рассматриваем FP8, на RTX PRO 6000 Blackwell с 96 ГБ — 16-битный вариант.
Чем длиннее контекст и больше одновременных запросов, тем выше расход памяти. Модель может столкнуться с нехваткой VRAM, когда нагрузка на нее возрастет, допустим несколько человек отправили сканированные фотографии с целью распознать их в текстовом виде.
Когда L40S или RTX PRO 6000 выгоднее H100 и H200
H100 и H200 нужны для тяжёлых нагрузок. Но для RAG-системы или работы с документами, а также корпоративной Wiki их возможности и стоимость часто избыточны.
Один из сильных аргументов в пользу этих ускорителей — быстрая HBM-память. У H100 SXM её пропускная способность составляет около 3,35 ТБ/с, у H200 SXM — 4,8 ТБ/с. Для сравнения: у RTX PRO 6000 Blackwell Server Edition — около 1,6 ТБ/с. В задачах, которые упираются в обмен с памятью, это существенное преимущество. Но нужны они не так часто, да и уже для продуктивных внедрениях в крупных компаниях или большом массиве данных, для малого и среднего бизнеса в России это часто избыточно и задачу можно успешно решить и более доступными GPU, как при аренде их в облаке, так и при размещении on-prem. В варианте on-prem, такой вариант, потребует значительных затрат на покупку и обслуживание таких систем, поэтому вариант аренды их в облаке остается более предпочтительным как по гибкости использования, так и по экономике.
Но если L40S или RTX PRO 6000 уже обеспечивают нужное время ответа, дополнительная скорость может не окупить более дорогую аренду. Мы в mClouds рекомендуем сначала проверить конфигурацию с одной-двумя такими картами:
- Модель помещается на L40S. Например, Qwen3.6-35B справляется с вашим потоком запросов — значит, оснований переходить на более дорогой GPU пока нет.
- Нужно больше памяти на одной карте. Для Qwen3.8-27B в 16-битном формате можно рассмотреть RTX PRO 6000 Blackwell с 96 ГБ.
- Растёт число обращений. Если модель помещается на каждой карте, две её копии с распределением запросов могут закрыть потребность без перехода на H100 или H200.
Для фоновой обработки документов сравнивайте время выполнения одинакового задания и стоимость ресурсов. Для чат-бота — сколько запросов сервер выдерживает без неприемлемого роста задержек. Небольшие чат-боты вообще отлично живут часто на базовой для ИИ карте - NVIDIA A16 и им хватает даже меньше 16GB памяти, при этом обеспечивая достаточную скорость ответов.
Совместное использование нескольких GPU
Еще одним вариантом экономии на аренде GPU в облаке, может быть совместное использование нескольких видеокарт, проброшенных в один сервер. Если вам необходимо 48GB памяти, и производительности карты NVIDIA L4 вам достаточно, то можно использовать две таких карты в одном сервере, суммарно получим 48GB доступной для работы видеопамяти GPU.
В облаке mClouds поддерживаются такие профили для работы с видеокартами NVIDIA L4 и NVIDIA L40S. Можно пробросить до 4-х GPU NVIDIA L4 в одну виртуальную машину и, получить таким образом суммарно 96GB видеопамяти GPU, доступной для работы с ИИ, распределив нагрузку между видеокартами. При этом получаем более экономичное решение, чем аренда одной GPU NVIDIA RTX 6000 PRO. Такой же режим работы поддерживается и для видеокарт NVIDIA L40S, мы поддерживаем объединение до двух таких видеокарт, также при этом передавая виртуальной машине для работы 96GB видеопамяти суммарно и мощность полностью двух L40S карт без ограничений.
С чего начать в mClouds
Для первого запуска достаточно короткого пилота:
- Определите задачу, требования к качеству и допустимое время ответа.
- Выберите модель и формат весов — например, Qwen3.5-9B с FP8-квантизацией или Qwen3.8
- Измерьте расход памяти с нужным контекстом.
- Проверьте скорость при ожидаемом количестве одновременных запросов.
- Сравните стоимость работы с учётом сопровождения.
Для компактных моделей можно начать с подходящего vGPU-профиля A16 или полностью NVIDIA L4 на 24 ГБ. Если памяти недостаточно — рассмотреть L40S на 48 ГБ. Для более крупных моделей на одной карте — RTX PRO 6000 Blackwell Server Edition на 96 ГБ. Или рассмотреть объединение двух или более видеокарт в одном виртуальной машине, исходя из ваших требований к производительности и объему памяти.
Так вы подберёте сервер под свою задачу и сможете оценить экономию на внешнем API до переноса основной нагрузки.
Как правильно оценить объем VRAM для запуска LLM
Что именно определяет расход видеопамяти и почему подобрать GPU только по объему памяти для работы с LLM не всегда сработает. Разберем влияние длины контекста, KV-кэш, количество одновременно обрабатываемых запросов, batch size и другие параметры.
09 сентября, 2026
Как запустить локальную LLM с RAG системой на своем сервере
Пошагово разбираем, как развернуть локальную RAG-систему на своем GPU-сервере, для примера будем использовать наши облачные GPU-серверы с NVIDIA L4 24GB. Для запуска моделей локально, будем использовать vLLM, для работы с базой знаний и запросами — Open WebUI.
27 августа, 2026
Июльский дайджест обновлений - добавили больше GPU и обновили 152-ФЗ
Вот что у нас нового в июле: добавили еще больше видеокарт в облаке - NVIDIA L40S и A16, завершили аттестацию всей платформы по 152-ФЗ, попали на карту ИТ-лидеров CNewsMarket и, конечно, продолжили публиковать статьи на Хабре и в нашем блоге. Заходите, чтобы узнать о процессорах EPYC Venice Zen6 и других новинках рынка.
04 августа, 2026