DEV Community

Cover image for Своя GPU под нейросеть почти не окупается - вот честный расчёт
Promptra Team for Promptra

Posted on

Своя GPU под нейросеть почти не окупается - вот честный расчёт

Применить: 30 минут на прикидку · Уровень: средний · Чтение: ~26 минут · Данные проверены на 10 июля 2026

Что узнаешь

  • Где на самом деле лежит точка окупаемости своей GPU: против дешёвого API это не 5-10 млн токенов в месяц - реальная планка ~5,7 млрд на одном H100.
  • Почему простаивающая видеокарта дороже топового облака: при загрузке 10% цена за 1000 токенов растёт с $0,013 до $0,13.
  • Сколько стоит человек, который держит нейросеть на сервере живой: loaded cost инженера $250-360K/год, это 60-75% всей сметы self-hosting.
  • Как гибрид (дешёвое и приватное локально, пики через API) режет счёт на 40-85% - с реальным кейсом $47K → $8K/мес.
  • Когда своё железо оправдано: 152-ФЗ, КИИ, суверенитет данных - и почему экономия тут ни при чём.
  • Причём тут гига чат, официальный сайт Сбера и открытая под MIT нейросеть GigaChat 3.5 Ultra на 432B.

Главное. Интуиция «куплю видеокарту - уйду от облака» почти всегда врёт. Своя GPU окупается только на очень высокой стабильной нагрузке (сотни миллионов - миллиарды токенов в месяц), потому что львиную долю сметы съедает зарплата инженера, а железо на её фоне дешёвое. Против дешёвого API вроде DeepSeek V4 Flash своё железо не окупается почти никогда. Реальные причины ставить своё - суверенитет данных и регуляторика. Дешевле всего - гибрид: рутина локально, сложное через облако.

Счёт за облачный API вырос вдвое за квартал, и рука сама тянется к калькулятору: «А если купить свою видеокарту?» Открытые веса лежат на Hugging Face, качай бесплатно. DeepSeek, Qwen, GLM, теперь ещё и GigaChat под MIT - всё в открытом доступе. Кажется, что дальше только железо и розетка.

Сразу оговорюсь для тех, кому из России нужен доступ к моделям без своего сервера. provod.ai - это агрегатор нейросетей для пользователей из России: Claude, GPT, Gemini, DeepSeek и Qwen в одном чате и через единый API (OpenAI- и Anthropic-совместимый), с оплатой в рублях легально, без VPN и зарубежных карт, с договором и закрывающими документами для юрлиц. Это готовый облачный вариант, если считать своё железо не хочется.

Вот в чём подвох. Эта арифметика почти всегда собирается из двух строк - цена GPU и электричество, - и обе строки красиво «доказывают» выгоду. Честный расчёт состоит из четырёх строк, и четвёртая (инженер плюс простой) переворачивает вывод. Ниже - те самые четыре строки, с ценами железа июля 2026, зарплатами, тарифами на аренду GPU и пересчётом в рубли. Спойлер: своё железо оправдано куда реже, чем подсказывает интуиция, и совсем по другим поводам.

Почему кажется, что своя нейросеть дешевле облака?

Главное. Иллюзию создают три вещи: пугающий счёт за API в конце месяца, «бесплатные» открытые веса на Hugging Face и страх утечки данных. Все три - реальные боли. Но каждая сравнивает облако лишь с половиной себестоимости своего сервера. Полную цену - с инженером и простоем - в расчёт не берут. Как только к железу прибавляется человек и простой, картинка разворачивается.

Разберём по порядку, откуда растёт ошибка №1.

Счёт за API психологически давит сильнее, чем зарплата. Когда в конце месяца прилетает $8000 за токены, это выглядит как утечка из кармана. А зарплата DevOps-инженера в $250K/год лежит в другой строке бюджета и «не считается» - хотя это тот же кошелёк. Мозг сравнивает видимый счёт за облако с невидимой стоимостью своей команды, и облако проигрывает ещё до расчёта. Психология тут работает против кошелька: одна цифра болит, вторая размазана по фонду оплаты труда.

Открытые веса выглядят бесплатными. DeepSeek V4 под модифицированной MIT, GLM-5.2 под MIT, Qwen3, теперь и нейросеть от Сбера GigaChat 3.5 Ultra под MIT - всё качается с Hugging Face без единого рубля лицензии. Логика простая: раз модель бесплатная, останется только «поставить её на свой сервер». Слово «поставить» и прячет всю стоимость - VRAM, инженера, обслуживание. Лицензия бесплатная, эксплуатация - нет.

Приватность ощущается как всё-или-ничего. «Не хочу, чтобы наши данные уходили в OpenAI» - здоровая мысль, особенно под 152-ФЗ. Из неё делают вывод «значит, всё своё», хотя между «шлём всё в чужое облако» и «строим свой ЦОД» лежит десяток промежуточных решений: приватный контур у российского провайдера, договор поручения, гибрид, локальный дев-стек. Приватность - это шкала, а её воспринимают как тумблер.

Есть и четвёртый источник ошибки - hobby-опыт. Человек запустил ollama run на своём макбуке, увидел, что нейросеть на пк отвечает бодро, и мысленно экстраполировал это на прод команды. На Hacker News таких историй десятки: локальная llm летает на ноуте у одного пользователя и умирает под нагрузкой сотни. Демо на одном запросе и прод на тысяче запросов - разные инженерные задачи, и вторая стоит денег.

Двухстрочная модель TCO всегда голосует за своё железо. Четырёхстрочная - говорит правду.

  • Digital Applied Team, 24 апреля 2026

Эта фраза (в оригинале «Two-line TCO models always favor self-hosting. Four-line models tell the truth») - ось всей статьи. Две строки - это GPU плюс электричество. Четыре - плюс инженер и плюс простой. Дальше считаем именно по четырём.

⚠️ Совет. Прежде чем считать окупаемость, вытащи из бюджета ВСЕ строки, включая те, что прячутся вне счёта за API. Зарплаты, амортизация, простой, on-call - в одну таблицу. Половина решений «уходим на своё железо» разворачивается прямо на этом шаге, когда цифры перестают прятаться по разным статьям.

Где точка окупаемости: сколько токенов в месяц нужно, чтобы своя GPU окупилась?

Главное. Порог «5-10 млн токенов в месяц» - миф. Он верен только против самых дорогих API (уровня GPT-5 или Claude Sonnet). Против дешёвого DeepSeek V4 Flash за $0,14 на миллион токенов своя GPU окупается лишь с ~5,7 млрд токенов в месяц на одном H100. Реальный порог - сотни миллионов - единицы миллиардов токенов в месяц, и то при загрузке 60-70%.

Точка окупаемости держится на одной переменной, которую проваливают почти все калькуляторы: с каким именно API ты сравниваешь своё железо. Пока эта переменная не зафиксирована, любая цифра порога бессмысленна.

Если сравнивать с премиум-моделью за $5 на миллион токенов, своё железо начинает выигрывать уже с 256 млн токенов в месяц (Digital Applied, 27 мая 2026). Против Claude Sonnet-класса - примерно с 430 млн при загрузке GPU 60-70%. Вот отсюда и растёт цифра «5-10 млн», которую любят повторять: она про дорогие API и часто ещё и посчитана без инженера в смете.

А теперь то же железо против дешёвого DeepSeek V4 Flash по $0,14 за миллион. Порог улетает до ~5,7 млрд токенов в месяц на одном H100. Разница больше чем в 20 раз - только из-за того, с чем сравниваешь. Одна и та же GPU по отношению к дорогому API выглядит выгодной покупкой, а по отношению к дешёвому - выброшенными деньгами.

Exhibit-1: где своё железо обгоняет облако (данные Digital Applied, апрель-май 2026)

С чем сравниваем Цена API Порог окупаемости своей GPU
Премиум (GPT-5-класс) ~$5 / 1M ~256 млн ток/мес
Средний (Claude Sonnet-класс) ~$3 / 1M ~430 млн ток/мес (загрузка 60-70%)
Чат общего назначения - ~1,2 млрд ток/мес
Код-ассистент - ~600 млн ток/мес
Дешёвый (DeepSeek V4 Flash) $0,14 / 1M ~5,7 млрд ток/мес на 1×H100

Прикинь на пальцах, что такое 5,7 млрд токенов в месяц. Это около 190 млн токенов в день, или ~2200 токенов в секунду без остановки - круглосуточно, все 30 дней. Средний ответ чат-бота - 300-800 токенов. То есть твоя нейросеть должна выдавать несколько ответов в секунду 24/7 без единой паузы, чтобы обогнать DeepSeek V4 Flash по цене. У большинства продуктовых команд реальная нагрузка на два-три порядка ниже.

Braincuber заходит с другой стороны и получает тот же вывод. По расчёту Mayur Domadiya (CEO Braincuber, 10 марта 2026), при нагрузке 1 млн токенов в день self-hosting на Azure выходит в 733 раза дороже, чем тот же объём через API. Break-even у него - около 11 млрд токенов в месяц. Baseten даёт ориентир помягче: практическая точка ~500 млн токенов в месяц. Разброс большой, но нижняя граница у всех считается сотнями миллионов; единицы миллионов остаются мифом.

При загрузке облачной GPU на 10% эффективная цена за 1000 токенов прыгает с $0,013 до $0,13 - дороже, чем премиум-API.

  • Digital Applied Team, 27 мая 2026

Вот почему объём вторичен. Первична утилизация, и к ней мы вернёмся в разделе про простой. Пока запомни правило пересчёта: сырую цену аренды GPU умножай на 1,3-2,0 (консервативно) или на 3-5 (с учётом DevOps, обновлений и простоя), и только потом сравнивай с API. Без этого множителя ты сравниваешь свою половину сметы с полной ценой облака.

Теперь честная таблица цен на сами API - чтобы понимать, с каким числом ты вообще воюешь. Для российского читателя добавляю строку с ценами в рублях по тем же официальным тарифам.

Сравнение цен облачных API (за 1M токенов, вход/выход; курс ЦБ 10.07.2026 = 75,93 ₽/$)

Модель Цена, $ / 1M Класс
Claude Opus 4.8 $5 / $25 фронтир
GPT-5.6 (Sol) $5 / $30 фронтир
Claude Sonnet 5 $3 / $15 средний
Gemini 3.1 Pro $2 / $12 средний
Qwen3.7 Max ~$1,2 / $6 доступный
DeepSeek V4 Flash $0,14 / $0,28 дешёвый
Те же модели в рублях (provod.ai) DeepSeek V4 Flash 11 / 22 ₽ · Opus 4.8 390 / 1950 ₽ оплата картой РФ

Строка provod.ai: те же официальные цены 1:1 без наценки, только в рублях, оплата картой РФ, СБП или по счёту. Реселлеры за то же обычно берут на 30-100% больше. Тарифы provod.ai сверены на 10.07.2026 - проверить в агрегаторе.

Смотри на нижнюю строку и на порог из Exhibit-1 вместе. Чтобы обогнать DeepSeek V4 Flash за 11-22 рубля на миллион токенов своим H100, тебе нужно прокачивать через него миллиарды токенов в месяц без простоя. У подавляющего большинства команд такой нагрузки просто нет, а значит и разговор про «своё дешевле» на этом уровне закрыт.

Сколько на самом деле стоит своя GPU под нейросеть?

Главное. Купить H100 - это $22-40K за карту, а под серьёзную модель нужен не один ускоритель. RTX 5090 на 32 ГБ дешевле ($1999 MSRP, на улице ~$3844), но её VRAM хватает только на мелкие модели. В России H100 у дилера стоит 3 485 187 ₽, а аренда - от ~246 тыс ₽/мес за одну карту. Модель определяет железо: чем больше параметров, тем больше VRAM, тем больше карт.

Начнём с прайса. Цены июля 2026, разброс на рынке огромный.

Цены на железо под нейросеть (покупка, июль 2026)

GPU VRAM Цена Комментарий
H100 80GB PCIe 80 ГБ $22-33K (new) рабочая лошадка инференса
H100 SXM5 80 ГБ $35-40K+ TDP 700 Вт
RTX PRO 6000 Blackwell 96 ГБ $13 250 +55% за 16 мес, дефицит GDDR7
RTX 5090 32 ГБ $1999 MSRP / ~$3844 street потолок для мелких моделей
RTX 4090 24 ГБ ~$3299 снята с производства, дефицит
H100 у РФ-дилера 80 ГБ 3 485 187 ₽ серый импорт

Ценник одной карты - это ещё полбеды. Беда в том, что модель диктует, сколько карт тебе нужно. Интуиция снова обманывает: «возьму видеокарту, запущу нейросеть на ПК» работает только для крохотных моделей уровня Qwen3 8B, а они и качеством уступают облачным флагманам. Как только речь заходит про серьёзную qwen нейросеть на 235B или дипсик нейросеть в полном разрешении, ПК под столом заканчивается и начинается стойка.

Сколько VRAM едят реальные модели

Модель Квантование VRAM Железо
DeepSeek V4 Flash Q4 18,5-26 ГБ 1×A100 или RTX PRO 6000
DeepSeek V4 Flash Q8 37-46 ГБ 1×H100
DeepSeek V4 Flash full ~160 ГБ несколько карт
Qwen3 235B Q4_K_M ~140 ГБ 2×H100 (все эксперты в VRAM)
GLM-5.2 744B FP8 ~744 ГБ 8×H200
GLM-5.2 744B 2-bit ~241 ГБ 4×RTX 3090 → 3-6 ток/с
GigaChat 3.5 Ultra 432B FP8 ~432 ГБ 8×H100/H200

Обрати внимание на две ловушки. Первая - MoE-модели вроде Qwen3 235B держат в VRAM ВСЕХ экспертов, даже если на каждом токене работают лишь несколько. «Активных параметров 22B» не значит «влезет в 22 ГБ», в память нужно уложить все 235B. Вторая - glm нейросеть GLM-5.2 на 2-bit можно ужать до четырёх бытовых RTX 3090, но ты получишь 3-6 токенов в секунду. Это скорость чтения вслух, для прода непригодно.

Аренда GPU снимает капзатраты, но не отменяет математику. Западные площадки:

Аренда H100 on-demand (июль 2026)

Площадка Цена H100 Примечание
Vast.ai $1,50-1,87/ч спот-маркет, разброс качества
RunPod $1,99-3,29/ч популярен у стартапов
Lambda $2,99-3,99/ч reserved $1,89
Modal $3,95/ч serverless, A100 $2,50
Together $6,49/ч dedicated

Разброс цен на одно и то же железо - от 4 раз между спот-маркетом и dedicated в таблице до 12 раз, если добавить гиперскейлеры вроде AWS. Это само по себе сигнал: рынок аренды незрелый, и «средней цены GPU-часа» не существует. Одна и та же H100 на спот-маркете и на dedicated-тарифе отличается вчетверо, и вместе с ценой скачет надёжность.

Про амортизацию покупки коротко. H100 за $30K при сроке службы 3 года - это ~$830 в месяц только на списание стоимости, без электричества, стойки и инженера. Арендованная H100 на Vast за $1,50/ч в режиме 24/7 - около $1080 в месяц. Покупка выигрывает по «голому» железу процентов на 20-30, но лишь если карта загружена постоянно все три года и не устареет раньше. Модели и требования к VRAM меняются каждый квартал, так что это смелое допущение.

В России Immers.cloud (проверка 11.07.2026) даёт A100 от ~210 ₽/час (~152 тыс ₽/мес за карту в режиме 24/7), H100 - около ~340 ₽/час (~246 тыс ₽/мес). Кластер A100×8 - порядка 1,2 млн ₽/мес. Считай: одна арендованная H100 за ~246 тыс ₽/мес быстро догоняет счёт за API, если ты не грузишь её под завязку. За предоплату площадки дают скидки 10-25%, но порядок величины это не меняет.

Здесь развилка для тех, кому нужен просто доступ к сильной модели в рублях без своего сервера и без капзатрат. В рублях 1:1 с официальными тарифами эти модели считает provod.ai - оплата картой РФ, СБП или по счёту с закрывающими для юрлиц. Реселлеры за то же обычно берут на 30-100% больше, так что аренда H100 за ~246 тыс ₽/мес плюс инженер на этом фоне выглядит спорно.

🚨 Критично. Дефицит GPU в России - это серый импорт со всеми рисками. Дмитрий Завалишин (директор DZ Systems, newsinfo.ru, 09.07.2026): «с видеокартами ситуация критическая». Топ-GPU везут через Шэньчжэнь, Гонконг, Малайзию, Казахстан; для карт с криптомодулями нужно уведомление ФСБ, а с 01.09.2026 вступает новый техрегламент ТР ТС 010. Планируя закупку своего железа, закладывай срыв сроков и отсутствие гарантии сверх самого ценника.

Какие скрытые косты убивают экономику self-hosting?

Главное. 60-75% стоимости self-hosting уходит на людей - больше, чем на само железо. Loaded cost инженера под LLM-serving - $250-360K/год, это как целый кластер 8×H100 в аренде. Полный контроль над одной 70B-моделью требует ~3,5 FTE. Прибавь амортизацию, охлаждение, обновления и простой - и «дешёвое своё железо» становится самой дорогой строкой сметы.

Вот где двухстрочная модель разбивается о реальность. Считаем строку, которую все забывают, - людей.

Инженер, который поднимет vLLM, настроит квантование, отловит OOM и переживёт ночной инцидент, стоит дорого. MLOps в США - медиана $130-165K, вилка $90-257K (kore1.com, апрель 2026). А именно под LLM-serving (vLLM, TensorRT, Triton поверх Kubernetes) - mid $170-230K, senior $235-325K.

Digital Applied сводит это в loaded cost $250-360K/год на инженера inference. Это $20-30K в месяц - примерно как целый кластер 8×H100 в аренде on-demand. То есть один человек в смете стоит столько же, сколько восемь топовых GPU.

60-75% стоимости self-host - это люди, а не железо.

  • CPO финтех-компании, Habr, 17 апреля 2026

Тот же автор оценивает полный контроль над одной 70B-моделью в ~3,5 FTE - целая мини-команда на дежурствах, апдейтах и разборе инцидентов, не один человек. Фонд зарплат такой команды - сотни тысяч долларов в год, и амортизация карт рядом с ним превращается в мелкую строку.

Exhibit-2: из чего реально складывается смета self-hosting

Строка Двухстрочная модель Честная четырёхстрочная
GPU (аренда/амортизация) есть есть
Электричество есть есть
Инженер (loaded cost) - $250-360K/год
Простой + обновления + on-call - +30-40% overprovision под P99

И это ещё не всё, что прячется в четвёртой строке:

  1. Обновления моделей. Каждый апдейт - 1-2 недели работы инженера на подгонку сервинга (~$12K за цикл). Модели в 2026 выходят чуть ли не ежемесячно.
  2. On-call. 2-4 инцидента в месяц. Нейросеть падает без предупреждения, обычно среди ночи в пятницу.
  3. Overprovision под P99. Чтобы держать хвост латентности, закладывают +30-40% лишних мощностей, которые простаивают в среднем.
  4. Охлаждение и PUE. Годовой счёт за электричество с учётом охлаждения умножается примерно в 2,5 раза.

Разберём на живом примере, чтобы четыре строки перестали быть абстракцией. Возьмём команду, которая гоняет 300 млн токенов в месяц - вроде бы «серьёзная нагрузка».

  • Строка 1, GPU. Одна арендованная H100 под завязку: ~$1080/мес.
  • Строка 2, электричество. Если карта своя - ~$150/мес с охлаждением; в аренде уже включено.
  • Строка 3, инженер. Даже 0,5 FTE DevOps под LLM - это ~$12-15K/мес loaded cost.
  • Строка 4, простой и обновления. +30-40% сверху на overprovision и циклы апдейтов - ещё ~$4-5K/мес.

Итого около $17-21K в месяц. Те же 300 млн токенов через DeepSeek V4 Flash по $0,14 обошлись бы в ~$42 (да, сорок два доллара). Даже против среднего API за $3/1M это ~$900. Двухстрочная модель показала бы $1230 и «выгоду», четырёхстрочная показывает $17-21K и приговор. Вот вся разница между «работает на бумаге» и «работает в бухгалтерии».

Nahla Davies (KDnuggets, 29 апреля 2026) формулирует боль точно: «разрыв между "работает" и "работает хорошо" шире, чем большинство ожидает». Запустить нейросеть на сервере командой из одной строки - это демо. Держать её в проде с латентностью, аптаймом и обновлениями - это те самые 3,5 FTE.

Электричество и простой: какой счёт тут забывают?

Главное. Один H100 SXM5 при TDP 700 Вт в режиме 24/7 съедает 6132 кВт·ч в год - это ~$736 по $0,12/кВт·ч, а с охлаждением (PUE) ~$1838. Но главный удар по экономике наносит простой: при загрузке 10% цена за 1000 токенов вырастает в 10 раз, и простаивающая GPU становится дороже премиум-API. Счёт за розетку рядом с этим - мелочь.

Сначала прямой счёт за электричество. H100 SXM5 имеет TDP 700 Вт (TRG Datacenters). В режиме 24/7 это:

700 Вт × 24 ч × 365 дней = 6132 кВт·ч в год.

По американскому тарифу $0,12/кВт·ч - около $736 в год за карту. С учётом охлаждения счёт умножается на PUE: при типичном дата-центровом PUE 1,5 это ~$1100, у плохих площадок под 2,5 - до ~$1840. PUE (Power Usage Effectiveness) показывает, сколько ты тратишь на инфраструктуру вокруг карты: на каждый ватт вычислений уходит ещё столько же на кондиционеры, ИБП и вентиляцию. Кластер из 1000×H100 обходится, по данным Spheron, в $50,8-317,5 тыс/мес в зависимости от региона - шестикратный разброс только из-за цены электричества.

В России розница в Москве - около 8,7 ₽/кВт·ч, в области ~9,1. Дешёвое электричество есть (Иркутск ~1,78 ₽/кВт·ч), но там нет ни каналов связи, ни персонала под ЦОД. Промышленный тариф для дата-центров официально не публикуется, так что дальше - прикидка с оговоркой: 8×H100 с охлаждением потребляют порядка 10 кВт, и в режиме 24/7 это грубо 440-610 тыс ₽/год за электричество. Цифра оценочная, но масштаб понятен: розетка - заметная, но не главная строка.

Главная строка прячется в слове «простой». Вернёмся к цитате из раздела про окупаемость: при загрузке 10% цена за 1000 токенов растёт с $0,013 до $0,13. Механика простая - ты платишь за GPU круглосуточно, а работает она десятую часть времени. Все затраты делятся на меньший объём токенов, и удельная цена взлетает в десять раз. Простаивающий H100 в этот момент становится дороже, чем премиум-API, за уход от которого его и покупали.

Эндпоинт под нагрузкой продолжает отдавать 200 OK и просто тратит 30 секунд на ответ.

  • Du'An Lightfoot, Senior AI Engineer, Akamai, 18 июня 2026

Это про другую сторону простоя - тихую деградацию. Дашборды зелёные, error rate ноль, health-check возвращает 200 OK, а нейросеть под нагрузкой отвечает по 30 секунд. Формально всё живо, метрики радуют. Фактически - авария уровня P0, которую двухстрочная модель не видит в принципе, потому что в ней нет строки «латентность под нагрузкой».

Отсюда правило утилизации: своё железо имеет смысл только при стабильной загрузке 60-70% и выше. Если нагрузка рваная (днём пик, ночью тишина, по выходным ноль), простаивающая GPU сжигает деньги, а API в это время просто не тарифицируется. Облако эластично по устройству - ты платишь за токены, а карта, которой нет у тебя в стойке, не простаивает за твой счёт.

⚠️ Совет. Прежде чем покупать GPU, неделю снимай метрику утилизации на арендованной карте под своей реальной нагрузкой. Если средняя загрузка ниже 50%, покупка почти наверняка не окупится - и ты узнаешь это за $50 аренды, до траты $30K на железо плюс год обслуживания.

Гибрид дешевле обоих: как совместить своё железо и облако

Главное. Гибрид срезает счёт на 40-85%: рутину и приватные данные гонишь через локальную LLM, сложное и редкое - через облачный API. Роутинг 70/30 даёт экономию ~67%, 80/20 - до 77-79%. Реальный fintech-кейс: $47K → $8K/мес, минус 83%. Главное - держать quality-gate, иначе роутер незаметно просадит качество.

Идея гибрида простая: запросы неравнозначны. Классификация, извлечение полей, модерация, heartbeat агента - дешёвая рутина, которую тянет локальная модель на своём железе или на арендованной GPU. Сложное рассуждение, длинный контекст, редкие тяжёлые запросы - уходят на фронтир-API, где платишь по факту. Так ты забираешь выгоду self-hosting (приватность и дешёвый объём) и отдаёшь облаку то, в чём оно сильнее (эластичность и топ-качество).

Цифры (Digital Applied, 14 июня 2026): routing-слой даёт минус 40-85%. Раскладка 70/30 (70% дешёвых запросов локально, 30% на фронтир) экономит ~67%. Раскладка 80/20 - 77-79%. RouteLLM (ICLR 2025) показал 85% экономии при сохранении 95% качества GPT-4, отправляя на фронтир лишь 14% запросов - правда, цифра benchmark-specific и не гарантия для твоей нагрузки.

Конкретный кейс: финтех-команда перешла с чистого self-host на гибрид и уронила счёт с $47K до $8K в месяц - минус 83%. Отдельно показателен heartbeat агента: крон, который дёргает модель каждые несколько минут, на наивной реализации жрёт 20-40 тыс токенов на запрос, а после оптимизации - 1,5 тыс. Минус 93% на одной ручке, просто потому что перестали гонять весь контекст на каждый тик.

Оптимизируют одно число, которое легко увидеть, игнорируя то единственное, которое имеет значение.

  • Digital Applied Team, 14 июня 2026

Как собрать гибрид (порядок действий)

  1. Разметь запросы по сложности: что реально требует фронтира, а что решает 8B-модель.
  2. Посади дешёвую и приватную рутину на локальную LLM (своё железо или аренда GPU).
  3. Пики и сложное рассуждение отправляй на облачный API - платишь только за них.
  4. Поставь quality-gate: 50-500 тестовых кейсов в CI, которые ловят просадку качества роутером.
  5. Считай PII-вызовы отдельно - их держи локально, если того требует регуляторика.

🚨 Критично. Роутинг без quality-gate незаметно убивает качество. Роутер начинает гонять на дешёвую модель запросы, которым нужен фронтир, метрики затрат падают, все радуются - а пользователи получают деградировавшие ответы. Без 50-500 кейсов в CI ты этого не увидишь, пока не придут жалобы и отток.

Гибрид - это дефолт 2026 года для большинства команд. Он снимает главную боль self-hosting (простой и утилизацию) и оставляет выгоду там, где она реальна: приватность и дешёвая высокообъёмная рутина. Заметь, что оба конца гибрида - локальный vLLM и облачный API - говорят на одном OpenAI-совместимом протоколе, так что переключение между ними стоит две строки кода вместо переписывания пайплайна.

Гига чат, официальный сайт и нейросеть от Сбера: причём тут своё железо?

Главное. GigaChat - это облачная нейросеть от Сбера: гига чат официальный сайт нейросеть отдаёт через веб-интерфейс и API на developers.sber.ru, платишь в рублях от 600 ₽/мес. В июле 2026 Сбер открыл GigaChat 3.5 Ultra под MIT - её можно скачать с Hugging Face. Но 432B в FP8 требуют ~432 ГБ VRAM (8×H100). MIT не равно «поставил на свой сервер» - это кластер корпоративного уровня.

Разберём, где тут облако, а где своё железо, потому что путаница здесь массовая.

GigaChat как облачный сервис. Доступ - через приложение и веб ГигаЧат плюс API в GigaChat Studio. Официальный сайт для разработчиков - developers.sber.ru, регистрация по телефону или Sber ID. Для работы с API нужен корневой сертификат НУЦ Минцифры (russian_trusted_root_ca) - это российская специфика, без него запросы к giga нейросети не пойдут. Тарифы на июль 2026: Free - 1 млн токенов с обновлением раз в 12 месяцев (примерно 1250-2000 запросов); физлица с 01.02.2026 - 0,2 ₽ за 1000 токенов при минимальном платеже 600 ₽/мес с НДС; юрлица - 20 млн токенов Lite за 1300 ₽, 100 млн за 6500 ₽. Это облако. Своё железо тут ни при чём - ты платишь Сберу за токены в рублях, а модель крутится в его дата-центрах.

Весь этот доступ - облачный: регистрация, сертификат, оплата в рублях, никакого своего сервера.

GigaChat 3.5 Ultra как открытая модель. Примерно 6 июля 2026 Сбер выложил нейросеть от Сбера под лицензией MIT: на Hugging Face это ai-sage/GigaChat3.5-432B-A28B (bf16 и GGUF), плюс зеркало на GitVerse. Архитектура - MoE на 432 млрд параметров при 28 млрд активных, гибрид MLA и GatedDeltaNet. Модель на ~40% компактнее прошлой 3.1 Ultra на 700B, KV-кэш урезан вчетверо, генерация быстрее на 20% (MTP разгоняет до 2,2×).

...проверка гипотезы, что гибридную архитектуру с линейным вниманием можно довести до сотен миллиардов параметров, не разменивая качество на скорость.

  • команда GigaChat (Сбер), Habr, 6 июля 2026

Вот тут и стыкуется с темой статьи. MIT-лицензия звучит как «бесплатно ставь на свой сервер». Реальность: FP8-версия GigaChat 3.5 Ultra требует ~432 ГБ VRAM, а это 8×H100 или H200. Bf16 - ~865 ГБ, уже мультинода. Даже 4-bit GGUF - 220-250 ГБ, четыре топовых карты. Открытая giga нейросеть от Сбера self-host-абельна только для того, у кого уже стоит кластер корпоративного уровня. Для всех остальных гига чат остаётся облачным сервисом с официального сайта developers.sber.ru за рубли, и это нормальный сценарий.

Та же история с любой большой открытой моделью - DeepSeek V4, GLM-5.2, Qwen3 235B. Веса открыты и бесплатны, но full-precision версии требуют кластеров. «Открытая» и «дешёвая в эксплуатации» - разные характеристики, и вторую оплачивает твой инженер и твоё электричество. Когда в чате хвалятся, что «поставили нейросеть от Сбера себе», в 99 случаях из 100 речь про облачный API или про сильно урезанный квант на паре карт с несерьёзной скоростью.

Суверенитет данных - главная настоящая причина ставить своё

Главное. Единственный повод, который реально оправдывает своё железо в 2026, - это суверенитет данных и регуляторика. 152-ФЗ требует первичной записи персональных данных на серверах в РФ, GigaChat API запрещает слать ПДн в запросах, а self-hosting даёт локализацию автоматически. Для банков и КИИ на кону сама допустимость обработки, и стоимость тут второстепенна.

Здесь своё железо оправдано контролем над данными, и окупаемость в токенах роли не играет вообще. Это единственная развилка, где ответ «ставь своё» не зависит от объёма нагрузки.

152-ФЗ (статья 18, часть 5) требует: первичная запись персональных данных россиян - на серверах в РФ. Есть нюанс: вызов модели трактуется как обработка и под требование о хранении в РФ формально не подпадает, и если первичная запись легла в российскую базу, локализация соблюдена даже при обращении к внешней модели. Но дальше начинаются ограничения по конкретным сервисам.

GigaChat API прямо запрещает отправлять ПДн в запросах. Yandex Cloud разрешает - через договор поручения и аттестацию. Отправка в OpenAI, Anthropic или Google - это трансграничная передача.

С трансграничкой важен нюанс юрисдикции. Китай (а значит и дипсик нейросеть DeepSeek) считается «адекватной» юрисдикцией - передача возможна после уведомления. США (OpenAI, Anthropic, Google) требуют ожидания 10 рабочих дней после уведомления Роскомнадзора. Self-hosting снимает вопрос целиком: всё остаётся в контуре РФ, локализация автоматическая, никаких договоров поручения и уведомлений.

Для банков и КИИ это уже не выбор из соображений экономии. Совкомбанк оценивает масштаб суверенной инфраструктуры прямо: по оценке главного аналитика банка Дмитрия Трошина (tks.ru, 22 июня 2026), суверенный ИИ-ЦОД уровня DeepSeek V4-класса - это не менее 300 МВт мощности и капзатраты порядка 1,2 трлн рублей.

Это верхний предел спектра. Полный цикл обучения LLM с нуля в России, по оценке Совкомбанка, текущих мощностей ЦОД, вероятно, не потянет.

Между «свой ИИ-ЦОД на 1,2 трлн» и «шлём всё в чужое облако» есть рабочие решения. On-premise ПАК Cotype от MTS AI работает «без внешних серверов» и целится в банки и КИИ - туда, где данные не должны покидать периметр ни при каких условиях. МТС вложила в направление 1 млрд ₽. Базой суверенного стека служат открытые MIT-модели: DeepSeek V4, GLM-5.2, GigaChat 3.5 - их можно поднять в своём контуре, если есть железо.

Для корпоративного контура инфраструктура self-hosted LLM оценивается в 40-60 млн ₽, а кластер 8×H200 под DeepSeek-класс становится «стратегическим активом» - строкой в балансе. Логика тут простая: определённые данные юридически или по риск-модели нельзя выпускать за периметр, и тогда своё железо остаётся единственным допустимым вариантом, сколько бы оно ни стоило.

Запомни разделение. Если ты считаешь окупаемость в токенах и она не сходится (а она чаще всего не сходится) - это сигнал уходить в облако или гибрид. Если вопрос стоит как «эти данные не имеют права оказаться в чужой юрисдикции» - тогда предмет расчёта меняется: ты считаешь стоимость соответствия закону, и окупаемость тут вообще ни при чём.

Стек для запуска: vLLM, Ollama, llama.cpp - что и когда

Главное. Прод-дефолт 2026 - vLLM (vllm serve <model>, PagedAttention до 24× throughput). Для агентов и RAG с общими префиксами - SGLang (RadixAttention до 6,4×). Прототип на своём ПК - Ollama (ollama run qwen3:8b). Любое железо и экзотика - llama.cpp с GGUF. TGI с 11.12.2025 в maintenance mode - в новые проекты не брать.

Если своё железо всё-таки оправдано (суверенитет, стабильная высокая нагрузка), вот чем это поднимают. Правильный выбор стека экономит недели инженерного времени.

Стек для запуска нейросети на сервере (июль 2026)

Инструмент Когда брать Фишка
vLLM (ветка v0.24, июнь 2026) прод-дефолт, серьёзная нагрузка PagedAttention, до 24× throughput
SGLang агенты, RAG, общие префиксы RadixAttention до 6,4×, DeepSeek MLA 3,1×
Ollama прототип, дев, «нейросеть на пк» одна команда, OpenAI-совместим
llama.cpp любое железо, экзотика минимум зависимостей, GGUF
TensorRT-LLM NVIDIA-only, максимум скорости FP8
KTransformers длинный контекст, MoE оптимизация под большие модели
TGI не брать maintenance mode с 11.12.2025

Немного цифр, чтобы выбор был предметным. vLLM с PagedAttention выдаёт до 24× throughput против наивной реализации - это де-факто дефолт для прода. SGLang с RadixAttention выигрывает на общих префиксах (типичный кейс агентов и RAG, где системный промпт повторяется): на бенче Llama3.1-8B/H100 он даёт ~16200 токенов в секунду против ~12500 у vLLM, это +29%. На DeepSeek с механизмом MLA SGLang ускоряется до 3,1×. Так что для ИИ-ассистентов программирования и агентных пайплайнов с длинным общим контекстом SGLang часто предпочтительнее.

Как установить нейросеть для прототипа - буквально одна команда Ollama:

ollama run qwen3:8b
Enter fullscreen mode Exit fullscreen mode

Для прода на своём кластере дефолт - vLLM:

vllm serve deepseek-ai/DeepSeek-V4-Flash
Enter fullscreen mode Exit fullscreen mode

vLLM даёт OpenAI-совместимый эндпоинт из коробки, и это важно для гибрида: код, который ходит в облачный API, переключается на локальную нейросеть сменой base_url. Тот же принцип работает и в обратную сторону - с локального стека на облако.

Как это подключить из России

Гибрид удобен тем, что и локальный vLLM, и облако говорят на одном протоколе - OpenAI-совместимом. Пайплайн, который сегодня ходит в свою нейросеть, завтра ходит в облачную сменой двух строк - ключа и адреса.

from openai import OpenAI

client = OpenAI(
    api_key="PROVOD_API_KEY",
    base_url="https://api.provod.ai/v1",  # OpenAI-совместимый эндпоинт
)

resp = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Проверка связи"}],
)
print(resp.choices[0].message.content)
Enter fullscreen mode Exit fullscreen mode

Так из России заводятся Claude Code, Cursor, n8n и любой код на OpenAI- или Anthropic-SDK - один ключ вместо пяти, оплата в рублях. Подробности - на provod.ai.

Честная граница. Агрегатор закрывает доступ к облачным моделям и оплату в рублях. Но там, где нужен именно суверенитет, он своё железо не заменяет: air-gap, хранение ПДн в своём контуре, fine-tuning под свои данные - это ровно то, ради чего ставят собственный сервер под нейросеть, и агрегатор эти задачи не решает. Для облачных моделей он дешевле и проще, для суверенного контура понадобится своё.

Ещё раз про TGI: он ушёл в maintenance mode 11 декабря 2025. Гайды в интернете всё ещё советуют его по инерции - игнорируй, в новые проекты бери vLLM или SGLang. llama.cpp держи для экзотики: разношёрстное железо, ноутбук, одноплатник, любой GGUF - когда нужен сам факт запуска нейросети на компьютере, а скорость вторична.

5 ошибок, из-за которых своя нейросеть выходит дороже облака

Главное. Пять антипаттернов топят экономику: двухстрочная TCO-модель без инженера, роутинг без quality-gate, health-check 200 OK как признак здоровья, экстраполяция опыта с ноутбука на прод и слепая вера, что квантование бесплатно. Каждый из них незаметно, но стабильно делает своё железо дороже облака.

Разберём по одной, с парой «должно / не должно».

Ошибка 1. Двухстрочная TCO-модель. Считать только GPU и электричество.

  • Не должно: «карта + розетка = дешевле облака».
  • Должно: четыре строки - GPU, электричество, инженер, простой. Умножай цену аренды на 1,3-2,0 минимум.

Ошибка 2. Роутинг без quality-gate. Гнать запросы на дешёвую модель без проверки качества.

  • Не должно: «экономим 80%, метрики затрат упали, отлично».
  • Должно: 50-500 кейсов в CI, которые ловят просадку качества до того, как её заметят пользователи.

Ошибка 3. Health-check 200 OK как индикатор здоровья. Считать зелёный дашборд признаком живой нейросети.

  • Не должно: «error rate ноль, значит всё работает».
  • Должно: мерить латентность под нагрузкой. Эндпоинт может отдавать 200 OK и думать 30 секунд - это авария, которую нельзя считать нормой.

Ошибка 4. Экстраполяция опыта с ноутбука на прод. «У меня Ollama на макбуке летает, значит и в проде взлетит».

  • Не должно: путать демо на одном пользователе с нагрузкой команды.
  • Должно: Ollama-стеки не рассчитаны на тысячи одновременных запросов; для прода - vLLM или SGLang и нагрузочное тестирование.

Ошибка 5. Вера, что квантование бесплатно. Ужать модель до Q4 и ждать того же качества.

  • Не должно: «Q4 экономит VRAM, качество то же».
  • Должно: помнить, что модель, надёжная на FP16, на Q4 ломает JSON-схемы и теряет качество на длинном контексте. Тестируй именно квантованную версию.

Типовой финал провального пилота описан точно (Habr/OTUS, март 2025): сервер встал, инференс падает раз в неделю, Q4 просел по качеству, и через три месяца команда уезжает обратно на API - с разочарованием и потраченным бюджетом. Все пять ошибок ведут в одну и ту же точку. Добавь сюда «налог на ошибку» разработки: пока пилишь агента, каждый прогон - 5-10 вызовов модели, и на своём нестабильном контуре отладка растягивается вдвое.

Что выбрать: своё железо, аренда GPU или облачный API?

Главное. Облачный API - дефолт для низкой и средней нагрузки (до ~250 млн токенов в месяц) и для команд без GPU-опыта. Аренда GPU - если нужна конкретная модель под контролем, но без капзатрат. Своё железо - только при стабильной высокой нагрузке (сотни миллионов - миллиарды токенов при загрузке 60-70%+) ИЛИ при жёсткой регуляторике. Дефолт для большинства - гибрид.

Дерево решений (отвечай по порядку)

  1. Данные нельзя выпускать за периметр (152-ФЗ строго, КИИ, банковская тайна)? → Да: своё железо или on-premise ПАК, окупаемость не считаешь. → Нет: дальше.
  2. Нагрузка стабильно выше ~250 млн токенов в месяц при загрузке 60-70%? → Нет: облачный API или гибрид, точка. → Да: дальше.
  3. Есть выделенный инженер с опытом vLLM/квантования (или бюджет на 2-3,5 FTE)? → Нет: аренда GPU или гибрид, покупку не тяни. → Да: дальше.
  4. Нагрузка предсказуемая, не рваная, не экспериментальная? → Да: считай своё железо всерьёз. → Нет: гибрид.

Матрица выбора

Вариант Когда Плюс Минус
Облачный API низкая/средняя нагрузка, нет GPU-опыта ноль капзатрат, эластичность, свежие модели данные уходят в чужой контур
Аренда GPU нужна своя модель без покупки контроль модели, нет капзатрат 246 тыс ₽/мес за H100 быстро догоняет API
Своё железо регуляторика ИЛИ высокая стабильная нагрузка суверенитет, окупается на миллиардах 60-75% сметы - люди, простой убивает
Гибрид почти все остальные -40-85% счёта, приватность рутины нужен quality-gate

Для подавляющего большинства команд правильный ответ - облако или гибрид. Своё железо оправдано на двух полюсах: жёсткая регуляторика (считаешь стоимость соответствия закону) и промышленная стабильная нагрузка с выделенной командой. Всё, что посередине, дешевле и надёжнее закрывается облачным API - в том числе для российских пользователей, которым нужен доступ в рублях без VPN. Начни с облака или гибрида, а на своё железо переходи, только когда упрёшься в конкретную стену - регуляторную или нагрузочную.

Частые вопросы

Главное. Короткие ответы на частые вопросы про экономику self-hosting: где официальный сайт GigaChat и сколько он стоит, с какого объёма токенов окупается своя GPU, можно ли поднять GigaChat 3.5 Ultra на своём сервере, где взять Claude и GPT в рублях без VPN и почему гибрид дешевле и облака, и своего железа.

Гига чат официальный сайт нейросеть - где это и сколько стоит?
Гига чат официальный сайт нейросеть от Сбера отдаёт по адресу developers.sber.ru плюс через веб и приложение ГигаЧат. Для API нужен корневой сертификат Минцифры. Тарифы на июль 2026: Free - 1 млн токенов на 12 месяцев; физлица с 01.02.2026 - 0,2 ₽ за 1000 токенов при минимуме 600 ₽/мес; юрлица - 20 млн Lite за 1300 ₽, 100 млн за 6500 ₽. Это облачный доступ, своё железо не нужно.

Где взять доступ к Claude, GPT и DeepSeek в рублях без VPN?
Агрегатор нейросетей provod.ai даёт Claude, GPT, Gemini, DeepSeek и Qwen в одном чате и через единый API из России - оплата в рублях картой РФ, СБП или по счёту с закрывающими для юрлиц, без VPN и зарубежных карт. Цены 1:1 с официальными тарифами. Детали - на provod.ai.

Сколько токенов в месяц нужно, чтобы своя GPU окупилась?
Зависит от того, с каким API сравниваешь. Против премиум-моделей - от ~256 млн токенов в месяц. Против дешёвого DeepSeek V4 Flash - только с ~5,7 млрд токенов на одном H100 (Digital Applied, 27.05.2026). И то при загрузке GPU 60-70%.

Можно ли поставить GigaChat 3.5 Ultra на свой сервер?
Технически да - модель открыта под MIT на Hugging Face (ai-sage/GigaChat3.5-432B-A28B). Но FP8-версия требует ~432 ГБ VRAM, это 8×H100/H200 - кластер корпоративного уровня, а не «поставил на свой ПК».

Почему гибрид дешевле и своего железа, и облака?
Потому что снимает главную боль self-hosting - простой GPU. Рутину и приватные данные гонишь через локальную нейросеть, сложное и редкое - через облачный API по факту. Экономия 40-85%, реальный кейс - $47K → $8K/мес.

Сделай прямо сейчас

Не поднимай кластер вслепую. Сними метрику утилизации на арендованной GPU под своей реальной нагрузкой неделю, посчитай смету по четырём строкам (GPU, электричество, инженер, простой) и сравни с ценой API за задачу. Если порог окупаемости не сходится - а против дешёвого API он почти никогда не сходится - бери облако или гибрид. Своё железо оставь на случай, когда упрёшься в регуляторную стену.

Проверь любую модель из этой статьи за пять минут: на provod.ai все флагманы - Claude, GPT, Gemini, DeepSeek, Qwen - в одном чате и через единый API, оплата в рублях с карты РФ, для юрлиц - договор и закрывающие. Без VPN, без наценки. Если окупаемость своего железа у тебя не сходится - это самый быстрый способ получить сильную нейросеть в рублях, не поднимая кластер.

Была полезна статья? Поделись в комментариях, с какой нагрузки у тебя окупается своё железо - и окупается ли.

Источники

  • Digital Applied Team. TCO frontier для self-hosting LLM. 24 апреля 2026.
  • Digital Applied Team. Decision Guide: точки окупаемости против API. 27 мая 2026.
  • Digital Applied Team. Routing и гибридная экономия 40-85%. 14 июня 2026.
  • Braincuber (Mayur Domadiya, CEO). Расчёт «733× дороже» на Azure. 10 марта 2026.
  • Baseten / GMI Cloud. Практический break-even ~500 млн токенов/мес.
  • aisuperior.com. Порог «5-10 млн токенов» только для премиум-API.
  • MindStudio. Пороги нагрузки для локального железа. 27 мая 2026.
  • kore1.com. Зарплаты MLOps и LLM-serving инженеров в США. Апрель 2026.
  • TRG Datacenters. TDP H100 SXM5 700 Вт.
  • Spheron.network. Стоимость электричества кластера 1000×H100 по регионам.
  • RunPod, Vast.ai, Lambda, Modal, Together. Тарифы аренды H100 on-demand.
  • wccftech.com, Tom's Hardware. Цены RTX PRO 6000 Blackwell, RTX 5090.
  • Habr (CPO финтех-компании). «60-75% стоимости self-host - это люди». 17 апреля 2026.
  • Habr / OTUS (Анастасия Нечепоренко). Типовой провал self-host-пилота. 10 марта 2025.
  • Akamai (Du'An Lightfoot, Senior AI Engineer). «200 OK и 30 секунд на ответ». 18 июня 2026.
  • KDnuggets (Nahla Davies). «Разрыв между "работает" и "работает хорошо"». 29 апреля 2026.
  • RouteLLM (ICLR 2025). 85% экономии при 95% качества GPT-4.
  • developers.sber.ru. Тарифы и сертификаты GigaChat. Июль 2026.
  • Hugging Face. ai-sage/GigaChat3.5-432B-A28B (MIT).
  • Habr / Сбербанк. Анонс GigaChat 3.5 Ultra и цитата про гибридную архитектуру. 6 июля 2026.
  • digital-razor.ru. Требования VRAM для self-host GigaChat 3.5 Ultra. 6 июля 2026.
  • Совкомбанк (Дмитрий Трошин). Капзатраты суверенного ИИ-ЦОД 1,2 трлн ₽. tks.ru, 22 июня 2026.
  • DZ Systems (Дмитрий Завалишин). «С видеокартами ситуация критическая». newsinfo.ru, 9 июля 2026.
  • Immers.cloud. Тарифы аренды H100/A100 в рублях. Проверка 11 июля 2026.
  • TINVEST. Цена H100 у РФ-дилера 3 485 187 ₽.
  • Хабр. 152-ФЗ и обработка ПДн в LLM. 2026.
  • MTS AI / MWS. Cotype on-premise. 2026.
  • Курс ЦБ РФ на 10 июля 2026: 75,93 ₽/$.

provod.ai — управляемая работа команды с внутренними материалами

Когда AI помогает анализировать договоры, отчёты или базу знаний, личные аккаунты становятся риском: отдельные пользователи, роли и общий корпоративный контур упрощают контроль доступа.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Безопасная организация работы не меняет тариф модели: официальная стоимость действует 1:1, без собственной наценки provod.ai.

Организуйте доступ к внутренним данным: форма регистрации · цены на модели · защита данных по 152-ФЗ · политика обработки данных

Top comments (0)