Применить: 30 минут на прикидку · Уровень: средний · Чтение: ~26 минут · Данные проверены на 10 июля 2026
Что узнаешь
- Где на самом деле лежит точка окупаемости своей GPU: против дешёвого API это не 5-10 млн токенов в месяц - реальная планка ~5,7 млрд на одном H100.
- Почему простаивающая видеокарта дороже топового облака: при загрузке 10% цена за 1000 токенов растёт с $0,013 до $0,13.
- Сколько стоит человек, который держит нейросеть на сервере живой: loaded cost инженера $250-360K/год, это 60-75% всей сметы self-hosting.
- Как гибрид (дешёвое и приватное локально, пики через API) режет счёт на 40-85% - с реальным кейсом $47K → $8K/мес.
- Когда своё железо оправдано: 152-ФЗ, КИИ, суверенитет данных - и почему экономия тут ни при чём.
- Причём тут гига чат, официальный сайт Сбера и открытая под MIT нейросеть GigaChat 3.5 Ultra на 432B.
Главное. Интуиция «куплю видеокарту - уйду от облака» почти всегда врёт. Своя GPU окупается только на очень высокой стабильной нагрузке (сотни миллионов - миллиарды токенов в месяц), потому что львиную долю сметы съедает зарплата инженера, а железо на её фоне дешёвое. Против дешёвого API вроде DeepSeek V4 Flash своё железо не окупается почти никогда. Реальные причины ставить своё - суверенитет данных и регуляторика. Дешевле всего - гибрид: рутина локально, сложное через облако.
Счёт за облачный API вырос вдвое за квартал, и рука сама тянется к калькулятору: «А если купить свою видеокарту?» Открытые веса лежат на Hugging Face, качай бесплатно. DeepSeek, Qwen, GLM, теперь ещё и GigaChat под MIT - всё в открытом доступе. Кажется, что дальше только железо и розетка.
Сразу оговорюсь для тех, кому из России нужен доступ к моделям без своего сервера. provod.ai - это агрегатор нейросетей для пользователей из России: Claude, GPT, Gemini, DeepSeek и Qwen в одном чате и через единый API (OpenAI- и Anthropic-совместимый), с оплатой в рублях легально, без VPN и зарубежных карт, с договором и закрывающими документами для юрлиц. Это готовый облачный вариант, если считать своё железо не хочется.
Вот в чём подвох. Эта арифметика почти всегда собирается из двух строк - цена GPU и электричество, - и обе строки красиво «доказывают» выгоду. Честный расчёт состоит из четырёх строк, и четвёртая (инженер плюс простой) переворачивает вывод. Ниже - те самые четыре строки, с ценами железа июля 2026, зарплатами, тарифами на аренду GPU и пересчётом в рубли. Спойлер: своё железо оправдано куда реже, чем подсказывает интуиция, и совсем по другим поводам.
Почему кажется, что своя нейросеть дешевле облака?
Главное. Иллюзию создают три вещи: пугающий счёт за API в конце месяца, «бесплатные» открытые веса на Hugging Face и страх утечки данных. Все три - реальные боли. Но каждая сравнивает облако лишь с половиной себестоимости своего сервера. Полную цену - с инженером и простоем - в расчёт не берут. Как только к железу прибавляется человек и простой, картинка разворачивается.
Разберём по порядку, откуда растёт ошибка №1.
Счёт за API психологически давит сильнее, чем зарплата. Когда в конце месяца прилетает $8000 за токены, это выглядит как утечка из кармана. А зарплата DevOps-инженера в $250K/год лежит в другой строке бюджета и «не считается» - хотя это тот же кошелёк. Мозг сравнивает видимый счёт за облако с невидимой стоимостью своей команды, и облако проигрывает ещё до расчёта. Психология тут работает против кошелька: одна цифра болит, вторая размазана по фонду оплаты труда.
Открытые веса выглядят бесплатными. DeepSeek V4 под модифицированной MIT, GLM-5.2 под MIT, Qwen3, теперь и нейросеть от Сбера GigaChat 3.5 Ultra под MIT - всё качается с Hugging Face без единого рубля лицензии. Логика простая: раз модель бесплатная, останется только «поставить её на свой сервер». Слово «поставить» и прячет всю стоимость - VRAM, инженера, обслуживание. Лицензия бесплатная, эксплуатация - нет.
Приватность ощущается как всё-или-ничего. «Не хочу, чтобы наши данные уходили в OpenAI» - здоровая мысль, особенно под 152-ФЗ. Из неё делают вывод «значит, всё своё», хотя между «шлём всё в чужое облако» и «строим свой ЦОД» лежит десяток промежуточных решений: приватный контур у российского провайдера, договор поручения, гибрид, локальный дев-стек. Приватность - это шкала, а её воспринимают как тумблер.
Есть и четвёртый источник ошибки - hobby-опыт. Человек запустил ollama run на своём макбуке, увидел, что нейросеть на пк отвечает бодро, и мысленно экстраполировал это на прод команды. На Hacker News таких историй десятки: локальная llm летает на ноуте у одного пользователя и умирает под нагрузкой сотни. Демо на одном запросе и прод на тысяче запросов - разные инженерные задачи, и вторая стоит денег.
Двухстрочная модель TCO всегда голосует за своё железо. Четырёхстрочная - говорит правду.
- Digital Applied Team, 24 апреля 2026
Эта фраза (в оригинале «Two-line TCO models always favor self-hosting. Four-line models tell the truth») - ось всей статьи. Две строки - это GPU плюс электричество. Четыре - плюс инженер и плюс простой. Дальше считаем именно по четырём.
⚠️ Совет. Прежде чем считать окупаемость, вытащи из бюджета ВСЕ строки, включая те, что прячутся вне счёта за API. Зарплаты, амортизация, простой, on-call - в одну таблицу. Половина решений «уходим на своё железо» разворачивается прямо на этом шаге, когда цифры перестают прятаться по разным статьям.
Где точка окупаемости: сколько токенов в месяц нужно, чтобы своя GPU окупилась?
Главное. Порог «5-10 млн токенов в месяц» - миф. Он верен только против самых дорогих API (уровня GPT-5 или Claude Sonnet). Против дешёвого DeepSeek V4 Flash за $0,14 на миллион токенов своя GPU окупается лишь с ~5,7 млрд токенов в месяц на одном H100. Реальный порог - сотни миллионов - единицы миллиардов токенов в месяц, и то при загрузке 60-70%.
Точка окупаемости держится на одной переменной, которую проваливают почти все калькуляторы: с каким именно API ты сравниваешь своё железо. Пока эта переменная не зафиксирована, любая цифра порога бессмысленна.
Если сравнивать с премиум-моделью за $5 на миллион токенов, своё железо начинает выигрывать уже с 256 млн токенов в месяц (Digital Applied, 27 мая 2026). Против Claude Sonnet-класса - примерно с 430 млн при загрузке GPU 60-70%. Вот отсюда и растёт цифра «5-10 млн», которую любят повторять: она про дорогие API и часто ещё и посчитана без инженера в смете.
А теперь то же железо против дешёвого DeepSeek V4 Flash по $0,14 за миллион. Порог улетает до ~5,7 млрд токенов в месяц на одном H100. Разница больше чем в 20 раз - только из-за того, с чем сравниваешь. Одна и та же GPU по отношению к дорогому API выглядит выгодной покупкой, а по отношению к дешёвому - выброшенными деньгами.
Exhibit-1: где своё железо обгоняет облако (данные Digital Applied, апрель-май 2026)
| С чем сравниваем | Цена API | Порог окупаемости своей GPU |
|---|---|---|
| Премиум (GPT-5-класс) | ~$5 / 1M | ~256 млн ток/мес |
| Средний (Claude Sonnet-класс) | ~$3 / 1M | ~430 млн ток/мес (загрузка 60-70%) |
| Чат общего назначения | - | ~1,2 млрд ток/мес |
| Код-ассистент | - | ~600 млн ток/мес |
| Дешёвый (DeepSeek V4 Flash) | $0,14 / 1M | ~5,7 млрд ток/мес на 1×H100 |
Прикинь на пальцах, что такое 5,7 млрд токенов в месяц. Это около 190 млн токенов в день, или ~2200 токенов в секунду без остановки - круглосуточно, все 30 дней. Средний ответ чат-бота - 300-800 токенов. То есть твоя нейросеть должна выдавать несколько ответов в секунду 24/7 без единой паузы, чтобы обогнать DeepSeek V4 Flash по цене. У большинства продуктовых команд реальная нагрузка на два-три порядка ниже.
Braincuber заходит с другой стороны и получает тот же вывод. По расчёту Mayur Domadiya (CEO Braincuber, 10 марта 2026), при нагрузке 1 млн токенов в день self-hosting на Azure выходит в 733 раза дороже, чем тот же объём через API. Break-even у него - около 11 млрд токенов в месяц. Baseten даёт ориентир помягче: практическая точка ~500 млн токенов в месяц. Разброс большой, но нижняя граница у всех считается сотнями миллионов; единицы миллионов остаются мифом.
При загрузке облачной GPU на 10% эффективная цена за 1000 токенов прыгает с $0,013 до $0,13 - дороже, чем премиум-API.
- Digital Applied Team, 27 мая 2026
Вот почему объём вторичен. Первична утилизация, и к ней мы вернёмся в разделе про простой. Пока запомни правило пересчёта: сырую цену аренды GPU умножай на 1,3-2,0 (консервативно) или на 3-5 (с учётом DevOps, обновлений и простоя), и только потом сравнивай с API. Без этого множителя ты сравниваешь свою половину сметы с полной ценой облака.
Теперь честная таблица цен на сами API - чтобы понимать, с каким числом ты вообще воюешь. Для российского читателя добавляю строку с ценами в рублях по тем же официальным тарифам.
Сравнение цен облачных API (за 1M токенов, вход/выход; курс ЦБ 10.07.2026 = 75,93 ₽/$)
| Модель | Цена, $ / 1M | Класс |
|---|---|---|
| Claude Opus 4.8 | $5 / $25 | фронтир |
| GPT-5.6 (Sol) | $5 / $30 | фронтир |
| Claude Sonnet 5 | $3 / $15 | средний |
| Gemini 3.1 Pro | $2 / $12 | средний |
| Qwen3.7 Max | ~$1,2 / $6 | доступный |
| DeepSeek V4 Flash | $0,14 / $0,28 | дешёвый |
| Те же модели в рублях (provod.ai) | DeepSeek V4 Flash 11 / 22 ₽ · Opus 4.8 390 / 1950 ₽ | оплата картой РФ |
Строка provod.ai: те же официальные цены 1:1 без наценки, только в рублях, оплата картой РФ, СБП или по счёту. Реселлеры за то же обычно берут на 30-100% больше. Тарифы provod.ai сверены на 10.07.2026 - проверить в агрегаторе.
Смотри на нижнюю строку и на порог из Exhibit-1 вместе. Чтобы обогнать DeepSeek V4 Flash за 11-22 рубля на миллион токенов своим H100, тебе нужно прокачивать через него миллиарды токенов в месяц без простоя. У подавляющего большинства команд такой нагрузки просто нет, а значит и разговор про «своё дешевле» на этом уровне закрыт.
Сколько на самом деле стоит своя GPU под нейросеть?
Главное. Купить H100 - это $22-40K за карту, а под серьёзную модель нужен не один ускоритель. RTX 5090 на 32 ГБ дешевле ($1999 MSRP, на улице ~$3844), но её VRAM хватает только на мелкие модели. В России H100 у дилера стоит 3 485 187 ₽, а аренда - от ~246 тыс ₽/мес за одну карту. Модель определяет железо: чем больше параметров, тем больше VRAM, тем больше карт.
Начнём с прайса. Цены июля 2026, разброс на рынке огромный.
Цены на железо под нейросеть (покупка, июль 2026)
| GPU | VRAM | Цена | Комментарий |
|---|---|---|---|
| H100 80GB PCIe | 80 ГБ | $22-33K (new) | рабочая лошадка инференса |
| H100 SXM5 | 80 ГБ | $35-40K+ | TDP 700 Вт |
| RTX PRO 6000 Blackwell | 96 ГБ | $13 250 | +55% за 16 мес, дефицит GDDR7 |
| RTX 5090 | 32 ГБ | $1999 MSRP / ~$3844 street | потолок для мелких моделей |
| RTX 4090 | 24 ГБ | ~$3299 | снята с производства, дефицит |
| H100 у РФ-дилера | 80 ГБ | 3 485 187 ₽ | серый импорт |
Ценник одной карты - это ещё полбеды. Беда в том, что модель диктует, сколько карт тебе нужно. Интуиция снова обманывает: «возьму видеокарту, запущу нейросеть на ПК» работает только для крохотных моделей уровня Qwen3 8B, а они и качеством уступают облачным флагманам. Как только речь заходит про серьёзную qwen нейросеть на 235B или дипсик нейросеть в полном разрешении, ПК под столом заканчивается и начинается стойка.
Сколько VRAM едят реальные модели
| Модель | Квантование | VRAM | Железо |
|---|---|---|---|
| DeepSeek V4 Flash | Q4 | 18,5-26 ГБ | 1×A100 или RTX PRO 6000 |
| DeepSeek V4 Flash | Q8 | 37-46 ГБ | 1×H100 |
| DeepSeek V4 Flash | full | ~160 ГБ | несколько карт |
| Qwen3 235B | Q4_K_M | ~140 ГБ | 2×H100 (все эксперты в VRAM) |
| GLM-5.2 744B | FP8 | ~744 ГБ | 8×H200 |
| GLM-5.2 744B | 2-bit | ~241 ГБ | 4×RTX 3090 → 3-6 ток/с |
| GigaChat 3.5 Ultra 432B | FP8 | ~432 ГБ | 8×H100/H200 |
Обрати внимание на две ловушки. Первая - MoE-модели вроде Qwen3 235B держат в VRAM ВСЕХ экспертов, даже если на каждом токене работают лишь несколько. «Активных параметров 22B» не значит «влезет в 22 ГБ», в память нужно уложить все 235B. Вторая - glm нейросеть GLM-5.2 на 2-bit можно ужать до четырёх бытовых RTX 3090, но ты получишь 3-6 токенов в секунду. Это скорость чтения вслух, для прода непригодно.
Аренда GPU снимает капзатраты, но не отменяет математику. Западные площадки:
Аренда H100 on-demand (июль 2026)
| Площадка | Цена H100 | Примечание |
|---|---|---|
| Vast.ai | $1,50-1,87/ч | спот-маркет, разброс качества |
| RunPod | $1,99-3,29/ч | популярен у стартапов |
| Lambda | $2,99-3,99/ч | reserved $1,89 |
| Modal | $3,95/ч | serverless, A100 $2,50 |
| Together | $6,49/ч | dedicated |
Разброс цен на одно и то же железо - от 4 раз между спот-маркетом и dedicated в таблице до 12 раз, если добавить гиперскейлеры вроде AWS. Это само по себе сигнал: рынок аренды незрелый, и «средней цены GPU-часа» не существует. Одна и та же H100 на спот-маркете и на dedicated-тарифе отличается вчетверо, и вместе с ценой скачет надёжность.
Про амортизацию покупки коротко. H100 за $30K при сроке службы 3 года - это ~$830 в месяц только на списание стоимости, без электричества, стойки и инженера. Арендованная H100 на Vast за $1,50/ч в режиме 24/7 - около $1080 в месяц. Покупка выигрывает по «голому» железу процентов на 20-30, но лишь если карта загружена постоянно все три года и не устареет раньше. Модели и требования к VRAM меняются каждый квартал, так что это смелое допущение.
В России Immers.cloud (проверка 11.07.2026) даёт A100 от ~210 ₽/час (~152 тыс ₽/мес за карту в режиме 24/7), H100 - около ~340 ₽/час (~246 тыс ₽/мес). Кластер A100×8 - порядка 1,2 млн ₽/мес. Считай: одна арендованная H100 за ~246 тыс ₽/мес быстро догоняет счёт за API, если ты не грузишь её под завязку. За предоплату площадки дают скидки 10-25%, но порядок величины это не меняет.
Здесь развилка для тех, кому нужен просто доступ к сильной модели в рублях без своего сервера и без капзатрат. В рублях 1:1 с официальными тарифами эти модели считает provod.ai - оплата картой РФ, СБП или по счёту с закрывающими для юрлиц. Реселлеры за то же обычно берут на 30-100% больше, так что аренда H100 за ~246 тыс ₽/мес плюс инженер на этом фоне выглядит спорно.
🚨 Критично. Дефицит GPU в России - это серый импорт со всеми рисками. Дмитрий Завалишин (директор DZ Systems, newsinfo.ru, 09.07.2026): «с видеокартами ситуация критическая». Топ-GPU везут через Шэньчжэнь, Гонконг, Малайзию, Казахстан; для карт с криптомодулями нужно уведомление ФСБ, а с 01.09.2026 вступает новый техрегламент ТР ТС 010. Планируя закупку своего железа, закладывай срыв сроков и отсутствие гарантии сверх самого ценника.
Какие скрытые косты убивают экономику self-hosting?
Главное. 60-75% стоимости self-hosting уходит на людей - больше, чем на само железо. Loaded cost инженера под LLM-serving - $250-360K/год, это как целый кластер 8×H100 в аренде. Полный контроль над одной 70B-моделью требует ~3,5 FTE. Прибавь амортизацию, охлаждение, обновления и простой - и «дешёвое своё железо» становится самой дорогой строкой сметы.
Вот где двухстрочная модель разбивается о реальность. Считаем строку, которую все забывают, - людей.
Инженер, который поднимет vLLM, настроит квантование, отловит OOM и переживёт ночной инцидент, стоит дорого. MLOps в США - медиана $130-165K, вилка $90-257K (kore1.com, апрель 2026). А именно под LLM-serving (vLLM, TensorRT, Triton поверх Kubernetes) - mid $170-230K, senior $235-325K.
Digital Applied сводит это в loaded cost $250-360K/год на инженера inference. Это $20-30K в месяц - примерно как целый кластер 8×H100 в аренде on-demand. То есть один человек в смете стоит столько же, сколько восемь топовых GPU.
60-75% стоимости self-host - это люди, а не железо.
- CPO финтех-компании, Habr, 17 апреля 2026
Тот же автор оценивает полный контроль над одной 70B-моделью в ~3,5 FTE - целая мини-команда на дежурствах, апдейтах и разборе инцидентов, не один человек. Фонд зарплат такой команды - сотни тысяч долларов в год, и амортизация карт рядом с ним превращается в мелкую строку.
Exhibit-2: из чего реально складывается смета self-hosting
| Строка | Двухстрочная модель | Честная четырёхстрочная |
|---|---|---|
| GPU (аренда/амортизация) | есть | есть |
| Электричество | есть | есть |
| Инженер (loaded cost) | - | $250-360K/год |
| Простой + обновления + on-call | - | +30-40% overprovision под P99 |
И это ещё не всё, что прячется в четвёртой строке:
- Обновления моделей. Каждый апдейт - 1-2 недели работы инженера на подгонку сервинга (~$12K за цикл). Модели в 2026 выходят чуть ли не ежемесячно.
- On-call. 2-4 инцидента в месяц. Нейросеть падает без предупреждения, обычно среди ночи в пятницу.
- Overprovision под P99. Чтобы держать хвост латентности, закладывают +30-40% лишних мощностей, которые простаивают в среднем.
- Охлаждение и PUE. Годовой счёт за электричество с учётом охлаждения умножается примерно в 2,5 раза.
Разберём на живом примере, чтобы четыре строки перестали быть абстракцией. Возьмём команду, которая гоняет 300 млн токенов в месяц - вроде бы «серьёзная нагрузка».
- Строка 1, GPU. Одна арендованная H100 под завязку: ~$1080/мес.
- Строка 2, электричество. Если карта своя - ~$150/мес с охлаждением; в аренде уже включено.
- Строка 3, инженер. Даже 0,5 FTE DevOps под LLM - это ~$12-15K/мес loaded cost.
- Строка 4, простой и обновления. +30-40% сверху на overprovision и циклы апдейтов - ещё ~$4-5K/мес.
Итого около $17-21K в месяц. Те же 300 млн токенов через DeepSeek V4 Flash по $0,14 обошлись бы в ~$42 (да, сорок два доллара). Даже против среднего API за $3/1M это ~$900. Двухстрочная модель показала бы $1230 и «выгоду», четырёхстрочная показывает $17-21K и приговор. Вот вся разница между «работает на бумаге» и «работает в бухгалтерии».
Nahla Davies (KDnuggets, 29 апреля 2026) формулирует боль точно: «разрыв между "работает" и "работает хорошо" шире, чем большинство ожидает». Запустить нейросеть на сервере командой из одной строки - это демо. Держать её в проде с латентностью, аптаймом и обновлениями - это те самые 3,5 FTE.
Электричество и простой: какой счёт тут забывают?
Главное. Один H100 SXM5 при TDP 700 Вт в режиме 24/7 съедает 6132 кВт·ч в год - это ~$736 по $0,12/кВт·ч, а с охлаждением (PUE) ~$1838. Но главный удар по экономике наносит простой: при загрузке 10% цена за 1000 токенов вырастает в 10 раз, и простаивающая GPU становится дороже премиум-API. Счёт за розетку рядом с этим - мелочь.
Сначала прямой счёт за электричество. H100 SXM5 имеет TDP 700 Вт (TRG Datacenters). В режиме 24/7 это:
700 Вт × 24 ч × 365 дней = 6132 кВт·ч в год.
По американскому тарифу $0,12/кВт·ч - около $736 в год за карту. С учётом охлаждения счёт умножается на PUE: при типичном дата-центровом PUE 1,5 это ~$1100, у плохих площадок под 2,5 - до ~$1840. PUE (Power Usage Effectiveness) показывает, сколько ты тратишь на инфраструктуру вокруг карты: на каждый ватт вычислений уходит ещё столько же на кондиционеры, ИБП и вентиляцию. Кластер из 1000×H100 обходится, по данным Spheron, в $50,8-317,5 тыс/мес в зависимости от региона - шестикратный разброс только из-за цены электричества.
В России розница в Москве - около 8,7 ₽/кВт·ч, в области ~9,1. Дешёвое электричество есть (Иркутск ~1,78 ₽/кВт·ч), но там нет ни каналов связи, ни персонала под ЦОД. Промышленный тариф для дата-центров официально не публикуется, так что дальше - прикидка с оговоркой: 8×H100 с охлаждением потребляют порядка 10 кВт, и в режиме 24/7 это грубо 440-610 тыс ₽/год за электричество. Цифра оценочная, но масштаб понятен: розетка - заметная, но не главная строка.
Главная строка прячется в слове «простой». Вернёмся к цитате из раздела про окупаемость: при загрузке 10% цена за 1000 токенов растёт с $0,013 до $0,13. Механика простая - ты платишь за GPU круглосуточно, а работает она десятую часть времени. Все затраты делятся на меньший объём токенов, и удельная цена взлетает в десять раз. Простаивающий H100 в этот момент становится дороже, чем премиум-API, за уход от которого его и покупали.
Эндпоинт под нагрузкой продолжает отдавать 200 OK и просто тратит 30 секунд на ответ.
- Du'An Lightfoot, Senior AI Engineer, Akamai, 18 июня 2026
Это про другую сторону простоя - тихую деградацию. Дашборды зелёные, error rate ноль, health-check возвращает 200 OK, а нейросеть под нагрузкой отвечает по 30 секунд. Формально всё живо, метрики радуют. Фактически - авария уровня P0, которую двухстрочная модель не видит в принципе, потому что в ней нет строки «латентность под нагрузкой».
Отсюда правило утилизации: своё железо имеет смысл только при стабильной загрузке 60-70% и выше. Если нагрузка рваная (днём пик, ночью тишина, по выходным ноль), простаивающая GPU сжигает деньги, а API в это время просто не тарифицируется. Облако эластично по устройству - ты платишь за токены, а карта, которой нет у тебя в стойке, не простаивает за твой счёт.
⚠️ Совет. Прежде чем покупать GPU, неделю снимай метрику утилизации на арендованной карте под своей реальной нагрузкой. Если средняя загрузка ниже 50%, покупка почти наверняка не окупится - и ты узнаешь это за $50 аренды, до траты $30K на железо плюс год обслуживания.
Гибрид дешевле обоих: как совместить своё железо и облако
Главное. Гибрид срезает счёт на 40-85%: рутину и приватные данные гонишь через локальную LLM, сложное и редкое - через облачный API. Роутинг 70/30 даёт экономию ~67%, 80/20 - до 77-79%. Реальный fintech-кейс: $47K → $8K/мес, минус 83%. Главное - держать quality-gate, иначе роутер незаметно просадит качество.
Идея гибрида простая: запросы неравнозначны. Классификация, извлечение полей, модерация, heartbeat агента - дешёвая рутина, которую тянет локальная модель на своём железе или на арендованной GPU. Сложное рассуждение, длинный контекст, редкие тяжёлые запросы - уходят на фронтир-API, где платишь по факту. Так ты забираешь выгоду self-hosting (приватность и дешёвый объём) и отдаёшь облаку то, в чём оно сильнее (эластичность и топ-качество).
Цифры (Digital Applied, 14 июня 2026): routing-слой даёт минус 40-85%. Раскладка 70/30 (70% дешёвых запросов локально, 30% на фронтир) экономит ~67%. Раскладка 80/20 - 77-79%. RouteLLM (ICLR 2025) показал 85% экономии при сохранении 95% качества GPT-4, отправляя на фронтир лишь 14% запросов - правда, цифра benchmark-specific и не гарантия для твоей нагрузки.
Конкретный кейс: финтех-команда перешла с чистого self-host на гибрид и уронила счёт с $47K до $8K в месяц - минус 83%. Отдельно показателен heartbeat агента: крон, который дёргает модель каждые несколько минут, на наивной реализации жрёт 20-40 тыс токенов на запрос, а после оптимизации - 1,5 тыс. Минус 93% на одной ручке, просто потому что перестали гонять весь контекст на каждый тик.
Оптимизируют одно число, которое легко увидеть, игнорируя то единственное, которое имеет значение.
- Digital Applied Team, 14 июня 2026
Как собрать гибрид (порядок действий)
- Разметь запросы по сложности: что реально требует фронтира, а что решает 8B-модель.
- Посади дешёвую и приватную рутину на локальную LLM (своё железо или аренда GPU).
- Пики и сложное рассуждение отправляй на облачный API - платишь только за них.
- Поставь quality-gate: 50-500 тестовых кейсов в CI, которые ловят просадку качества роутером.
- Считай PII-вызовы отдельно - их держи локально, если того требует регуляторика.
🚨 Критично. Роутинг без quality-gate незаметно убивает качество. Роутер начинает гонять на дешёвую модель запросы, которым нужен фронтир, метрики затрат падают, все радуются - а пользователи получают деградировавшие ответы. Без 50-500 кейсов в CI ты этого не увидишь, пока не придут жалобы и отток.
Гибрид - это дефолт 2026 года для большинства команд. Он снимает главную боль self-hosting (простой и утилизацию) и оставляет выгоду там, где она реальна: приватность и дешёвая высокообъёмная рутина. Заметь, что оба конца гибрида - локальный vLLM и облачный API - говорят на одном OpenAI-совместимом протоколе, так что переключение между ними стоит две строки кода вместо переписывания пайплайна.
Гига чат, официальный сайт и нейросеть от Сбера: причём тут своё железо?
Главное. GigaChat - это облачная нейросеть от Сбера: гига чат официальный сайт нейросеть отдаёт через веб-интерфейс и API на developers.sber.ru, платишь в рублях от 600 ₽/мес. В июле 2026 Сбер открыл GigaChat 3.5 Ultra под MIT - её можно скачать с Hugging Face. Но 432B в FP8 требуют ~432 ГБ VRAM (8×H100). MIT не равно «поставил на свой сервер» - это кластер корпоративного уровня.
Разберём, где тут облако, а где своё железо, потому что путаница здесь массовая.
GigaChat как облачный сервис. Доступ - через приложение и веб ГигаЧат плюс API в GigaChat Studio. Официальный сайт для разработчиков - developers.sber.ru, регистрация по телефону или Sber ID. Для работы с API нужен корневой сертификат НУЦ Минцифры (russian_trusted_root_ca) - это российская специфика, без него запросы к giga нейросети не пойдут. Тарифы на июль 2026: Free - 1 млн токенов с обновлением раз в 12 месяцев (примерно 1250-2000 запросов); физлица с 01.02.2026 - 0,2 ₽ за 1000 токенов при минимальном платеже 600 ₽/мес с НДС; юрлица - 20 млн токенов Lite за 1300 ₽, 100 млн за 6500 ₽. Это облако. Своё железо тут ни при чём - ты платишь Сберу за токены в рублях, а модель крутится в его дата-центрах.
Весь этот доступ - облачный: регистрация, сертификат, оплата в рублях, никакого своего сервера.
GigaChat 3.5 Ultra как открытая модель. Примерно 6 июля 2026 Сбер выложил нейросеть от Сбера под лицензией MIT: на Hugging Face это ai-sage/GigaChat3.5-432B-A28B (bf16 и GGUF), плюс зеркало на GitVerse. Архитектура - MoE на 432 млрд параметров при 28 млрд активных, гибрид MLA и GatedDeltaNet. Модель на ~40% компактнее прошлой 3.1 Ultra на 700B, KV-кэш урезан вчетверо, генерация быстрее на 20% (MTP разгоняет до 2,2×).
...проверка гипотезы, что гибридную архитектуру с линейным вниманием можно довести до сотен миллиардов параметров, не разменивая качество на скорость.
- команда GigaChat (Сбер), Habr, 6 июля 2026
Вот тут и стыкуется с темой статьи. MIT-лицензия звучит как «бесплатно ставь на свой сервер». Реальность: FP8-версия GigaChat 3.5 Ultra требует ~432 ГБ VRAM, а это 8×H100 или H200. Bf16 - ~865 ГБ, уже мультинода. Даже 4-bit GGUF - 220-250 ГБ, четыре топовых карты. Открытая giga нейросеть от Сбера self-host-абельна только для того, у кого уже стоит кластер корпоративного уровня. Для всех остальных гига чат остаётся облачным сервисом с официального сайта developers.sber.ru за рубли, и это нормальный сценарий.
Та же история с любой большой открытой моделью - DeepSeek V4, GLM-5.2, Qwen3 235B. Веса открыты и бесплатны, но full-precision версии требуют кластеров. «Открытая» и «дешёвая в эксплуатации» - разные характеристики, и вторую оплачивает твой инженер и твоё электричество. Когда в чате хвалятся, что «поставили нейросеть от Сбера себе», в 99 случаях из 100 речь про облачный API или про сильно урезанный квант на паре карт с несерьёзной скоростью.
Суверенитет данных - главная настоящая причина ставить своё
Главное. Единственный повод, который реально оправдывает своё железо в 2026, - это суверенитет данных и регуляторика. 152-ФЗ требует первичной записи персональных данных на серверах в РФ, GigaChat API запрещает слать ПДн в запросах, а self-hosting даёт локализацию автоматически. Для банков и КИИ на кону сама допустимость обработки, и стоимость тут второстепенна.
Здесь своё железо оправдано контролем над данными, и окупаемость в токенах роли не играет вообще. Это единственная развилка, где ответ «ставь своё» не зависит от объёма нагрузки.
152-ФЗ (статья 18, часть 5) требует: первичная запись персональных данных россиян - на серверах в РФ. Есть нюанс: вызов модели трактуется как обработка и под требование о хранении в РФ формально не подпадает, и если первичная запись легла в российскую базу, локализация соблюдена даже при обращении к внешней модели. Но дальше начинаются ограничения по конкретным сервисам.
GigaChat API прямо запрещает отправлять ПДн в запросах. Yandex Cloud разрешает - через договор поручения и аттестацию. Отправка в OpenAI, Anthropic или Google - это трансграничная передача.
С трансграничкой важен нюанс юрисдикции. Китай (а значит и дипсик нейросеть DeepSeek) считается «адекватной» юрисдикцией - передача возможна после уведомления. США (OpenAI, Anthropic, Google) требуют ожидания 10 рабочих дней после уведомления Роскомнадзора. Self-hosting снимает вопрос целиком: всё остаётся в контуре РФ, локализация автоматическая, никаких договоров поручения и уведомлений.
Для банков и КИИ это уже не выбор из соображений экономии. Совкомбанк оценивает масштаб суверенной инфраструктуры прямо: по оценке главного аналитика банка Дмитрия Трошина (tks.ru, 22 июня 2026), суверенный ИИ-ЦОД уровня DeepSeek V4-класса - это не менее 300 МВт мощности и капзатраты порядка 1,2 трлн рублей.
Это верхний предел спектра. Полный цикл обучения LLM с нуля в России, по оценке Совкомбанка, текущих мощностей ЦОД, вероятно, не потянет.
Между «свой ИИ-ЦОД на 1,2 трлн» и «шлём всё в чужое облако» есть рабочие решения. On-premise ПАК Cotype от MTS AI работает «без внешних серверов» и целится в банки и КИИ - туда, где данные не должны покидать периметр ни при каких условиях. МТС вложила в направление 1 млрд ₽. Базой суверенного стека служат открытые MIT-модели: DeepSeek V4, GLM-5.2, GigaChat 3.5 - их можно поднять в своём контуре, если есть железо.
Для корпоративного контура инфраструктура self-hosted LLM оценивается в 40-60 млн ₽, а кластер 8×H200 под DeepSeek-класс становится «стратегическим активом» - строкой в балансе. Логика тут простая: определённые данные юридически или по риск-модели нельзя выпускать за периметр, и тогда своё железо остаётся единственным допустимым вариантом, сколько бы оно ни стоило.
Запомни разделение. Если ты считаешь окупаемость в токенах и она не сходится (а она чаще всего не сходится) - это сигнал уходить в облако или гибрид. Если вопрос стоит как «эти данные не имеют права оказаться в чужой юрисдикции» - тогда предмет расчёта меняется: ты считаешь стоимость соответствия закону, и окупаемость тут вообще ни при чём.
Стек для запуска: vLLM, Ollama, llama.cpp - что и когда
Главное. Прод-дефолт 2026 - vLLM (
vllm serve <model>, PagedAttention до 24× throughput). Для агентов и RAG с общими префиксами - SGLang (RadixAttention до 6,4×). Прототип на своём ПК - Ollama (ollama run qwen3:8b). Любое железо и экзотика - llama.cpp с GGUF. TGI с 11.12.2025 в maintenance mode - в новые проекты не брать.
Если своё железо всё-таки оправдано (суверенитет, стабильная высокая нагрузка), вот чем это поднимают. Правильный выбор стека экономит недели инженерного времени.
Стек для запуска нейросети на сервере (июль 2026)
| Инструмент | Когда брать | Фишка |
|---|---|---|
| vLLM (ветка v0.24, июнь 2026) | прод-дефолт, серьёзная нагрузка | PagedAttention, до 24× throughput |
| SGLang | агенты, RAG, общие префиксы | RadixAttention до 6,4×, DeepSeek MLA 3,1× |
| Ollama | прототип, дев, «нейросеть на пк» | одна команда, OpenAI-совместим |
| llama.cpp | любое железо, экзотика | минимум зависимостей, GGUF |
| TensorRT-LLM | NVIDIA-only, максимум скорости | FP8 |
| KTransformers | длинный контекст, MoE | оптимизация под большие модели |
| TGI | не брать | maintenance mode с 11.12.2025 |
Немного цифр, чтобы выбор был предметным. vLLM с PagedAttention выдаёт до 24× throughput против наивной реализации - это де-факто дефолт для прода. SGLang с RadixAttention выигрывает на общих префиксах (типичный кейс агентов и RAG, где системный промпт повторяется): на бенче Llama3.1-8B/H100 он даёт ~16200 токенов в секунду против ~12500 у vLLM, это +29%. На DeepSeek с механизмом MLA SGLang ускоряется до 3,1×. Так что для ИИ-ассистентов программирования и агентных пайплайнов с длинным общим контекстом SGLang часто предпочтительнее.
Как установить нейросеть для прототипа - буквально одна команда Ollama:
ollama run qwen3:8b
Для прода на своём кластере дефолт - vLLM:
vllm serve deepseek-ai/DeepSeek-V4-Flash
vLLM даёт OpenAI-совместимый эндпоинт из коробки, и это важно для гибрида: код, который ходит в облачный API, переключается на локальную нейросеть сменой base_url. Тот же принцип работает и в обратную сторону - с локального стека на облако.
Как это подключить из России
Гибрид удобен тем, что и локальный vLLM, и облако говорят на одном протоколе - OpenAI-совместимом. Пайплайн, который сегодня ходит в свою нейросеть, завтра ходит в облачную сменой двух строк - ключа и адреса.
from openai import OpenAI
client = OpenAI(
api_key="PROVOD_API_KEY",
base_url="https://api.provod.ai/v1", # OpenAI-совместимый эндпоинт
)
resp = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Проверка связи"}],
)
print(resp.choices[0].message.content)
Так из России заводятся Claude Code, Cursor, n8n и любой код на OpenAI- или Anthropic-SDK - один ключ вместо пяти, оплата в рублях. Подробности - на provod.ai.
Честная граница. Агрегатор закрывает доступ к облачным моделям и оплату в рублях. Но там, где нужен именно суверенитет, он своё железо не заменяет: air-gap, хранение ПДн в своём контуре, fine-tuning под свои данные - это ровно то, ради чего ставят собственный сервер под нейросеть, и агрегатор эти задачи не решает. Для облачных моделей он дешевле и проще, для суверенного контура понадобится своё.
Ещё раз про TGI: он ушёл в maintenance mode 11 декабря 2025. Гайды в интернете всё ещё советуют его по инерции - игнорируй, в новые проекты бери vLLM или SGLang. llama.cpp держи для экзотики: разношёрстное железо, ноутбук, одноплатник, любой GGUF - когда нужен сам факт запуска нейросети на компьютере, а скорость вторична.
5 ошибок, из-за которых своя нейросеть выходит дороже облака
Главное. Пять антипаттернов топят экономику: двухстрочная TCO-модель без инженера, роутинг без quality-gate, health-check 200 OK как признак здоровья, экстраполяция опыта с ноутбука на прод и слепая вера, что квантование бесплатно. Каждый из них незаметно, но стабильно делает своё железо дороже облака.
Разберём по одной, с парой «должно / не должно».
Ошибка 1. Двухстрочная TCO-модель. Считать только GPU и электричество.
- Не должно: «карта + розетка = дешевле облака».
- Должно: четыре строки - GPU, электричество, инженер, простой. Умножай цену аренды на 1,3-2,0 минимум.
Ошибка 2. Роутинг без quality-gate. Гнать запросы на дешёвую модель без проверки качества.
- Не должно: «экономим 80%, метрики затрат упали, отлично».
- Должно: 50-500 кейсов в CI, которые ловят просадку качества до того, как её заметят пользователи.
Ошибка 3. Health-check 200 OK как индикатор здоровья. Считать зелёный дашборд признаком живой нейросети.
- Не должно: «error rate ноль, значит всё работает».
- Должно: мерить латентность под нагрузкой. Эндпоинт может отдавать 200 OK и думать 30 секунд - это авария, которую нельзя считать нормой.
Ошибка 4. Экстраполяция опыта с ноутбука на прод. «У меня Ollama на макбуке летает, значит и в проде взлетит».
- Не должно: путать демо на одном пользователе с нагрузкой команды.
- Должно: Ollama-стеки не рассчитаны на тысячи одновременных запросов; для прода - vLLM или SGLang и нагрузочное тестирование.
Ошибка 5. Вера, что квантование бесплатно. Ужать модель до Q4 и ждать того же качества.
- Не должно: «Q4 экономит VRAM, качество то же».
- Должно: помнить, что модель, надёжная на FP16, на Q4 ломает JSON-схемы и теряет качество на длинном контексте. Тестируй именно квантованную версию.
Типовой финал провального пилота описан точно (Habr/OTUS, март 2025): сервер встал, инференс падает раз в неделю, Q4 просел по качеству, и через три месяца команда уезжает обратно на API - с разочарованием и потраченным бюджетом. Все пять ошибок ведут в одну и ту же точку. Добавь сюда «налог на ошибку» разработки: пока пилишь агента, каждый прогон - 5-10 вызовов модели, и на своём нестабильном контуре отладка растягивается вдвое.
Что выбрать: своё железо, аренда GPU или облачный API?
Главное. Облачный API - дефолт для низкой и средней нагрузки (до ~250 млн токенов в месяц) и для команд без GPU-опыта. Аренда GPU - если нужна конкретная модель под контролем, но без капзатрат. Своё железо - только при стабильной высокой нагрузке (сотни миллионов - миллиарды токенов при загрузке 60-70%+) ИЛИ при жёсткой регуляторике. Дефолт для большинства - гибрид.
Дерево решений (отвечай по порядку)
- Данные нельзя выпускать за периметр (152-ФЗ строго, КИИ, банковская тайна)? → Да: своё железо или on-premise ПАК, окупаемость не считаешь. → Нет: дальше.
- Нагрузка стабильно выше ~250 млн токенов в месяц при загрузке 60-70%? → Нет: облачный API или гибрид, точка. → Да: дальше.
- Есть выделенный инженер с опытом vLLM/квантования (или бюджет на 2-3,5 FTE)? → Нет: аренда GPU или гибрид, покупку не тяни. → Да: дальше.
- Нагрузка предсказуемая, не рваная, не экспериментальная? → Да: считай своё железо всерьёз. → Нет: гибрид.
Матрица выбора
| Вариант | Когда | Плюс | Минус |
|---|---|---|---|
| Облачный API | низкая/средняя нагрузка, нет GPU-опыта | ноль капзатрат, эластичность, свежие модели | данные уходят в чужой контур |
| Аренда GPU | нужна своя модель без покупки | контроль модели, нет капзатрат | 246 тыс ₽/мес за H100 быстро догоняет API |
| Своё железо | регуляторика ИЛИ высокая стабильная нагрузка | суверенитет, окупается на миллиардах | 60-75% сметы - люди, простой убивает |
| Гибрид | почти все остальные | -40-85% счёта, приватность рутины | нужен quality-gate |
Для подавляющего большинства команд правильный ответ - облако или гибрид. Своё железо оправдано на двух полюсах: жёсткая регуляторика (считаешь стоимость соответствия закону) и промышленная стабильная нагрузка с выделенной командой. Всё, что посередине, дешевле и надёжнее закрывается облачным API - в том числе для российских пользователей, которым нужен доступ в рублях без VPN. Начни с облака или гибрида, а на своё железо переходи, только когда упрёшься в конкретную стену - регуляторную или нагрузочную.
Частые вопросы
Главное. Короткие ответы на частые вопросы про экономику self-hosting: где официальный сайт GigaChat и сколько он стоит, с какого объёма токенов окупается своя GPU, можно ли поднять GigaChat 3.5 Ultra на своём сервере, где взять Claude и GPT в рублях без VPN и почему гибрид дешевле и облака, и своего железа.
Гига чат официальный сайт нейросеть - где это и сколько стоит?
Гига чат официальный сайт нейросеть от Сбера отдаёт по адресу developers.sber.ru плюс через веб и приложение ГигаЧат. Для API нужен корневой сертификат Минцифры. Тарифы на июль 2026: Free - 1 млн токенов на 12 месяцев; физлица с 01.02.2026 - 0,2 ₽ за 1000 токенов при минимуме 600 ₽/мес; юрлица - 20 млн Lite за 1300 ₽, 100 млн за 6500 ₽. Это облачный доступ, своё железо не нужно.
Где взять доступ к Claude, GPT и DeepSeek в рублях без VPN?
Агрегатор нейросетей provod.ai даёт Claude, GPT, Gemini, DeepSeek и Qwen в одном чате и через единый API из России - оплата в рублях картой РФ, СБП или по счёту с закрывающими для юрлиц, без VPN и зарубежных карт. Цены 1:1 с официальными тарифами. Детали - на provod.ai.
Сколько токенов в месяц нужно, чтобы своя GPU окупилась?
Зависит от того, с каким API сравниваешь. Против премиум-моделей - от ~256 млн токенов в месяц. Против дешёвого DeepSeek V4 Flash - только с ~5,7 млрд токенов на одном H100 (Digital Applied, 27.05.2026). И то при загрузке GPU 60-70%.
Можно ли поставить GigaChat 3.5 Ultra на свой сервер?
Технически да - модель открыта под MIT на Hugging Face (ai-sage/GigaChat3.5-432B-A28B). Но FP8-версия требует ~432 ГБ VRAM, это 8×H100/H200 - кластер корпоративного уровня, а не «поставил на свой ПК».
Почему гибрид дешевле и своего железа, и облака?
Потому что снимает главную боль self-hosting - простой GPU. Рутину и приватные данные гонишь через локальную нейросеть, сложное и редкое - через облачный API по факту. Экономия 40-85%, реальный кейс - $47K → $8K/мес.
Сделай прямо сейчас
Не поднимай кластер вслепую. Сними метрику утилизации на арендованной GPU под своей реальной нагрузкой неделю, посчитай смету по четырём строкам (GPU, электричество, инженер, простой) и сравни с ценой API за задачу. Если порог окупаемости не сходится - а против дешёвого API он почти никогда не сходится - бери облако или гибрид. Своё железо оставь на случай, когда упрёшься в регуляторную стену.
Проверь любую модель из этой статьи за пять минут: на provod.ai все флагманы - Claude, GPT, Gemini, DeepSeek, Qwen - в одном чате и через единый API, оплата в рублях с карты РФ, для юрлиц - договор и закрывающие. Без VPN, без наценки. Если окупаемость своего железа у тебя не сходится - это самый быстрый способ получить сильную нейросеть в рублях, не поднимая кластер.
Была полезна статья? Поделись в комментариях, с какой нагрузки у тебя окупается своё железо - и окупается ли.
Источники
- Digital Applied Team. TCO frontier для self-hosting LLM. 24 апреля 2026.
- Digital Applied Team. Decision Guide: точки окупаемости против API. 27 мая 2026.
- Digital Applied Team. Routing и гибридная экономия 40-85%. 14 июня 2026.
- Braincuber (Mayur Domadiya, CEO). Расчёт «733× дороже» на Azure. 10 марта 2026.
- Baseten / GMI Cloud. Практический break-even ~500 млн токенов/мес.
- aisuperior.com. Порог «5-10 млн токенов» только для премиум-API.
- MindStudio. Пороги нагрузки для локального железа. 27 мая 2026.
- kore1.com. Зарплаты MLOps и LLM-serving инженеров в США. Апрель 2026.
- TRG Datacenters. TDP H100 SXM5 700 Вт.
- Spheron.network. Стоимость электричества кластера 1000×H100 по регионам.
- RunPod, Vast.ai, Lambda, Modal, Together. Тарифы аренды H100 on-demand.
- wccftech.com, Tom's Hardware. Цены RTX PRO 6000 Blackwell, RTX 5090.
- Habr (CPO финтех-компании). «60-75% стоимости self-host - это люди». 17 апреля 2026.
- Habr / OTUS (Анастасия Нечепоренко). Типовой провал self-host-пилота. 10 марта 2025.
- Akamai (Du'An Lightfoot, Senior AI Engineer). «200 OK и 30 секунд на ответ». 18 июня 2026.
- KDnuggets (Nahla Davies). «Разрыв между "работает" и "работает хорошо"». 29 апреля 2026.
- RouteLLM (ICLR 2025). 85% экономии при 95% качества GPT-4.
- developers.sber.ru. Тарифы и сертификаты GigaChat. Июль 2026.
- Hugging Face. ai-sage/GigaChat3.5-432B-A28B (MIT).
- Habr / Сбербанк. Анонс GigaChat 3.5 Ultra и цитата про гибридную архитектуру. 6 июля 2026.
- digital-razor.ru. Требования VRAM для self-host GigaChat 3.5 Ultra. 6 июля 2026.
- Совкомбанк (Дмитрий Трошин). Капзатраты суверенного ИИ-ЦОД 1,2 трлн ₽. tks.ru, 22 июня 2026.
- DZ Systems (Дмитрий Завалишин). «С видеокартами ситуация критическая». newsinfo.ru, 9 июля 2026.
- Immers.cloud. Тарифы аренды H100/A100 в рублях. Проверка 11 июля 2026.
- TINVEST. Цена H100 у РФ-дилера 3 485 187 ₽.
- Хабр. 152-ФЗ и обработка ПДн в LLM. 2026.
- MTS AI / MWS. Cotype on-premise. 2026.
- Курс ЦБ РФ на 10 июля 2026: 75,93 ₽/$.
provod.ai — управляемая работа команды с внутренними материалами
Когда AI помогает анализировать договоры, отчёты или базу знаний, личные аккаунты становятся риском: отдельные пользователи, роли и общий корпоративный контур упрощают контроль доступа.
В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.
Безопасная организация работы не меняет тариф модели: официальная стоимость действует 1:1, без собственной наценки provod.ai.
Организуйте доступ к внутренним данным: форма регистрации · цены на модели · защита данных по 152-ФЗ · политика обработки данных




Top comments (0)