Применить за 25 минут · Сэкономит: месяцы и бюджет на мёртвых agentic-пилотах · Уровень: средний · Чтение: ~30 минут · Данные актуальны на 2026-07-10
Ты видел это демо. AI-агент сам разбирает входящие тикеты, лезет в базу, оформляет возврат, пишет клиенту вежливый ответ и закрывает задачу за секунды. CTO кивает, бюджет выделяют, начинается пилот. Проходит полгода. В прод не выехало ничего: на живых данных агент путает клиентов, лезет туда, куда не должен, а когда ошибается - непонятно, кто за это отвечает.
Так вот, это не твоя личная неудача. Gartner прогнозирует, что больше 40% корпоративных проектов с AI-агентами закроют к концу 2027 года. А из тысяч вендоров, которые называют свой продукт «агентным», настоящих - около 130. Остальное - переупакованные чат-боты. И самое неприятное: ломается всё в самом неожиданном месте, и почти никогда - в самих моделях.
Кстати про доступ. Гонять эти самые модели из России, чтобы вообще проверить свою идею с агентом, можно тремя путями: зарубежная карта, реселлеры с наценкой сверху и агрегаторы вроде provod.ai, где Claude, GPT, Gemini, DeepSeek и Qwen доступны в рублях по официальным тарифам. Дальше покажу, где агрегатор снимает боль, а где надёжность агента остаётся на тебе.
Для контекста: provod.ai - это агрегатор нейросетей для пользователей из России: Claude, GPT, Gemini, DeepSeek и Qwen в одном чате и через единый API (OpenAI- и Anthropic-совместимый), с оплатой в рублях легально, без VPN и зарубежных карт, с договором и закрывающими документами для юрлиц.
Главное за 30 секунд. Gartner прогнозирует отмену больше 40% agentic-проектов к концу 2027 из-за роста издержек, размытой бизнес-ценности и слабого контроля рисков. Из тысяч «агентных» вендоров настоящих около 130 - остальное agent-washing, старые продукты под новым ярлыком. Беда почти нигде не в моделях: она в разрыве между демо и продом, в governance и в том, что за действия автономного агента некому отвечать. Лечится узкой задачей, человеком в контуре и eval-обвязкой на реальных данных.
Что узнаешь из разбора:
- Что дословно сказал Gartner про 40% отмен и кто это сказал - с датами и цитатами.
- Откуда взялась цифра «130 настоящих агентов из тысяч» и как самому отличить агента от перекрашенного чат-бота.
- Где именно рвётся путь от успешного демо к рабочему проду - и почему по разным замерам 2026-го от трёх четвертей до девяти десятых пилотов туда не доезжают.
- Почему прогон AI-агента дорожает, хотя цена токена за три года упала почти на 98% - с реальным RU-кейсом и цифрами.
- Что делают команды, которые всё-таки довели ИИ-агента до прода - чек-лист перед запуском.
Что пообещали AI-агенты - и почему это не сошлось?
Коротко: В 2024-2025 индустрия продавала автономных цифровых «сотрудников», которые сами доводят задачи до конца. К 2026-му пришло отрезвление: вместо сотрудников получились дорогие POC. При этом интерес огромный - по опросу Gartner на 3412 участников почти пятая часть компаний уже вложилась в agentic всерьёз. Вопрос в том, почему при таком спросе половину проектов собираются закрыть.
Разберёмся, что вообще обещали. Картинка была красивая: автономный агент сам ставит цель, разбивает её на шаги, дёргает нужные инструменты, проверяет результат и повторяет, пока не сделает. Обычный чат-бот отвечает на вопрос и замолкает, а этот берётся довести дело до конца самостоятельно. Виртуальный сотрудник, который не спит, не устаёт и стоит копейки. Под это поднимали раунды, писали лендинги и запускали пилоты - десятками, в каждой второй крупной компании.
Спрос был не выдуманный. По опросу Gartner, проведённому в январе 2025 года на 3412 участниках, картина такая: 19% организаций уже вложились в agentic AI значимо, 42% инвестировали консервативно, 8% не вкладывались вообще, а 31% выжидали или присматривались. То есть больше половины рынка уже так или иначе занесли деньги, а ещё треть держит руку над кошельком. Занос денег в agentic стал мейнстримом корпоративного бюджета 2025 года.
Подогревало всё это с двух сторон. Вендоры показывали идеально отрепетированные демо и обещали «цифровых сотрудников» под ключ, а на слайдах инвесторов «год ИИ-агентов» стоял главным пунктом стратегии. Внутри компаний менеджеры не хотели остаться теми, кто «проспал агентов», и запускали пилот, чтобы было что показать на следующем совете. В итоге деньги пошли под общую идею «нам нужен agentic AI», без конкретной измеримой задачи за ними. Ровно эту болезнь Verma из Gartner потом и опишет словом «misapplied» - применяют не по делу. Хайп сам по себе не порок, но когда он подменяет постановку задачи, пилот стартует без ответа на вопрос «а что конкретно мы хотим от агента и как поймём, что получилось».
А теперь контраст. За 2024-2025 эти пилоты массово запускали, и к 2026-му пошла волна ревизии: бюджеты кончились, отчётный период настал, и кто-то должен объяснить совету директоров, что дал agentic-проект. Выяснилось, что чаще всего он дал впечатляющее демо и счёт за токены. Обещали автономного сотрудника - получили эксперимент, который на чистых тестовых данных работает, а на боевых сыпется.
Именно на этом стыке - огромный интерес и мало доехавших до прода проектов - и появляются громкие прогнозы про отмены. Дальше я разбираю, что дословно сказал Gartner, откуда цифра 40% и почему беда AI-агентов почти никогда не сидит в самих моделях. Начну с первоисточника, потому что вокруг него уже наросло много искажений.
Что на самом деле сказал Gartner про 40% отмен?
Коротко: Gartner в пресс-релизе от 25 июня 2025 года прогнозирует, что больше 40% проектов с agentic AI будут отменены к концу 2027 - из-за роста издержек, размытой бизнес-ценности и слабого контроля рисков. Спикер - Anushree Verma, Senior Director Analyst. При этом тот же релиз даёт оптимистичный прогноз на 2028. Это прогноз чистки перед ростом, а не приговор технологии.
Сначала точная формулировка, потому что её постоянно перевирают. Пресс-релиз Gartner от 25 июня 2025 года называется «Gartner Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027». Дословный тезис: больше 40% проектов с agentic AI будут отменены к концу 2027 года из-за роста издержек (escalating costs), размытой бизнес-ценности (unclear business value) и слабого контроля рисков (inadequate risk controls). Спикер - Anushree Verma, Senior Director Analyst в Gartner.
Теперь её собственные слова. Первая цитата описывает, в каком состоянии сейчас находится рынок AI-агентов.
«Most agentic AI projects right now are early-stage experiments or proof of concepts that are mostly driven by hype and are often misapplied.»
- Anushree Verma, Gartner, 25 июня 2025
Перевод в живой речи: большинство нынешних проектов с ИИ-агентами - это ранние эксперименты и proof of concept, которые движет в основном хайп, и применяют их часто не по делу. То есть Verma не говорит «технология не работает». Она говорит другое: инструмент суют не туда и без плана.
Вторая цитата - про деньги, и она объясняет ту самую строчку «рост издержек».
«When you add orchestrators, governance layers, and multiple agents, costs start escalating very quickly.»
- Anushree Verma, Gartner, 25 июня 2025
Перевод: как только ты добавляешь оркестраторов, слои управления и несколько агентов сразу, издержки начинают расти очень быстро. Запомни этот момент - к цифрам про деньги я вернусь в отдельном разделе, там будет живой RU-кейс, где счёт за одну задачу вырос в десять раз ровно по этой причине.
Есть и третий тезис Verma, про зрелость моделей. Она формулирует его так: у текущих моделей пока нет достаточной зрелости и «агентности», чтобы автономно достигать сложных бизнес-целей и держать нюансы инструкций во времени. Здесь важно не переусердствовать с выводом. Модели не тупые - у них пока не хватает зрелости, чтобы тянуть полную автономию на сложных многошаговых целях без человека рядом. Разница принципиальная, и вокруг неё построена вся практическая часть разбора.
⚠️ Не путай прогноз с приговором. «40% отменят» не равно «agentic AI провалился». В том же релизе от 25 июня 2025 года Gartner даёт встречный прогноз: к 2028 году не меньше 15% ежедневных рабочих решений будут приниматься автономно через agentic AI - против 0% в 2024-м. И 33% корпоративного софта будут включать agentic-возможности к 2028 году - против меньше 1% в 2024-м. Сначала чистка, потом рост. Одно не отменяет другое.
Почему тогда прогноз звучит так пугающе? Потому что заголовок про 40% отмен отлично расходится, а вторую половину релиза - про рост к 2028-му - цитируют куда реже. Отсюда искажённое ощущение, что Gartner похоронил AI-агентов. Он их не хоронил. Он описал нормальную фазу хайп-цикла, когда рынок отсеивает то, что было продано на голом ажиотаже.
Хорошо это сформулировал обозреватель Forbes Robert J. Szczerba в разборе того же прогноза от 7 июля 2026 года: «A demo is a promise. Production is a contract.» Демо - это обещание, прод - это контракт. К его тексту я ещё вернусь, там есть очень точный термин про то, где именно рвётся путь от обещания к контракту.
Что такое agent-washing и почему настоящих ~130?
Коротко: Agent-washing - термин Gartner: старый продукт (AI-ассистент, RPA-бот, чат-бот) переупаковывают под «агента» без реальной автономности. По оценке Gartner, из тысяч вендоров, заявляющих agentic AI, настоящих около 130. Настоящий агент сам ставит и достигает цель через многошаговые решения без пошагового управления человеком. Перекрашенный чат-бот - нет. Ниже даю тест, как отличить одно от другого.
Термин ввёл Gartner в том же контексте, и он объясняет, откуда берётся разрыв между тысячами «агентов» и сотней настоящих. Agent-washing - это переупаковка существующих продуктов под ярлык «агент» без реальных агентных возможностей. По формулировке Gartner, под этот ярлык массово перекрашивают три вещи: AI-ассистентов, RPA-ботов (роботизированная автоматизация процессов) и обычных чат-ботов.
Аналогия простая. Как «эко» и «натуральное» лепят на всё подряд, чтобы продать дороже, так «agentic» и «автономный агент» лепят на софт, который автономным не является. Маркетологи поменяли слайды, продукт остался прежним. Отсюда и цифра: Gartner оценивает, что из тысяч вендоров, продающих себя как agentic AI, реальны лишь около 130. Forbes в разборе от 7 июля 2026 года эту оценку подтверждает и добавляет, что большинство «агентных» решений на деле разворачивают обычных чат-ботов.
Что отличает настоящего AI-агента от перекрашенного? Реальный агент сам ставит цель или получает её в общем виде, сам планирует путь, сам принимает многошаговые решения и сам дёргает инструменты - без того, чтобы человек вёл его за руку на каждом шаге. Перекрашенный чат-бот делает один заранее прописанный сценарий: получил запрос, вызвал одну функцию, вернул ответ. Между ними пропасть в архитектуре, но на демо-слайде они выглядят одинаково.
Вот практический тест из четырёх признаков - им можно проверить любого «агента», которого тебе продают.
- Многошаговость без подсказки. Спроси, сколько решений агент принимает сам между постановкой задачи и результатом. Если ответ «одно» - перед тобой чат-бот с кнопкой, называть его автономным агентом рановато.
- Работа с инструментами по своей инициативе. Настоящий ИИ-агент сам выбирает, какой инструмент дёрнуть и когда. Если список действий жёстко зашит в сценарий - это RPA под новой вывеской.
- Реакция на непредвиденное. Спроси, что агент делает, когда что-то пошло не по плану: данные кривые, инструмент вернул ошибку. Настоящий агент перепланирует. Перекрашенный - падает или отдаёт заглушку.
- Автономность во времени. Держит ли агент цель и контекст на длинной цепочке шагов, не теряя нить после одного обмена репликами. Это ровно та «зрелость», про нехватку которой говорила Verma.
🚨 Критично для тех, кто выбирает вендора. Если продавец показывает только отрепетированное демо и уходит от вопроса «покажи на наших данных и с нашими доступами» - почти наверняка перед тобой agent-washing. Настоящую автономность видно на грязных данных и в нештатных ситуациях, а на подготовленном сценарии её не проверить. Требуй пилот на своём контуре до того, как подпишешь контракт, - это отсекает большую часть из тех тысяч ненастоящих агентов.
Проверить это на настоящих моделях, а не на маркетинговом слайде, из России можно без плясок с VPN. В агрегаторе provod.ai Claude, GPT и Gemini живут в одном чате и в одном API, платишь картой РФ по официальному тарифу - реселлеры за то же обычно берут на 15-25% больше.
Различать это важно не ради чистоты терминов. Когда половина рынка зовёт агентом обычный чат-бот, статистика отмен и провалов смешивается. Часть «провалов agentic AI» - это провалы чат-ботов, которым навесили лишних ожиданий. Поэтому дальше я развожу два разных вопроса: где ломаются настоящие агенты и где ломается сам путь от демо к проду - у любого, даже честного, продукта.
Почему успешный пилот не доезжает до прода?
Коротко: Обозреватель Forbes Robert J. Szczerba (7 июля 2026) назвал это «capability-deployment verification gap»: агент умеет задачу в контролируемом тесте, но бизнес не может проверить и доверить ему её в бою. Демо живёт на чистых данных, прод - на проприетарных системах, доступах и ответственности. По замерам 2026-го от трёх четвертей до девяти десятых пилотов до прода не доезжают.
У этого разрыва есть точное имя. Robert J. Szczerba в Forbes от 7 июля 2026 года называет его «capability-deployment verification gap» - разрыв между способностью и проверяемым внедрением. Его формулировка: «the agent can do the task in a controlled test, but the business can't verify or trust it once it runs against proprietary systems and live data». Агент умеет задачу в контролируемом тесте, но бизнес не может проверить её и довериться агенту, когда тот работает в бою - против проприетарных систем и живых данных.
Почему так выходит. Демо живёт в тепличных условиях: чистые данные, заранее известные кейсы, один сценарий, никакой ответственности за последствия. Прод - это проприетарные системы, реальные доступы к боевым базам, кривые исторические данные, юридическая ответственность за каждое действие и требование всё это проверять. Szczerba пишет прямо: «deployment is harder than the sales deck made it sound» - развёртывание тяжелее, чем это звучало в продающей презентации.
Теперь цифры разрыва. Тут я специально осторожен с атрибуцией, потому что по сети гуляет красивая цифра «77% пилотов не доходят до прода», которую приписывают то Gartner, то ещё кому-то. Единого твёрдого источника у неё нет - разброс по вторичным данным идёт от 77% до 89%. Поэтому даю только то, что атрибутируется честно.
- Forrester (2026, через Forbes). Около 75% предприятий внедряют agentic AI, но до реального прода доходит лишь малая доля. Внедрять начали почти все, довести до боя - единицы.
- IDC (в партнёрстве с Lenovo, 2025). Порядка 88% proof of concept с ИИ-агентами не доезжают до прода: на каждые 33 запущенных POC в прод выходит примерно 4.
- Опрос 650 техлидеров (март 2026). У 78% есть хотя бы один пилот AI-агента, но лишь 14% масштабировали его на всю организацию. Пилот есть почти у всех, дошёл до масштаба - у каждого седьмого.
- MIT, «The GenAI Divide: State of AI in Business 2025» (август 2025). 95% пилотов генеративного ИИ не дают измеримого влияния на P&L. Важно: это про генеративный ИИ в целом, не сугубо про агентов - но именно эта цифра задаёт фон, на котором agentic-провалы выглядят частью большой картины.
- S&P Global (октябрь 2025), 2025 Enterprise AI Survey. 42% компаний забросили большинство своих ИИ-инициатив в 2025 году - против 17% годом раньше. В среднем компании выбрасывают 46% своих POC, не доводя до прода.
Сложи это вместе. Разные конторы мерили по-разному, но диапазон устойчивый: по замерам 2026-го от трёх четвертей до девяти десятых пилотов не доезжают до прода. Цифры разные, источники независимые, а коридор сходится. И почти везде дело в одном: результат нельзя проверить, доверить и встроить в живой процесс. Модель тут чаще всего ни при чём.
⚠️ Совет тем, кто планирует пилот. Заложи в план не «сделать демо», а «пройти проверяемость на боевых данных». Если у тебя нет ответа на вопрос «как мы поймём, что агент не облажался, и как откатим, если облажался» - ты строишь очередной POC из тех 88%, что не доедут. Проверяемость дороже способности. Именно на ней и держится весь разрыв.
Дальше - про деньги, потому что вторая причина смертности после «непроверяемости» звучит как «стало слишком дорого». И это парадокс: токены дешевеют, а агенты дорожают.
Почему AI-агенты столько сжигают - и где утекают деньги?
Коротко: Цена токена рухнула: GPT-4-класс стоил около $20 за 1M токенов в конце 2022 и около $0,40 в начале 2026 - минус ~98% за три года (Epoch AI). А прогон агента подорожал, потому что одна задача - это десятки-сотни вызовов модели плюс раздувание контекста. Реальный RU-кейс: переход на мультиагентную схему поднял стоимость задачи с $0,42 до $4,30. Считать нужно стоимость всей задачи целиком.
Начну с хорошей новости, которую все неправильно интерпретируют. Инференс подешевел резко. По данным Epoch AI, модель класса GPT-4 стоила около $20 за миллион токенов в конце 2022 года и около $0,40 за миллион к началу 2026-го. Это падение примерно на 98% за три года. Логично ждать, что и агенты подешевели в разы. На практике прогон агента дорожает. Вот где собака зарыта.
AI-агент почти никогда не ограничивается одним вызовом модели. На одну задачу их уходят десятки, а то и сотни: спланировал шаг, дёрнул инструмент, получил результат, проверил, перепланировал, дёрнул ещё раз. И каждый следующий вызов тащит за собой всю накопленную историю - контекст раздувается, а платишь ты за токены на входе каждый раз заново. Дешёвый токен, умноженный на сотню вызовов и растущий контекст, превращается в совсем не дешёвый счёт.
Лучшая иллюстрация - живой RU-кейс. На Habr в статье «Мультиагентный хаос» (автор kardanShurup, 23 апреля 2026) описан переход с плоского пайплайна на «командный» мультиагентный сценарий, где несколько агентов общаются между собой. Результат: число вызовов LLM на одну задачу выросло с 14 до 127, а стоимость одной задачи - с $0,42 до $4,30. Почти десятикратный рост. И это ровно то, о чём предупреждала Verma из Gartner: добавили оркестраторов и несколько агентов - издержки полетели вверх.
Отсюда простое правило: чтобы AI-агент тебя не разорял, считай стоимость за всю задачу целиком, а не за отдельный токен. Формула грубая, но рабочая: количество вызовов × средний размер контекста × цена токена. Пока ты смотришь только на «цену за миллион токенов», реальная стоимость от тебя скрыта: её задаёт архитектура агента, число вызовов и размер контекста.
Чтобы прикинуть этот счёт, нужны понятные цены на входе. Ниже - тарифы через provod.ai в рублях за 1000 токенов, вход/выход, один в один с официальными ценами вендоров (реселлеры обычно накидывают сверху +15-25%).
| Модель | ₽ за 1000 токенов (вход) | ₽ за 1000 токенов (выход) | Когда брать в агенте |
|---|---|---|---|
| Claude Opus 4.8 | 0,39 | 1,95 | Сложное планирование, длинные цепочки рассуждений |
| Claude Sonnet 4.6 | 0,23 | 1,17 | Рабочая лошадка: баланс цены и качества |
| GPT-5.5 | 0,39 | 2,34 | Универсал под инструменты и код |
| Gemini 3.1 Pro | 0,16 | 0,94 | Дешевле флагманов, большой контекст |
| DeepSeek V4 Flash | 0,011 | 0,022 | Массовые дешёвые шаги, черновая обработка |
| Qwen3.7 Max | 0,094 | 0,468 | Недорогой сильный вариант для рутины |
Цены через provod.ai, ₽ за 1000 токенов, 1:1 с официальными тарифами вендоров. Данные на 2026-07-10. Проверить актуальные - на provod.ai.
Смотри, что даёт таблица на практике. Один и тот же агент можно собрать на Opus за 1,95 ₽ за 1000 токенов выхода, а можно на DeepSeek V4 Flash за 0,022 ₽ - почти в 90 раз дешевле. Если у тебя сто вызовов на задачу, схема «планировщик на флагмане, чернуха на дешёвой модели» отделяет окупаемого агента от мёртвого пилота на одной только цене прогона. Единый баланс в рублях помогает эту арифметику видеть в одном месте, без сбора расходов по пяти кабинетам с разными валютами.
Прикинем на условном примере. Пусть агент делает 100 вызовов на задачу, и каждый тащит в среднем 3000 токенов накопленного контекста на входе - это 300 тысяч входных токенов на одну задачу. На Opus по 0,39 ₽ за 1000 токенов входа это около 117 ₽ только за вход, на Gemini 3.1 Pro - около 48 ₽, а на DeepSeek V4 Flash по 0,011 ₽ - около 3,3 ₽. Выход добавляется сверху. Разброс на ровном месте - десятки раз, и задаёт его архитектура твоего агента: сколько вызовов, какой контекст и какая модель стоит на каждом шаге. Цена «за миллион токенов» из рекламы вендора тут почти ничего не говорит.
Про API отдельно. Всё это гоняется через единый API, OpenAI- и Anthropic-совместимый: код и тулзы вроде Claude Code, Cursor или n8n переключаются на нужную модель сменой base_url и ключа, без переписывания. Как это выглядит в коде - покажу в разделе про запуск из России, там будет готовый сэмпл. Технически ты дёргаешь один эндпоинт, а под капотом - любая модель из таблицы.
Дешёвый токен обманчив: он создаёт ощущение, что агент почти ничего не стоит, и команда не смотрит на полный счёт до тех пор, пока не приходит выписка за месяц. А там - те самые «escalating costs», из-за которых Gartner и прогнозирует отмену части проектов. Деньги утекают в архитектуре, которая множит вызовы. Прайс за токен тут обманчиво мал.
Три причины, по которым агент падает в реальной работе
Коротко: Настоящие AI-агенты валятся в проде по трём причинам. Первая - каскад ошибок: надёжность на шаге меньше единицы перемножается по длинной цепочке. Вторая - размытая ответственность: когда агент действует сам, непонятно, кто отвечает и как откатывать. Третья - неприметная интеграционная работа (доступы, данные, мониторинг, eval), которой нет в демо. Разбираю каждую с цифрами и RU-голосами.
Причина 1: каскад ошибок по длинной цепочке
Математика беспощадная. Если на одном шаге агент надёжен на 95%, то на цепочке из десяти шагов итоговая надёжность - это 0,95 в десятой степени, около 60%. На двадцати шагах - уже около 36%. Чем длиннее задача, тем вернее провал, даже если каждый отдельный шаг выглядит почти идеальным. Это называется compounding error, накопление ошибки.
Цифры это подтверждают. Проект METR, который меряет надёжность агентов, показывает: горизонт надёжности резко падает с ростом длины задачи. А отдельный замер на retail-задачах в бенчмарке τ-bench от Sierra AI даёт такую картину: pass@1 у GPT-4o - 61%, pass@8 - 25%. Читается так: с первой попытки агент решает задачу в 61% случаев, но стабильно повторить успех восемь раз подряд получается лишь в 25%. Единичный успех не гарантирует, что так будет каждый раз. Проду же нужна именно повторяемость.
Добавь сюда разрыв между лабораторией и боем. По индустриальным обзорам 2026 года, разница между лабораторными бенчмарками и реальной эксплуатацией составляет около 37%, а разброс стоимости выполнения одной и той же задачи доходит до 50 раз в зависимости от того, сколько попыток и перепланирований потребовалось. То, что на бенче выглядит как «решено», в проде оказывается «решено иногда и за непредсказуемые деньги».
Причина 2: размытая ответственность, когда агент действует сам
Когда автономный агент сам совершает действие - оформляет возврат, меняет запись в базе, отправляет письмо клиенту - возникает вопрос, на который у большинства пилотов нет ответа: кто за это отвечает. Разработчик? Владелец процесса? Вендор агента? Эту размытость называют fuzzy accountability. Нет чёткой подотчётности - нет и механизма отката, когда агент ошибётся. А он ошибётся, см. причину 1.
RU-голоса тут звучат честнее любого отчёта. На Habr в комментарии от Claritas (30 мая 2026) сформулировано так: «в агентной системе - вероятность. А вероятность в проде это headache на продакшене». В переводе на человеческий: агент по своей природе вероятностный, а прод не терпит вероятности там, где нужны предсказуемость и ответственность. Каждое «скорее всего правильно» в бою превращается в головную боль эксплуатации.
Причина 3: неприметная интеграционная работа, которой нет в демо
Демо не показывает 80% реальной работы. Доступы к боевым системам с правильными правами, чистка и разметка данных, мониторинг того, что агент вообще делает, eval-обвязка для проверки качества, логирование каждого действия для разбора инцидентов - всё это невидимо на слайде и составляет основную часть трудозатрат в проде. Автор «Мультиагентного хаоса» kardanShurup на Habr (23 апреля 2026) бьёт в ту же точку: «Проблема - в архитектуре оркестрации, которую многие принимают за магию». Никакой магии, только кропотливая инженерия, которую на демо не видно.
Вот как это выглядит в виде «что показывают против что ломается».
| В демо выглядит готовым | В проде ломается |
|---|---|
| Агент решает задачу с первой попытки | Каскад ошибок на длинной цепочке (pass@8 падает вдвое) |
| Чистые заранее подготовленные данные | Кривые проприетарные данные и битые доступы |
| Один аккуратный сценарий | Нештатные ситуации, на которые агент не рассчитан |
| Успешное действие на экране | Некому отвечать за действие и нечем откатить |
| «Просто подключите API» | Мониторинг, eval, логирование, права - месяцы работы |
🚨 Критично: агент с правами на запись без песочницы. Самый дорогой сценарий провала - когда автономному агенту дали боевые права на изменение данных или отправку денег, но не дали песочницу, лимиты и откат. Один каскад ошибок на длинной цепочке - и агент массово наделал действий, которые никто не проверял и которые нельзя отменить. Прежде чем давать агенту право что-то менять в бою, дай ему сначала право только читать и предлагать, а исполнение оставь человеку. Это дешевле любого инцидента.
Все три причины бьют в одно. Настоящий AI-агент падает почти никогда не из-за глупости модели. Валит его другое: длинная автономная цепочка вероятностных решений в живой системе - сложная инженерная задача, которую демо маскирует под магию. Отсюда закономерный вопрос: если всё так, может, вся история с агентами - пузырь?
Значит ли это, что вся история с агентами - пузырь?
Коротко: Нет. Это классический хайп-цикл: пик завышенных ожиданий, отрезвление, потом плато продуктивности. Часть отмен - обычная смертность ИТ-проектов, которая случилась бы и без всякого ИИ. При этом спрос реальный и растёт: по данным UK AI Safety Institute, на выборке 177 000 инструментов агентов доля «действующих» выросла с 24% до 65% за год с небольшим. Чистка отсеет agent-washing, выживут узкие рабочие агенты.
Сначала аргумент, который любят игнорировать сторонники теории «пузырь лопнет». В треде на Hacker News про этот самый прогноз Gartner пользователь dagw задал отрезвляющий вопрос: а какой процент вообще всех софт-проектов, стартовавших за последние 12 месяцев, будет отменён к концу 2027? Мысль простая: ИТ-проекты умирают пачками всегда, безотносительно ИИ. Часть из тех 40% - это обычная базовая смертность стартовавших инициатив, не обязательно специфический провал agentic AI. На фоне общей статистики отмен цифра перестаёт выглядеть апокалиптично.
Есть и встречный скепсис из того же треда. Пользователь bGl2YW5j подметил: «If you define success simply as "not cancelled", then yes, fantastic odds». Если считать успехом просто факт «проект не отменили» - тогда да, шансы отличные. Тонко: «не отменён» не означает «полезен». Проект может тихо жить, жрать бюджет и не давать той самой измеримой пользы, про которую MIT насчитал 95% пустых пилотов. Так что и оптимизм по формуле «выживших много» надо делить на реальную отдачу.
А теперь то, что склоняет чашу к «не пузырь». UK AI Safety Institute изучил выборку из 177 000 инструментов агентов и посчитал долю «действующих» - тех, что реально совершают действия помимо генерации текста. Эта доля выросла с 24% до 65% между концом 2024 и началом 2026 года. Направление однозначное: агенты всё чаще переходят от болтовни к реальным действиям. Спрос не выдуманный, и технология движется в правильную сторону.
Сложи всё вместе, и получится картина обычной санитарной чистки. Крах тут ни при чём. Хайп-цикл работает как всегда: сначала пик завышенных ожиданий, где agent-washing продаёт чат-ботов под видом автономных сотрудников, потом отрезвление, где половину проектов честно закрывают, потом плато продуктивности, где остаются узкие рабочие агенты на понятных задачах. Прогноз Gartner про 40% отмен - это описание фазы отрезвления. Некрологом тут и не пахнет.
Кстати, есть ещё эффект самого прогноза. В том же треде на HN пользователь josefritzishere напомнил про «Gartner effect»: громкий прогноз влияет на рынок сам по себе - кто-то закроет проект просто потому, что «Gartner же сказал». Так что часть будущих отмен - это отчасти сбывающееся пророчество. Но сути это не меняет: рынок отсеет ненастоящее и оставит то, что работает на узких задачах. Вопрос только в том, что именно делают те, кто попадает в выжившие. Об этом - дальше.
Что делают те, кто всё-таки доводит агента до прода?
Коротко: Команды, у которых AI-агент доехал до прода, делают примерно одно и то же. Берут узкую частотную задачу вместо «агента-всё». Держат человека на рискованных шагах. Дают агенту минимум прав и песочницу с откатом. Строят eval-обвязку до масштабирования. Выкатывают из теневого режима в автономию постепенно. Тот самый governance, нехватку которого называют Gartner и Forbes.
Разберём по шагам. Ниже - сводка того, что повторяется у команд, которые пробили capability-deployment verification gap.
Узкая, частотная, высокообъёмная задача. Берут одну конкретную операцию, которую надо делать тысячу раз в день, и строят агента строго под неё. Никаких «агентов, которые делают всё». Узость даёт две вещи: короткую цепочку шагов (меньше каскад ошибок) и понятную метрику успеха. «Агент-всё» проваливается по всем трём причинам сразу, узкий агент - почти ни по одной.
Человек на рискованных шагах (human-in-the-loop). Полная автономия с первого дня - это прямой путь в тот самый инцидент с правами на запись без песочницы. Рабочие команды ставят человека на подтверждение действий, которые что-то необратимо меняют или стоят денег. Агент готовит решение, человек жмёт кнопку. Автономию наращивают потом, по мере накопленной статистики.
Узкие права и песочница (least privilege). Агенту дают ровно те доступы, что нужны для его узкой задачи, и ни одним больше. Сначала право только читать, потом предлагать, и лишь потом, под контролем, - исполнять. Плюс песочница и работающий откат на случай каскада ошибок. Это прямой ответ на fuzzy accountability: если права узкие, а откат есть, цена ошибки ограничена.
Eval-обвязка ещё до масштабирования. Прежде чем катить агента на всю организацию, команды строят измеримые метрики успеха, мониторинг каждого действия и регресс-тесты на реальных данных. Без этого не отличишь «агент работает» от «агенту пока везёт». Именно eval превращает эффектное демо в проверяемый прод - тот самый мост через verification gap.
Из теневого режима в автономию постепенно. Сначала агент работает в shadow-режиме: он принимает решения, но не исполняет их, а его выбор сравнивают с тем, что сделал человек. Накопили статистику, увидели, что агент попадает в цель, - дали ему исполнять часть шагов. Автономию наращивают плавно, участок за участком. Никаких рубильников «включили полную самостоятельность».
Как это выглядит вживую. Агент для возвратов сначала месяц работает в тени: на каждый входящий кейс он предлагает решение (одобрить, отклонить, запросить фото), но кнопку жмёт оператор, а система копит, где агент совпал с человеком, а где разошёлся. Совпадение дошло до 98% на кейсах до 3000 ₽ - агенту отдают автоисполнение только этого узкого сегмента, а всё что дороже и все спорные случаи остаются на человеке. Через квартал сегмент расширяют по той же схеме. Так автономию тут не включают верой в демо - её зарабатывают статистикой на боевом потоке. Ровно этого шага и нет у 88% пилотов, которые пытаются прыгнуть из демо сразу в полную самостоятельность.
Свяжу это с первопричиной. Gartner называет одной из трёх причин отмен слабый контроль рисков (inadequate risk controls), а Forbes - poor governance и insufficient operational discipline. Пять пунктов выше складываются в тот самый governance на практике. Вполне осязаемый: узкая задача, человек в контуре, узкие права, eval и плавный выкат. Команды, которые это делают, попадают в те 14%, что масштабировали пилот. Остальные 88% застревают на POC.
⚠️ Мини-чеклист перед тем, как нести агента в прод. Пробеги по нему честно, до запуска:
- Задача узкая, частотная, с понятной метрикой успеха? Если «агент будет делать много всего» - вернись на шаг назад.
- Есть человек на каждом действии, которое необратимо или стоит денег?
- Права минимальные, есть песочница и рабочий откат?
- Построена eval-обвязка на реальных данных (не только демо-прогон)?
- Есть план плавного выката из shadow в автономию без прыжка сразу «на всю компанию»?
- Понятно, кто отвечает за действие агента и как разбирать инцидент?
Если хотя бы на один пункт ответ «нет» - ты пока на стадии POC, до прода ещё далеко. И это нормальная стадия, если ты про неё честен. Плохо, когда POC несут в бой, не закрыв ни одного из этих пунктов, - вот тогда проект и попадает в статистику отмен.
Как строить и оплачивать AI-агентов из России?
Коротко: Технически запуск из РФ - это единый API-ключ и смена base_url: Claude Code, Cursor, n8n подхватывают его без переписывания кода. Мультипровайдер даёт резерв на случай сбоя одного вендора, единый баланс в рублях - возможность видеть реальные расходы в одном месте. Но честно: агрегатор закрывает доступ и оплату, а надёжность агента - governance, eval, узкая задача, интеграция - остаётся на тебе.
Начну с практики. Чтобы проверить свою идею с агентом на реальных моделях из России, не нужны зарубежная карта и VPN. Схема простая: берёшь единый API-ключ, меняешь base_url в своём коде или инструменте - и всё, что говорит на языке OpenAI или Anthropic, начинает работать. Claude Code, Cursor, n8n и подобные тулзы переключаются на нужную модель сменой двух значений.
Вот как это выглядит в коде.
from openai import OpenAI
client = OpenAI(
api_key="<PROVOD_KEY>",
base_url="https://api.provod.ai/v1", # OpenAI-совместимо; для Anthropic - /v1/messages
)
resp = client.chat.completions.create(
model="claude-opus-4.8",
messages=[...],
)
Две строчки - api_key и base_url - и твой агент дёргает Claude, GPT, Gemini, DeepSeek или Qwen через один эндпоинт. Для Anthropic-совместимого режима меняется путь на /v1/messages, остальное так же. Логику агента переписывать не нужно: тулзы думают, что говорят с привычным провайдером.
Что это даёт помимо доступа. Мультипровайдер - это резерв: если один вендор лёг или ограничил доступ, ты переключаешь модель, а не переписываешь интеграцию и не ждёшь, пока починят. Сервис не зависит от аптайма одного конкретного вендора. Единый баланс в рублях - это возможность видеть полный счёт по всем моделям в одном месте, без сбора расходов по пяти кабинетам с разными валютами и картами. Один ключ вместо пяти, один баланс, закрывающие документы для юрлиц (договор, счёт, акт/УПД) - это через provod.ai.
Теперь честная граница, без которой этот раздел был бы враньём. provod.ai закрывает ровно две вещи: доступ к моделям из России и легальную оплату в рублях. Надёжным твоего агента он не делает. Governance, eval-обвязка, сужение задачи, интеграция с боевыми системами и ответственность за действия агента - всё это по-прежнему на тебе, и ни один агрегатор это за тебя не сделает. Смена base_url решает проблему доступа. Проблему capability-deployment verification gap решают те пять пунктов из предыдущего раздела.
И ещё одна граница, чтобы ожидания были ровными. Если тебе нужны фирменные подписочные фичи конкретного вендора - шеринг Projects или Artifacts, командные пространства внутри продукта вендора - или fine-tuning модели под свои данные, это уже прямая подписка или контур вендора. Агрегатор тут не поможет: его работа - дать доступ к моделям и единый API с оплатой в рублях. За специфичными продуктовыми фичами идёшь к вендору напрямую. Так честнее, и так ты не разочаруешься в инструменте, ожидая от него чужой работы.
Частые вопросы
Коротко: Собрал ответы на реальные запросы про ИИ-агентов: почему они не работают как в демо, что такое agent-washing простыми словами, правда ли Gartner предсказал 40% отмен, сколько стоит гонять агента и как подключить модели из России без VPN. Каждый ответ начинается с прямого ответа, детали - в основных разделах выше.
Почему ИИ-агенты не работают так, как обещали в демо?
Потому что демо и прод - разные среды. Демо живёт на чистых данных и одном отрепетированном сценарии, а прод - на кривых проприетарных данных, реальных доступах и ответственности за каждое действие. Обозреватель Forbes Robert J. Szczerba (7 июля 2026) назвал этот разрыв «capability-deployment verification gap»: агент умеет задачу в тесте, но бизнес не может проверить и доверить ему её в бою. Плюс работает каскад ошибок: надёжность на шаге меньше единицы перемножается по длинной цепочке, и чем длиннее задача, тем вернее провал.
Что такое agent-washing простыми словами?
Это когда старый продукт - AI-ассистента, RPA-бота или обычного чат-бота - переупаковывают под ярлык «автономный агент» без реальной автономности. Термин ввёл Gartner. Как «эко» лепят на всё подряд ради наценки, так «agentic» клеят на софт, где автономностью и не пахнет. Поэтому из тысяч вендоров, называющих себя agentic AI, настоящих, по оценке Gartner, около 130. Настоящий AI-агент сам ставит и достигает цель через многошаговые решения без пошагового управления человеком.
Правда ли, что Gartner предсказал отмену 40% проектов с ИИ-агентами?
Да, но с важными оговорками. В пресс-релизе от 25 июня 2025 года Gartner прогнозирует отмену больше 40% проектов с agentic AI к концу 2027 года - из-за роста издержек, размытой бизнес-ценности и слабого контроля рисков. Спикер - Anushree Verma, Senior Director Analyst. При этом тот же релиз даёт встречный прогноз: к 2028 году не меньше 15% ежедневных рабочих решений будут приниматься автономно через агентов (против 0% в 2024). Это прогноз чистки перед ростом.
Сколько стоит гонять ИИ-агента и почему это дорого?
Токен как раз подешевел - почти на 98% за три года (Epoch AI: около $20 за 1M токенов в конце 2022 против около $0,40 в начале 2026). Дорого выходит из-за архитектуры: одна задача агента - это десятки-сотни вызовов модели плюс раздувание контекста. В RU-кейсе с Habr («Мультиагентный хаос», 23 апреля 2026) переход на мультиагентную схему поднял стоимость одной задачи с $0,42 до $4,30 - почти в десять раз. Поэтому и считать надо стоимость всей задачи целиком.
Как подключить AI-агента и оплатить модели из России без VPN?
Через агрегатор с оплатой в рублях. Берёшь единый API-ключ, меняешь base_url в коде или в тулзе (Claude Code, Cursor, n8n) - и агент дёргает Claude, GPT, Gemini, DeepSeek или Qwen через один эндпоинт, без VPN и зарубежных карт. Через provod.ai это единый баланс в рублях, цены 1:1 с официальными и закрывающие документы для юрлиц - проверить любую модель можно на provod.ai. Доступ и оплату агрегатор закрывает. Надёжность агента - governance и eval - остаётся на тебе.
Проверить любую модель из этой статьи можно за пять минут: на provod.ai все флагманы - Claude, GPT, Gemini, DeepSeek, Qwen - в одном чате и через единый API, оплата в рублях с карты РФ, для юрлиц договор и закрывающие. Без VPN и без наценки.
Источники
- Gartner, пресс-релиз «Gartner Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027», 25 июня 2025. Спикер - Anushree Verma, Senior Director Analyst.
- Forbes, Robert J. Szczerba, «Why 40% Of Agentic AI Projects May Be Canceled By 2027», 7 июля 2026.
- MarTech, разбор прогноза Gartner по agentic AI, 2025.
- MIT, «The GenAI Divide: State of AI in Business 2025», август 2025 (95% пилотов генеративного ИИ без измеримого влияния на P&L).
- S&P Global Market Intelligence, 2025 Enterprise AI Survey, октябрь 2025 (42% забросили большинство ИИ-инициатив; в среднем выбрасывают 46% POC).
- IDC (в партнёрстве с Lenovo), 2025 (около 88% POC с ИИ-агентами не доходят до прода; «на 33 POC - 4 в прод»).
- Forrester, оценка внедрения agentic AI, 2026 (около 75% предприятий внедряют, до прода доходит малая доля).
- Epoch AI, тренд стоимости инференса (GPT-4-класс: около $20 за 1M токенов в конце 2022 против около $0,40 в начале 2026).
- UK AI Safety Institute, анализ выборки из 177 000 инструментов агентов (доля «действующих» выросла с 24% до 65% между концом 2024 и началом 2026).
- METR, замеры горизонта надёжности ИИ-агентов (надёжность резко падает с ростом длины задачи).
- τ-bench (Sierra AI), метрика pass@k на retail-агентских задачах (pass@1 61% против pass@8 25% для GPT-4o).
- Habr, «Мультиагентный хаос», автор kardanShurup, 23 апреля 2026 (рост вызовов LLM с 14 до 127, стоимость задачи с $0,42 до $4,30).
- Habr, комментарий пользователя Claritas, 30 мая 2026 («вероятность в проде это headache на продакшене»).
- Hacker News, тред про прогноз Gartner об отмене 40% agentic-проектов, 2025 (комментарии пользователей dagw, bGl2YW5j, josefritzishere, senko).
provod.ai — единая точка доступа к AI для российского бизнеса
Совместите технический и организационный контуры: модели подключаются через общий API, расчёты идут в рублях, юридические лица получают документы, а команда работает в корпоративном пространстве.
В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.
Доступность из России сочетается с прямой экономикой: официальный тариф модели переносится 1:1, без собственной наценки provod.ai.
Соберите корпоративный AI-контур: форма регистрации · цены на модели · защита данных по 152-ФЗ · реквизиты для договора




Top comments (0)