DEV Community

Cover image for Настоящих AI-агентов - около 130 из тысяч на рынке
Promptra Team for Promptra

Posted on

Настоящих AI-агентов - около 130 из тысяч на рынке

Применить за 25 минут · Сэкономит: месяцы и бюджет на мёртвых agentic-пилотах · Уровень: средний · Чтение: ~30 минут · Данные актуальны на 2026-07-10

Ты видел это демо. AI-агент сам разбирает входящие тикеты, лезет в базу, оформляет возврат, пишет клиенту вежливый ответ и закрывает задачу за секунды. CTO кивает, бюджет выделяют, начинается пилот. Проходит полгода. В прод не выехало ничего: на живых данных агент путает клиентов, лезет туда, куда не должен, а когда ошибается - непонятно, кто за это отвечает.

Так вот, это не твоя личная неудача. Gartner прогнозирует, что больше 40% корпоративных проектов с AI-агентами закроют к концу 2027 года. А из тысяч вендоров, которые называют свой продукт «агентным», настоящих - около 130. Остальное - переупакованные чат-боты. И самое неприятное: ломается всё в самом неожиданном месте, и почти никогда - в самих моделях.

Кстати про доступ. Гонять эти самые модели из России, чтобы вообще проверить свою идею с агентом, можно тремя путями: зарубежная карта, реселлеры с наценкой сверху и агрегаторы вроде provod.ai, где Claude, GPT, Gemini, DeepSeek и Qwen доступны в рублях по официальным тарифам. Дальше покажу, где агрегатор снимает боль, а где надёжность агента остаётся на тебе.

Для контекста: provod.ai - это агрегатор нейросетей для пользователей из России: Claude, GPT, Gemini, DeepSeek и Qwen в одном чате и через единый API (OpenAI- и Anthropic-совместимый), с оплатой в рублях легально, без VPN и зарубежных карт, с договором и закрывающими документами для юрлиц.

Главное за 30 секунд. Gartner прогнозирует отмену больше 40% agentic-проектов к концу 2027 из-за роста издержек, размытой бизнес-ценности и слабого контроля рисков. Из тысяч «агентных» вендоров настоящих около 130 - остальное agent-washing, старые продукты под новым ярлыком. Беда почти нигде не в моделях: она в разрыве между демо и продом, в governance и в том, что за действия автономного агента некому отвечать. Лечится узкой задачей, человеком в контуре и eval-обвязкой на реальных данных.

Что узнаешь из разбора:

  • Что дословно сказал Gartner про 40% отмен и кто это сказал - с датами и цитатами.
  • Откуда взялась цифра «130 настоящих агентов из тысяч» и как самому отличить агента от перекрашенного чат-бота.
  • Где именно рвётся путь от успешного демо к рабочему проду - и почему по разным замерам 2026-го от трёх четвертей до девяти десятых пилотов туда не доезжают.
  • Почему прогон AI-агента дорожает, хотя цена токена за три года упала почти на 98% - с реальным RU-кейсом и цифрами.
  • Что делают команды, которые всё-таки довели ИИ-агента до прода - чек-лист перед запуском.

Что пообещали AI-агенты - и почему это не сошлось?

Коротко: В 2024-2025 индустрия продавала автономных цифровых «сотрудников», которые сами доводят задачи до конца. К 2026-му пришло отрезвление: вместо сотрудников получились дорогие POC. При этом интерес огромный - по опросу Gartner на 3412 участников почти пятая часть компаний уже вложилась в agentic всерьёз. Вопрос в том, почему при таком спросе половину проектов собираются закрыть.

Разберёмся, что вообще обещали. Картинка была красивая: автономный агент сам ставит цель, разбивает её на шаги, дёргает нужные инструменты, проверяет результат и повторяет, пока не сделает. Обычный чат-бот отвечает на вопрос и замолкает, а этот берётся довести дело до конца самостоятельно. Виртуальный сотрудник, который не спит, не устаёт и стоит копейки. Под это поднимали раунды, писали лендинги и запускали пилоты - десятками, в каждой второй крупной компании.

Спрос был не выдуманный. По опросу Gartner, проведённому в январе 2025 года на 3412 участниках, картина такая: 19% организаций уже вложились в agentic AI значимо, 42% инвестировали консервативно, 8% не вкладывались вообще, а 31% выжидали или присматривались. То есть больше половины рынка уже так или иначе занесли деньги, а ещё треть держит руку над кошельком. Занос денег в agentic стал мейнстримом корпоративного бюджета 2025 года.

Подогревало всё это с двух сторон. Вендоры показывали идеально отрепетированные демо и обещали «цифровых сотрудников» под ключ, а на слайдах инвесторов «год ИИ-агентов» стоял главным пунктом стратегии. Внутри компаний менеджеры не хотели остаться теми, кто «проспал агентов», и запускали пилот, чтобы было что показать на следующем совете. В итоге деньги пошли под общую идею «нам нужен agentic AI», без конкретной измеримой задачи за ними. Ровно эту болезнь Verma из Gartner потом и опишет словом «misapplied» - применяют не по делу. Хайп сам по себе не порок, но когда он подменяет постановку задачи, пилот стартует без ответа на вопрос «а что конкретно мы хотим от агента и как поймём, что получилось».

А теперь контраст. За 2024-2025 эти пилоты массово запускали, и к 2026-му пошла волна ревизии: бюджеты кончились, отчётный период настал, и кто-то должен объяснить совету директоров, что дал agentic-проект. Выяснилось, что чаще всего он дал впечатляющее демо и счёт за токены. Обещали автономного сотрудника - получили эксперимент, который на чистых тестовых данных работает, а на боевых сыпется.

Именно на этом стыке - огромный интерес и мало доехавших до прода проектов - и появляются громкие прогнозы про отмены. Дальше я разбираю, что дословно сказал Gartner, откуда цифра 40% и почему беда AI-агентов почти никогда не сидит в самих моделях. Начну с первоисточника, потому что вокруг него уже наросло много искажений.


Что на самом деле сказал Gartner про 40% отмен?

Коротко: Gartner в пресс-релизе от 25 июня 2025 года прогнозирует, что больше 40% проектов с agentic AI будут отменены к концу 2027 - из-за роста издержек, размытой бизнес-ценности и слабого контроля рисков. Спикер - Anushree Verma, Senior Director Analyst. При этом тот же релиз даёт оптимистичный прогноз на 2028. Это прогноз чистки перед ростом, а не приговор технологии.

Сначала точная формулировка, потому что её постоянно перевирают. Пресс-релиз Gartner от 25 июня 2025 года называется «Gartner Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027». Дословный тезис: больше 40% проектов с agentic AI будут отменены к концу 2027 года из-за роста издержек (escalating costs), размытой бизнес-ценности (unclear business value) и слабого контроля рисков (inadequate risk controls). Спикер - Anushree Verma, Senior Director Analyst в Gartner.

Теперь её собственные слова. Первая цитата описывает, в каком состоянии сейчас находится рынок AI-агентов.

«Most agentic AI projects right now are early-stage experiments or proof of concepts that are mostly driven by hype and are often misapplied.»

  • Anushree Verma, Gartner, 25 июня 2025

Перевод в живой речи: большинство нынешних проектов с ИИ-агентами - это ранние эксперименты и proof of concept, которые движет в основном хайп, и применяют их часто не по делу. То есть Verma не говорит «технология не работает». Она говорит другое: инструмент суют не туда и без плана.

Вторая цитата - про деньги, и она объясняет ту самую строчку «рост издержек».

«When you add orchestrators, governance layers, and multiple agents, costs start escalating very quickly.»

  • Anushree Verma, Gartner, 25 июня 2025

Перевод: как только ты добавляешь оркестраторов, слои управления и несколько агентов сразу, издержки начинают расти очень быстро. Запомни этот момент - к цифрам про деньги я вернусь в отдельном разделе, там будет живой RU-кейс, где счёт за одну задачу вырос в десять раз ровно по этой причине.

Есть и третий тезис Verma, про зрелость моделей. Она формулирует его так: у текущих моделей пока нет достаточной зрелости и «агентности», чтобы автономно достигать сложных бизнес-целей и держать нюансы инструкций во времени. Здесь важно не переусердствовать с выводом. Модели не тупые - у них пока не хватает зрелости, чтобы тянуть полную автономию на сложных многошаговых целях без человека рядом. Разница принципиальная, и вокруг неё построена вся практическая часть разбора.

⚠️ Не путай прогноз с приговором. «40% отменят» не равно «agentic AI провалился». В том же релизе от 25 июня 2025 года Gartner даёт встречный прогноз: к 2028 году не меньше 15% ежедневных рабочих решений будут приниматься автономно через agentic AI - против 0% в 2024-м. И 33% корпоративного софта будут включать agentic-возможности к 2028 году - против меньше 1% в 2024-м. Сначала чистка, потом рост. Одно не отменяет другое.

Почему тогда прогноз звучит так пугающе? Потому что заголовок про 40% отмен отлично расходится, а вторую половину релиза - про рост к 2028-му - цитируют куда реже. Отсюда искажённое ощущение, что Gartner похоронил AI-агентов. Он их не хоронил. Он описал нормальную фазу хайп-цикла, когда рынок отсеивает то, что было продано на голом ажиотаже.

Хорошо это сформулировал обозреватель Forbes Robert J. Szczerba в разборе того же прогноза от 7 июля 2026 года: «A demo is a promise. Production is a contract.» Демо - это обещание, прод - это контракт. К его тексту я ещё вернусь, там есть очень точный термин про то, где именно рвётся путь от обещания к контракту.


Что такое agent-washing и почему настоящих ~130?

Коротко: Agent-washing - термин Gartner: старый продукт (AI-ассистент, RPA-бот, чат-бот) переупаковывают под «агента» без реальной автономности. По оценке Gartner, из тысяч вендоров, заявляющих agentic AI, настоящих около 130. Настоящий агент сам ставит и достигает цель через многошаговые решения без пошагового управления человеком. Перекрашенный чат-бот - нет. Ниже даю тест, как отличить одно от другого.

Термин ввёл Gartner в том же контексте, и он объясняет, откуда берётся разрыв между тысячами «агентов» и сотней настоящих. Agent-washing - это переупаковка существующих продуктов под ярлык «агент» без реальных агентных возможностей. По формулировке Gartner, под этот ярлык массово перекрашивают три вещи: AI-ассистентов, RPA-ботов (роботизированная автоматизация процессов) и обычных чат-ботов.

Аналогия простая. Как «эко» и «натуральное» лепят на всё подряд, чтобы продать дороже, так «agentic» и «автономный агент» лепят на софт, который автономным не является. Маркетологи поменяли слайды, продукт остался прежним. Отсюда и цифра: Gartner оценивает, что из тысяч вендоров, продающих себя как agentic AI, реальны лишь около 130. Forbes в разборе от 7 июля 2026 года эту оценку подтверждает и добавляет, что большинство «агентных» решений на деле разворачивают обычных чат-ботов.

Что отличает настоящего AI-агента от перекрашенного? Реальный агент сам ставит цель или получает её в общем виде, сам планирует путь, сам принимает многошаговые решения и сам дёргает инструменты - без того, чтобы человек вёл его за руку на каждом шаге. Перекрашенный чат-бот делает один заранее прописанный сценарий: получил запрос, вызвал одну функцию, вернул ответ. Между ними пропасть в архитектуре, но на демо-слайде они выглядят одинаково.

Вот практический тест из четырёх признаков - им можно проверить любого «агента», которого тебе продают.

  1. Многошаговость без подсказки. Спроси, сколько решений агент принимает сам между постановкой задачи и результатом. Если ответ «одно» - перед тобой чат-бот с кнопкой, называть его автономным агентом рановато.
  2. Работа с инструментами по своей инициативе. Настоящий ИИ-агент сам выбирает, какой инструмент дёрнуть и когда. Если список действий жёстко зашит в сценарий - это RPA под новой вывеской.
  3. Реакция на непредвиденное. Спроси, что агент делает, когда что-то пошло не по плану: данные кривые, инструмент вернул ошибку. Настоящий агент перепланирует. Перекрашенный - падает или отдаёт заглушку.
  4. Автономность во времени. Держит ли агент цель и контекст на длинной цепочке шагов, не теряя нить после одного обмена репликами. Это ровно та «зрелость», про нехватку которой говорила Verma.

🚨 Критично для тех, кто выбирает вендора. Если продавец показывает только отрепетированное демо и уходит от вопроса «покажи на наших данных и с нашими доступами» - почти наверняка перед тобой agent-washing. Настоящую автономность видно на грязных данных и в нештатных ситуациях, а на подготовленном сценарии её не проверить. Требуй пилот на своём контуре до того, как подпишешь контракт, - это отсекает большую часть из тех тысяч ненастоящих агентов.

Проверить это на настоящих моделях, а не на маркетинговом слайде, из России можно без плясок с VPN. В агрегаторе provod.ai Claude, GPT и Gemini живут в одном чате и в одном API, платишь картой РФ по официальному тарифу - реселлеры за то же обычно берут на 15-25% больше.

Различать это важно не ради чистоты терминов. Когда половина рынка зовёт агентом обычный чат-бот, статистика отмен и провалов смешивается. Часть «провалов agentic AI» - это провалы чат-ботов, которым навесили лишних ожиданий. Поэтому дальше я развожу два разных вопроса: где ломаются настоящие агенты и где ломается сам путь от демо к проду - у любого, даже честного, продукта.


Почему успешный пилот не доезжает до прода?

Коротко: Обозреватель Forbes Robert J. Szczerba (7 июля 2026) назвал это «capability-deployment verification gap»: агент умеет задачу в контролируемом тесте, но бизнес не может проверить и доверить ему её в бою. Демо живёт на чистых данных, прод - на проприетарных системах, доступах и ответственности. По замерам 2026-го от трёх четвертей до девяти десятых пилотов до прода не доезжают.

У этого разрыва есть точное имя. Robert J. Szczerba в Forbes от 7 июля 2026 года называет его «capability-deployment verification gap» - разрыв между способностью и проверяемым внедрением. Его формулировка: «the agent can do the task in a controlled test, but the business can't verify or trust it once it runs against proprietary systems and live data». Агент умеет задачу в контролируемом тесте, но бизнес не может проверить её и довериться агенту, когда тот работает в бою - против проприетарных систем и живых данных.

Почему так выходит. Демо живёт в тепличных условиях: чистые данные, заранее известные кейсы, один сценарий, никакой ответственности за последствия. Прод - это проприетарные системы, реальные доступы к боевым базам, кривые исторические данные, юридическая ответственность за каждое действие и требование всё это проверять. Szczerba пишет прямо: «deployment is harder than the sales deck made it sound» - развёртывание тяжелее, чем это звучало в продающей презентации.

Теперь цифры разрыва. Тут я специально осторожен с атрибуцией, потому что по сети гуляет красивая цифра «77% пилотов не доходят до прода», которую приписывают то Gartner, то ещё кому-то. Единого твёрдого источника у неё нет - разброс по вторичным данным идёт от 77% до 89%. Поэтому даю только то, что атрибутируется честно.

  • Forrester (2026, через Forbes). Около 75% предприятий внедряют agentic AI, но до реального прода доходит лишь малая доля. Внедрять начали почти все, довести до боя - единицы.
  • IDC (в партнёрстве с Lenovo, 2025). Порядка 88% proof of concept с ИИ-агентами не доезжают до прода: на каждые 33 запущенных POC в прод выходит примерно 4.
  • Опрос 650 техлидеров (март 2026). У 78% есть хотя бы один пилот AI-агента, но лишь 14% масштабировали его на всю организацию. Пилот есть почти у всех, дошёл до масштаба - у каждого седьмого.
  • MIT, «The GenAI Divide: State of AI in Business 2025» (август 2025). 95% пилотов генеративного ИИ не дают измеримого влияния на P&L. Важно: это про генеративный ИИ в целом, не сугубо про агентов - но именно эта цифра задаёт фон, на котором agentic-провалы выглядят частью большой картины.
  • S&P Global (октябрь 2025), 2025 Enterprise AI Survey. 42% компаний забросили большинство своих ИИ-инициатив в 2025 году - против 17% годом раньше. В среднем компании выбрасывают 46% своих POC, не доводя до прода.

Сложи это вместе. Разные конторы мерили по-разному, но диапазон устойчивый: по замерам 2026-го от трёх четвертей до девяти десятых пилотов не доезжают до прода. Цифры разные, источники независимые, а коридор сходится. И почти везде дело в одном: результат нельзя проверить, доверить и встроить в живой процесс. Модель тут чаще всего ни при чём.

⚠️ Совет тем, кто планирует пилот. Заложи в план не «сделать демо», а «пройти проверяемость на боевых данных». Если у тебя нет ответа на вопрос «как мы поймём, что агент не облажался, и как откатим, если облажался» - ты строишь очередной POC из тех 88%, что не доедут. Проверяемость дороже способности. Именно на ней и держится весь разрыв.

Дальше - про деньги, потому что вторая причина смертности после «непроверяемости» звучит как «стало слишком дорого». И это парадокс: токены дешевеют, а агенты дорожают.


Почему AI-агенты столько сжигают - и где утекают деньги?

Коротко: Цена токена рухнула: GPT-4-класс стоил около $20 за 1M токенов в конце 2022 и около $0,40 в начале 2026 - минус ~98% за три года (Epoch AI). А прогон агента подорожал, потому что одна задача - это десятки-сотни вызовов модели плюс раздувание контекста. Реальный RU-кейс: переход на мультиагентную схему поднял стоимость задачи с $0,42 до $4,30. Считать нужно стоимость всей задачи целиком.

Начну с хорошей новости, которую все неправильно интерпретируют. Инференс подешевел резко. По данным Epoch AI, модель класса GPT-4 стоила около $20 за миллион токенов в конце 2022 года и около $0,40 за миллион к началу 2026-го. Это падение примерно на 98% за три года. Логично ждать, что и агенты подешевели в разы. На практике прогон агента дорожает. Вот где собака зарыта.

AI-агент почти никогда не ограничивается одним вызовом модели. На одну задачу их уходят десятки, а то и сотни: спланировал шаг, дёрнул инструмент, получил результат, проверил, перепланировал, дёрнул ещё раз. И каждый следующий вызов тащит за собой всю накопленную историю - контекст раздувается, а платишь ты за токены на входе каждый раз заново. Дешёвый токен, умноженный на сотню вызовов и растущий контекст, превращается в совсем не дешёвый счёт.

Лучшая иллюстрация - живой RU-кейс. На Habr в статье «Мультиагентный хаос» (автор kardanShurup, 23 апреля 2026) описан переход с плоского пайплайна на «командный» мультиагентный сценарий, где несколько агентов общаются между собой. Результат: число вызовов LLM на одну задачу выросло с 14 до 127, а стоимость одной задачи - с $0,42 до $4,30. Почти десятикратный рост. И это ровно то, о чём предупреждала Verma из Gartner: добавили оркестраторов и несколько агентов - издержки полетели вверх.

Отсюда простое правило: чтобы AI-агент тебя не разорял, считай стоимость за всю задачу целиком, а не за отдельный токен. Формула грубая, но рабочая: количество вызовов × средний размер контекста × цена токена. Пока ты смотришь только на «цену за миллион токенов», реальная стоимость от тебя скрыта: её задаёт архитектура агента, число вызовов и размер контекста.

Чтобы прикинуть этот счёт, нужны понятные цены на входе. Ниже - тарифы через provod.ai в рублях за 1000 токенов, вход/выход, один в один с официальными ценами вендоров (реселлеры обычно накидывают сверху +15-25%).

Модель ₽ за 1000 токенов (вход) ₽ за 1000 токенов (выход) Когда брать в агенте
Claude Opus 4.8 0,39 1,95 Сложное планирование, длинные цепочки рассуждений
Claude Sonnet 4.6 0,23 1,17 Рабочая лошадка: баланс цены и качества
GPT-5.5 0,39 2,34 Универсал под инструменты и код
Gemini 3.1 Pro 0,16 0,94 Дешевле флагманов, большой контекст
DeepSeek V4 Flash 0,011 0,022 Массовые дешёвые шаги, черновая обработка
Qwen3.7 Max 0,094 0,468 Недорогой сильный вариант для рутины

Цены через provod.ai, ₽ за 1000 токенов, 1:1 с официальными тарифами вендоров. Данные на 2026-07-10. Проверить актуальные - на provod.ai.

Смотри, что даёт таблица на практике. Один и тот же агент можно собрать на Opus за 1,95 ₽ за 1000 токенов выхода, а можно на DeepSeek V4 Flash за 0,022 ₽ - почти в 90 раз дешевле. Если у тебя сто вызовов на задачу, схема «планировщик на флагмане, чернуха на дешёвой модели» отделяет окупаемого агента от мёртвого пилота на одной только цене прогона. Единый баланс в рублях помогает эту арифметику видеть в одном месте, без сбора расходов по пяти кабинетам с разными валютами.

Прикинем на условном примере. Пусть агент делает 100 вызовов на задачу, и каждый тащит в среднем 3000 токенов накопленного контекста на входе - это 300 тысяч входных токенов на одну задачу. На Opus по 0,39 ₽ за 1000 токенов входа это около 117 ₽ только за вход, на Gemini 3.1 Pro - около 48 ₽, а на DeepSeek V4 Flash по 0,011 ₽ - около 3,3 ₽. Выход добавляется сверху. Разброс на ровном месте - десятки раз, и задаёт его архитектура твоего агента: сколько вызовов, какой контекст и какая модель стоит на каждом шаге. Цена «за миллион токенов» из рекламы вендора тут почти ничего не говорит.

Про API отдельно. Всё это гоняется через единый API, OpenAI- и Anthropic-совместимый: код и тулзы вроде Claude Code, Cursor или n8n переключаются на нужную модель сменой base_url и ключа, без переписывания. Как это выглядит в коде - покажу в разделе про запуск из России, там будет готовый сэмпл. Технически ты дёргаешь один эндпоинт, а под капотом - любая модель из таблицы.

Дешёвый токен обманчив: он создаёт ощущение, что агент почти ничего не стоит, и команда не смотрит на полный счёт до тех пор, пока не приходит выписка за месяц. А там - те самые «escalating costs», из-за которых Gartner и прогнозирует отмену части проектов. Деньги утекают в архитектуре, которая множит вызовы. Прайс за токен тут обманчиво мал.


Три причины, по которым агент падает в реальной работе

Коротко: Настоящие AI-агенты валятся в проде по трём причинам. Первая - каскад ошибок: надёжность на шаге меньше единицы перемножается по длинной цепочке. Вторая - размытая ответственность: когда агент действует сам, непонятно, кто отвечает и как откатывать. Третья - неприметная интеграционная работа (доступы, данные, мониторинг, eval), которой нет в демо. Разбираю каждую с цифрами и RU-голосами.

Причина 1: каскад ошибок по длинной цепочке

Математика беспощадная. Если на одном шаге агент надёжен на 95%, то на цепочке из десяти шагов итоговая надёжность - это 0,95 в десятой степени, около 60%. На двадцати шагах - уже около 36%. Чем длиннее задача, тем вернее провал, даже если каждый отдельный шаг выглядит почти идеальным. Это называется compounding error, накопление ошибки.

Цифры это подтверждают. Проект METR, который меряет надёжность агентов, показывает: горизонт надёжности резко падает с ростом длины задачи. А отдельный замер на retail-задачах в бенчмарке τ-bench от Sierra AI даёт такую картину: pass@1 у GPT-4o - 61%, pass@8 - 25%. Читается так: с первой попытки агент решает задачу в 61% случаев, но стабильно повторить успех восемь раз подряд получается лишь в 25%. Единичный успех не гарантирует, что так будет каждый раз. Проду же нужна именно повторяемость.

Добавь сюда разрыв между лабораторией и боем. По индустриальным обзорам 2026 года, разница между лабораторными бенчмарками и реальной эксплуатацией составляет около 37%, а разброс стоимости выполнения одной и той же задачи доходит до 50 раз в зависимости от того, сколько попыток и перепланирований потребовалось. То, что на бенче выглядит как «решено», в проде оказывается «решено иногда и за непредсказуемые деньги».

Причина 2: размытая ответственность, когда агент действует сам

Когда автономный агент сам совершает действие - оформляет возврат, меняет запись в базе, отправляет письмо клиенту - возникает вопрос, на который у большинства пилотов нет ответа: кто за это отвечает. Разработчик? Владелец процесса? Вендор агента? Эту размытость называют fuzzy accountability. Нет чёткой подотчётности - нет и механизма отката, когда агент ошибётся. А он ошибётся, см. причину 1.

RU-голоса тут звучат честнее любого отчёта. На Habr в комментарии от Claritas (30 мая 2026) сформулировано так: «в агентной системе - вероятность. А вероятность в проде это headache на продакшене». В переводе на человеческий: агент по своей природе вероятностный, а прод не терпит вероятности там, где нужны предсказуемость и ответственность. Каждое «скорее всего правильно» в бою превращается в головную боль эксплуатации.

Причина 3: неприметная интеграционная работа, которой нет в демо

Демо не показывает 80% реальной работы. Доступы к боевым системам с правильными правами, чистка и разметка данных, мониторинг того, что агент вообще делает, eval-обвязка для проверки качества, логирование каждого действия для разбора инцидентов - всё это невидимо на слайде и составляет основную часть трудозатрат в проде. Автор «Мультиагентного хаоса» kardanShurup на Habr (23 апреля 2026) бьёт в ту же точку: «Проблема - в архитектуре оркестрации, которую многие принимают за магию». Никакой магии, только кропотливая инженерия, которую на демо не видно.

Вот как это выглядит в виде «что показывают против что ломается».

В демо выглядит готовым В проде ломается
Агент решает задачу с первой попытки Каскад ошибок на длинной цепочке (pass@8 падает вдвое)
Чистые заранее подготовленные данные Кривые проприетарные данные и битые доступы
Один аккуратный сценарий Нештатные ситуации, на которые агент не рассчитан
Успешное действие на экране Некому отвечать за действие и нечем откатить
«Просто подключите API» Мониторинг, eval, логирование, права - месяцы работы

🚨 Критично: агент с правами на запись без песочницы. Самый дорогой сценарий провала - когда автономному агенту дали боевые права на изменение данных или отправку денег, но не дали песочницу, лимиты и откат. Один каскад ошибок на длинной цепочке - и агент массово наделал действий, которые никто не проверял и которые нельзя отменить. Прежде чем давать агенту право что-то менять в бою, дай ему сначала право только читать и предлагать, а исполнение оставь человеку. Это дешевле любого инцидента.

Все три причины бьют в одно. Настоящий AI-агент падает почти никогда не из-за глупости модели. Валит его другое: длинная автономная цепочка вероятностных решений в живой системе - сложная инженерная задача, которую демо маскирует под магию. Отсюда закономерный вопрос: если всё так, может, вся история с агентами - пузырь?


Значит ли это, что вся история с агентами - пузырь?

Коротко: Нет. Это классический хайп-цикл: пик завышенных ожиданий, отрезвление, потом плато продуктивности. Часть отмен - обычная смертность ИТ-проектов, которая случилась бы и без всякого ИИ. При этом спрос реальный и растёт: по данным UK AI Safety Institute, на выборке 177 000 инструментов агентов доля «действующих» выросла с 24% до 65% за год с небольшим. Чистка отсеет agent-washing, выживут узкие рабочие агенты.

Сначала аргумент, который любят игнорировать сторонники теории «пузырь лопнет». В треде на Hacker News про этот самый прогноз Gartner пользователь dagw задал отрезвляющий вопрос: а какой процент вообще всех софт-проектов, стартовавших за последние 12 месяцев, будет отменён к концу 2027? Мысль простая: ИТ-проекты умирают пачками всегда, безотносительно ИИ. Часть из тех 40% - это обычная базовая смертность стартовавших инициатив, не обязательно специфический провал agentic AI. На фоне общей статистики отмен цифра перестаёт выглядеть апокалиптично.

Есть и встречный скепсис из того же треда. Пользователь bGl2YW5j подметил: «If you define success simply as "not cancelled", then yes, fantastic odds». Если считать успехом просто факт «проект не отменили» - тогда да, шансы отличные. Тонко: «не отменён» не означает «полезен». Проект может тихо жить, жрать бюджет и не давать той самой измеримой пользы, про которую MIT насчитал 95% пустых пилотов. Так что и оптимизм по формуле «выживших много» надо делить на реальную отдачу.

А теперь то, что склоняет чашу к «не пузырь». UK AI Safety Institute изучил выборку из 177 000 инструментов агентов и посчитал долю «действующих» - тех, что реально совершают действия помимо генерации текста. Эта доля выросла с 24% до 65% между концом 2024 и началом 2026 года. Направление однозначное: агенты всё чаще переходят от болтовни к реальным действиям. Спрос не выдуманный, и технология движется в правильную сторону.

Сложи всё вместе, и получится картина обычной санитарной чистки. Крах тут ни при чём. Хайп-цикл работает как всегда: сначала пик завышенных ожиданий, где agent-washing продаёт чат-ботов под видом автономных сотрудников, потом отрезвление, где половину проектов честно закрывают, потом плато продуктивности, где остаются узкие рабочие агенты на понятных задачах. Прогноз Gartner про 40% отмен - это описание фазы отрезвления. Некрологом тут и не пахнет.

Кстати, есть ещё эффект самого прогноза. В том же треде на HN пользователь josefritzishere напомнил про «Gartner effect»: громкий прогноз влияет на рынок сам по себе - кто-то закроет проект просто потому, что «Gartner же сказал». Так что часть будущих отмен - это отчасти сбывающееся пророчество. Но сути это не меняет: рынок отсеет ненастоящее и оставит то, что работает на узких задачах. Вопрос только в том, что именно делают те, кто попадает в выжившие. Об этом - дальше.


Что делают те, кто всё-таки доводит агента до прода?

Коротко: Команды, у которых AI-агент доехал до прода, делают примерно одно и то же. Берут узкую частотную задачу вместо «агента-всё». Держат человека на рискованных шагах. Дают агенту минимум прав и песочницу с откатом. Строят eval-обвязку до масштабирования. Выкатывают из теневого режима в автономию постепенно. Тот самый governance, нехватку которого называют Gartner и Forbes.

Разберём по шагам. Ниже - сводка того, что повторяется у команд, которые пробили capability-deployment verification gap.

  1. Узкая, частотная, высокообъёмная задача. Берут одну конкретную операцию, которую надо делать тысячу раз в день, и строят агента строго под неё. Никаких «агентов, которые делают всё». Узость даёт две вещи: короткую цепочку шагов (меньше каскад ошибок) и понятную метрику успеха. «Агент-всё» проваливается по всем трём причинам сразу, узкий агент - почти ни по одной.

  2. Человек на рискованных шагах (human-in-the-loop). Полная автономия с первого дня - это прямой путь в тот самый инцидент с правами на запись без песочницы. Рабочие команды ставят человека на подтверждение действий, которые что-то необратимо меняют или стоят денег. Агент готовит решение, человек жмёт кнопку. Автономию наращивают потом, по мере накопленной статистики.

  3. Узкие права и песочница (least privilege). Агенту дают ровно те доступы, что нужны для его узкой задачи, и ни одним больше. Сначала право только читать, потом предлагать, и лишь потом, под контролем, - исполнять. Плюс песочница и работающий откат на случай каскада ошибок. Это прямой ответ на fuzzy accountability: если права узкие, а откат есть, цена ошибки ограничена.

  4. Eval-обвязка ещё до масштабирования. Прежде чем катить агента на всю организацию, команды строят измеримые метрики успеха, мониторинг каждого действия и регресс-тесты на реальных данных. Без этого не отличишь «агент работает» от «агенту пока везёт». Именно eval превращает эффектное демо в проверяемый прод - тот самый мост через verification gap.

  5. Из теневого режима в автономию постепенно. Сначала агент работает в shadow-режиме: он принимает решения, но не исполняет их, а его выбор сравнивают с тем, что сделал человек. Накопили статистику, увидели, что агент попадает в цель, - дали ему исполнять часть шагов. Автономию наращивают плавно, участок за участком. Никаких рубильников «включили полную самостоятельность».

Как это выглядит вживую. Агент для возвратов сначала месяц работает в тени: на каждый входящий кейс он предлагает решение (одобрить, отклонить, запросить фото), но кнопку жмёт оператор, а система копит, где агент совпал с человеком, а где разошёлся. Совпадение дошло до 98% на кейсах до 3000 ₽ - агенту отдают автоисполнение только этого узкого сегмента, а всё что дороже и все спорные случаи остаются на человеке. Через квартал сегмент расширяют по той же схеме. Так автономию тут не включают верой в демо - её зарабатывают статистикой на боевом потоке. Ровно этого шага и нет у 88% пилотов, которые пытаются прыгнуть из демо сразу в полную самостоятельность.

Свяжу это с первопричиной. Gartner называет одной из трёх причин отмен слабый контроль рисков (inadequate risk controls), а Forbes - poor governance и insufficient operational discipline. Пять пунктов выше складываются в тот самый governance на практике. Вполне осязаемый: узкая задача, человек в контуре, узкие права, eval и плавный выкат. Команды, которые это делают, попадают в те 14%, что масштабировали пилот. Остальные 88% застревают на POC.

⚠️ Мини-чеклист перед тем, как нести агента в прод. Пробеги по нему честно, до запуска:

  • Задача узкая, частотная, с понятной метрикой успеха? Если «агент будет делать много всего» - вернись на шаг назад.
  • Есть человек на каждом действии, которое необратимо или стоит денег?
  • Права минимальные, есть песочница и рабочий откат?
  • Построена eval-обвязка на реальных данных (не только демо-прогон)?
  • Есть план плавного выката из shadow в автономию без прыжка сразу «на всю компанию»?
  • Понятно, кто отвечает за действие агента и как разбирать инцидент?

Если хотя бы на один пункт ответ «нет» - ты пока на стадии POC, до прода ещё далеко. И это нормальная стадия, если ты про неё честен. Плохо, когда POC несут в бой, не закрыв ни одного из этих пунктов, - вот тогда проект и попадает в статистику отмен.


Как строить и оплачивать AI-агентов из России?

Коротко: Технически запуск из РФ - это единый API-ключ и смена base_url: Claude Code, Cursor, n8n подхватывают его без переписывания кода. Мультипровайдер даёт резерв на случай сбоя одного вендора, единый баланс в рублях - возможность видеть реальные расходы в одном месте. Но честно: агрегатор закрывает доступ и оплату, а надёжность агента - governance, eval, узкая задача, интеграция - остаётся на тебе.

Начну с практики. Чтобы проверить свою идею с агентом на реальных моделях из России, не нужны зарубежная карта и VPN. Схема простая: берёшь единый API-ключ, меняешь base_url в своём коде или инструменте - и всё, что говорит на языке OpenAI или Anthropic, начинает работать. Claude Code, Cursor, n8n и подобные тулзы переключаются на нужную модель сменой двух значений.

Вот как это выглядит в коде.

from openai import OpenAI

client = OpenAI(
    api_key="<PROVOD_KEY>",
    base_url="https://api.provod.ai/v1",  # OpenAI-совместимо; для Anthropic - /v1/messages
)

resp = client.chat.completions.create(
    model="claude-opus-4.8",
    messages=[...],
)
Enter fullscreen mode Exit fullscreen mode

Две строчки - api_key и base_url - и твой агент дёргает Claude, GPT, Gemini, DeepSeek или Qwen через один эндпоинт. Для Anthropic-совместимого режима меняется путь на /v1/messages, остальное так же. Логику агента переписывать не нужно: тулзы думают, что говорят с привычным провайдером.

Что это даёт помимо доступа. Мультипровайдер - это резерв: если один вендор лёг или ограничил доступ, ты переключаешь модель, а не переписываешь интеграцию и не ждёшь, пока починят. Сервис не зависит от аптайма одного конкретного вендора. Единый баланс в рублях - это возможность видеть полный счёт по всем моделям в одном месте, без сбора расходов по пяти кабинетам с разными валютами и картами. Один ключ вместо пяти, один баланс, закрывающие документы для юрлиц (договор, счёт, акт/УПД) - это через provod.ai.

Теперь честная граница, без которой этот раздел был бы враньём. provod.ai закрывает ровно две вещи: доступ к моделям из России и легальную оплату в рублях. Надёжным твоего агента он не делает. Governance, eval-обвязка, сужение задачи, интеграция с боевыми системами и ответственность за действия агента - всё это по-прежнему на тебе, и ни один агрегатор это за тебя не сделает. Смена base_url решает проблему доступа. Проблему capability-deployment verification gap решают те пять пунктов из предыдущего раздела.

И ещё одна граница, чтобы ожидания были ровными. Если тебе нужны фирменные подписочные фичи конкретного вендора - шеринг Projects или Artifacts, командные пространства внутри продукта вендора - или fine-tuning модели под свои данные, это уже прямая подписка или контур вендора. Агрегатор тут не поможет: его работа - дать доступ к моделям и единый API с оплатой в рублях. За специфичными продуктовыми фичами идёшь к вендору напрямую. Так честнее, и так ты не разочаруешься в инструменте, ожидая от него чужой работы.


Частые вопросы

Коротко: Собрал ответы на реальные запросы про ИИ-агентов: почему они не работают как в демо, что такое agent-washing простыми словами, правда ли Gartner предсказал 40% отмен, сколько стоит гонять агента и как подключить модели из России без VPN. Каждый ответ начинается с прямого ответа, детали - в основных разделах выше.

Почему ИИ-агенты не работают так, как обещали в демо?

Потому что демо и прод - разные среды. Демо живёт на чистых данных и одном отрепетированном сценарии, а прод - на кривых проприетарных данных, реальных доступах и ответственности за каждое действие. Обозреватель Forbes Robert J. Szczerba (7 июля 2026) назвал этот разрыв «capability-deployment verification gap»: агент умеет задачу в тесте, но бизнес не может проверить и доверить ему её в бою. Плюс работает каскад ошибок: надёжность на шаге меньше единицы перемножается по длинной цепочке, и чем длиннее задача, тем вернее провал.

Что такое agent-washing простыми словами?

Это когда старый продукт - AI-ассистента, RPA-бота или обычного чат-бота - переупаковывают под ярлык «автономный агент» без реальной автономности. Термин ввёл Gartner. Как «эко» лепят на всё подряд ради наценки, так «agentic» клеят на софт, где автономностью и не пахнет. Поэтому из тысяч вендоров, называющих себя agentic AI, настоящих, по оценке Gartner, около 130. Настоящий AI-агент сам ставит и достигает цель через многошаговые решения без пошагового управления человеком.

Правда ли, что Gartner предсказал отмену 40% проектов с ИИ-агентами?

Да, но с важными оговорками. В пресс-релизе от 25 июня 2025 года Gartner прогнозирует отмену больше 40% проектов с agentic AI к концу 2027 года - из-за роста издержек, размытой бизнес-ценности и слабого контроля рисков. Спикер - Anushree Verma, Senior Director Analyst. При этом тот же релиз даёт встречный прогноз: к 2028 году не меньше 15% ежедневных рабочих решений будут приниматься автономно через агентов (против 0% в 2024). Это прогноз чистки перед ростом.

Сколько стоит гонять ИИ-агента и почему это дорого?

Токен как раз подешевел - почти на 98% за три года (Epoch AI: около $20 за 1M токенов в конце 2022 против около $0,40 в начале 2026). Дорого выходит из-за архитектуры: одна задача агента - это десятки-сотни вызовов модели плюс раздувание контекста. В RU-кейсе с Habr («Мультиагентный хаос», 23 апреля 2026) переход на мультиагентную схему поднял стоимость одной задачи с $0,42 до $4,30 - почти в десять раз. Поэтому и считать надо стоимость всей задачи целиком.

Как подключить AI-агента и оплатить модели из России без VPN?

Через агрегатор с оплатой в рублях. Берёшь единый API-ключ, меняешь base_url в коде или в тулзе (Claude Code, Cursor, n8n) - и агент дёргает Claude, GPT, Gemini, DeepSeek или Qwen через один эндпоинт, без VPN и зарубежных карт. Через provod.ai это единый баланс в рублях, цены 1:1 с официальными и закрывающие документы для юрлиц - проверить любую модель можно на provod.ai. Доступ и оплату агрегатор закрывает. Надёжность агента - governance и eval - остаётся на тебе.


Проверить любую модель из этой статьи можно за пять минут: на provod.ai все флагманы - Claude, GPT, Gemini, DeepSeek, Qwen - в одном чате и через единый API, оплата в рублях с карты РФ, для юрлиц договор и закрывающие. Без VPN и без наценки.


Источники

  • Gartner, пресс-релиз «Gartner Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027», 25 июня 2025. Спикер - Anushree Verma, Senior Director Analyst.
  • Forbes, Robert J. Szczerba, «Why 40% Of Agentic AI Projects May Be Canceled By 2027», 7 июля 2026.
  • MarTech, разбор прогноза Gartner по agentic AI, 2025.
  • MIT, «The GenAI Divide: State of AI in Business 2025», август 2025 (95% пилотов генеративного ИИ без измеримого влияния на P&L).
  • S&P Global Market Intelligence, 2025 Enterprise AI Survey, октябрь 2025 (42% забросили большинство ИИ-инициатив; в среднем выбрасывают 46% POC).
  • IDC (в партнёрстве с Lenovo), 2025 (около 88% POC с ИИ-агентами не доходят до прода; «на 33 POC - 4 в прод»).
  • Forrester, оценка внедрения agentic AI, 2026 (около 75% предприятий внедряют, до прода доходит малая доля).
  • Epoch AI, тренд стоимости инференса (GPT-4-класс: около $20 за 1M токенов в конце 2022 против около $0,40 в начале 2026).
  • UK AI Safety Institute, анализ выборки из 177 000 инструментов агентов (доля «действующих» выросла с 24% до 65% между концом 2024 и началом 2026).
  • METR, замеры горизонта надёжности ИИ-агентов (надёжность резко падает с ростом длины задачи).
  • τ-bench (Sierra AI), метрика pass@k на retail-агентских задачах (pass@1 61% против pass@8 25% для GPT-4o).
  • Habr, «Мультиагентный хаос», автор kardanShurup, 23 апреля 2026 (рост вызовов LLM с 14 до 127, стоимость задачи с $0,42 до $4,30).
  • Habr, комментарий пользователя Claritas, 30 мая 2026 («вероятность в проде это headache на продакшене»).
  • Hacker News, тред про прогноз Gartner об отмене 40% agentic-проектов, 2025 (комментарии пользователей dagw, bGl2YW5j, josefritzishere, senko).

provod.ai — единая точка доступа к AI для российского бизнеса

Совместите технический и организационный контуры: модели подключаются через общий API, расчёты идут в рублях, юридические лица получают документы, а команда работает в корпоративном пространстве.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Доступность из России сочетается с прямой экономикой: официальный тариф модели переносится 1:1, без собственной наценки provod.ai.

Соберите корпоративный AI-контур: форма регистрации · цены на модели · защита данных по 152-ФЗ · реквизиты для договора

Top comments (0)