DEV Community

Cover image for AI-агент или чат-бот — где нужен контроль человека
Promptra Team for Promptra

Posted on

AI-агент или чат-бот — где нужен контроль человека

Как только помощник получает право вызвать инструмент, его ошибка перестаёт быть ответом и становится действием. Чат-бот, который ошибся, выдал неверный текст: ты прочитал его и отбросил. Помощник с доступом к инструментам, который ошибся, уже нажал кнопку: отменил заказ, отправил письмо, переписал запись в CRM, списал деньги. Разница между этими двумя ситуациями и есть та ось, по которой стоит выбирать степень автономии, а не то, насколько «умный» помощник.

Дальше по порядку три вещи. Сначала разделим ошибочный ответ и ошибочное действие: это разные классы риска, и путать их дорого. Потом соберём карту действия: какие поля в ней нужны, чтобы решение об автономии стало проверяемым, а не интуитивным. И сформулируем порог человеческого подтверждения — момент, после которого агент обязан остановиться и спросить.

Чем ошибочный ответ отличается от ошибочного действия?

Спорный по умолчанию вывод звучит так: если помощник умеет вызвать инструмент, значит, ему стоит дать делать это самостоятельно. Такой умолчательный выбор неверен. Умение вызвать инструмент говорит о способности модели, а не о праве действовать без подтверждения: между способностью и правом лежит вся зона управляемого риска.

Классический чат-бот работает в замкнутом контуре «запрос-ответ». Худшее, что он делает при сбое: выдаёт плохой текст. Как раз помощника с доступом к инструментам и памятью между шагами в индустрии называют ai agent, а по-русски — ai агент. Автономный ии агент замыкает контур на внешний мир, и именно это расширяет цену ошибки. Конфликт здесь не в интеллекте модели, а в том, что полезное действие агента одновременно создаёт обязательство контроля над этим действием. Чем полезнее доступ, тем выше ставка.

Отсюда falsifiable-тезис, который держит всю статью: если действие нельзя отменить или проверить до наступления ущерба, автономный агент не проходит карту допуска. Этот тезис можно опровергнуть: достаточно показать необратимое действие, которое агент безопасно делает сам, без журнала и владельца эскалации. Пока такого примера нет, а рамки Anthropic, OpenAI и CSA/NIST, на которые опирается текст ниже, движутся в ту же сторону.

Что должно стоять в карте «действие — риск — кто подтверждает»?

Карта не архитектура бота и не фреймворк, а таблица, которую владелец процесса заполняет до выдачи разрешений. Одна строка описывает одно действие, которое помощник теоретически может совершить, и у неё минимум три поля: само действие, его обратимость и тот, кто подтверждает.

Поле обратимости центральное. В независимом отраслевом whitepaper Cloud Security Alliance, расширяющем NIST AI RMF на агентские системы (доступ 2026-07-18, черновик v1), прямо предлагается классифицировать каждый инструмент агента по измерению обратимости: можно ли отменить эффекты вызова инструмента и какой ценой. Read-only инструменты там относят к принципиально другому классу риска, чем инструменты записи и выполнения. Это ровно то различие, которое кладётся в карту: чтение файла и отправка платежа не могут иметь одинаковую политику допуска.

Поле «кто подтверждает» указывает не роль в оргструктуре, а владельца конкретной эскалации. Если на действие нет назначенного человека, который его подтвердит, строка карты недописана. И тут два честных условия отказа. Первое: если обратимость действия определить нельзя, автономию по нему давать нельзя, карта такую строку не пропускает. Второе: если у действия нет ответственного за подтверждение и нет журнала, автономию давать тоже нельзя. Оба условия проверяемы до пилота, и оба чаще всего валят строки, которые интуитивно казались безопасными.

Что здесь установлено, а что нет. Установлено: роли, разрешения и точки эскалации можно явно задать в карте, это полностью в руках владельца процесса. Вероятно: сама классификация снизит риск неверной автономии, потому что заставляет назвать необратимость до выдачи прав. Неизвестно: реальная частота ошибок в конкретном процессе до пилота. Карту нельзя выдавать за метрику надёжности: она снижает риск решения, а не измеряет частоту сбоя.

Схема строки карты допуска: действие, обратимость, кто подтверждает

Где на практике проходит граница разрешений?

У вендоров эта граница уже реализована в коде, и по ней удобно калибровать собственную карту. Документация Claude Code по разрешениям (доступ 2026-07-18) делит инструменты по типу. Инструменты только для чтения, такие как чтение файлов и grep, внутри рабочей директории не требуют одобрения. Команды shell требуют подтверждения, кроме встроенного allowlist безопасных read-only команд. Инструменты, которые меняют файлы, тоже требуют одобрения, но оно действует только до конца сессии: право на запись выдаётся не бессрочно, а на ограниченное время, и это уже встроенная граница обратимости.

OpenAI в документации Agents SDK (доступ 2026-07-18) разводит два механизма, которые часто путают. Guardrails автоматически проверяют вход, выход и вызовы без участия человека. Human-in-the-loop approvals — отдельный механизм, зарезервированный для вызовов с побочными эффектами: отмены, правки, команды shell. Такой вызов ставит выполнение на паузу и возвращает interruption, который нужно разрешить до продолжения. Для аудита важна деталь: состояние приостановленного запуска можно сериализовать, сохранить и возобновить позже, поэтому пауза получается персистентной и проверяемой, а не зависшим процессом.

Возьмём для примера ai code agent, который правит репозиторий. Чтение кода и поиск по нему обратимы, их можно журналировать и не спрашивать разрешения. Правка файла обратима в пределах сессии и через историю версий, допустима при наличии лога. А команда, которая пушит в общую ветку или выкатывает изменения в прод, обратима слабо, и здесь нужна пауза с подтверждением. Один и тот же агент по разным строкам карты получает разный режим: автономию выдаёт не агент целиком, а конкретное действие.

Для computer-use инструмента Anthropic (помечен как beta, доступ 2026-07-18) формулировка ещё жёстче: модель должна просить человека подтвердить решения, которые способны привести к значимым последствиям в реальном мире, и документация прямо называет финансовые транзакции и согласие с условиями сервиса. Рекомендация вендора — ограничивать инструмент доверенной средой с низкими привилегиями и просматривать логи. Это нормативная позиция вендора, а не измеренная частота ошибок, и её стоит воспринимать именно так: как внешний факт, а не как гарантию.

Сравнение уровней разрешений: Claude Code, OpenAI Agents SDK, tiers CSA/NIST

Почему одобрение вслепую ломается на масштабе?

Человек в контуре не панацея: у этого контроля есть измеренный режим отказа. Телеметрия Anthropic (доступ 2026-07-18) показала, что пользователи одобряли примерно 93% запросов на разрешение в Claude Code. Хуже другое: чем больше запросов на одобрение видел человек, тем менее внимательно он рассматривал каждый. Это задокументированная «усталость от одобрений»: контроль, который формально существует, но фактически выродился в рефлекторное «да».

Ответом Anthropic стал модельный классификатор auto mode, который заранее одобряет действия с низким риском и прогоняет каждое предложенное действие по критериям обратимости, охвата и пересечения границы доверия. Его рабочее правило сформулировано прямо: «всё, что агент выбирает сам, считается неавторизованным, пока пользователь не скажет иначе». Это важная инверсия по умолчанию: не «разрешено, пока не запрещено», а наоборот.

Цифры классификатора стоит читать с осторожностью: это внутренняя выборка одного вендора на примерно 10 000 реальных вызовов инструментов от сотрудников, а не универсальная частота отказов агентов. По отчёту Anthropic, двухступенчатый пайплайн давал 8,5% ложноположительных блокировок на первой ступени, падавших до 0,4% после ступени рассуждения, и от 5,7% до 17% ложноотрицательных срабатываний в зависимости от тестового набора. Смысл здесь не в конкретных процентах, а в том, что даже выделенный автоматический контролёр ошибается в обе стороны: и лишний раз блокирует, и пропускает.

Поэтому в auto mode зашиты жёсткие пределы эскалации: после 3 отказов подряд или 20 отказов суммарно за один запуск система эскалирует на человека либо завершается в headless-режиме, а Anthropic ведёт внутренний журнал инцидентов агентского поведения. Это и есть та самая граница эскалации из карты, но выраженная числом. Спорный размен виден целиком: человек в контуре снижает скорость, но ограничивает ущерб. Автоклассификатор возвращает скорость, но добавляет свой процент ошибок. Ни один из вариантов не бесплатен, и карта нужна именно чтобы разложить, где какой размен допустим.

Гистограмма: 93% одобрений и уровни ошибок классификатора auto mode

Как решить: бот, агент или ручной шаг?

Теперь переходим к результату: классификации задачи. Для каждой строки карты ответ один из трёх. Контролируемый бот: действие обратимо и его можно проверить постфактум по логу. Агент с автономией: действие обратимо, проверяемо и достаточно частое, чтобы человек в контуре создавал усталость от одобрений. Ручной шаг: действие необратимо или его нельзя проверить до наступления ущерба. Ниже показано, как это ложится в таблицу.

Рамка CSA/NIST помогает не изобретать шкалу заново: она задаёт четыре уровня автономии от Tier 1 («полный надзор», одобрение человека до любого действия) до Tier 4 («полная автономия в ограниченной среде», включая порождение под-агентов), и обязательства по управлению, включая документированные триггеры эскалации, растут вместе с уровнем. Отдельно стоит отметить edge case: конструкция multi agent llm, где агенты порождают под-агентов, попадает в верхний Tier, и по карте она допустима только тогда, когда каждое итоговое действие под-агента всё равно проходит проверку обратимости. Автономия оркестратора не отменяет допуск исполнителя.

Действие Обратимость Кто подтверждает Класс
Чтение файлов, поиск по данным Полная Никто, только журнал Бот
Черновик ответа клиенту Полная Бот сам, лог Бот
Правка записи в CRM Частичная, есть история Агент с логом Агент
Отправка письма внешнему клиенту Слабая Человек Ручной шаг
Пуш в общую ветку, выкат в прод Слабая Человек Ручной шаг
Финансовая транзакция, согласие с условиями Отсутствует Человек Ручной шаг
Удаление данных без бэкапа Отсутствует Человек Ручной шаг

Читательская работа здесь простая и денежная: не покупать автономность для задачи, где достаточно контролируемого бота. Автономия не бесплатный апгрейд: это обязательство держать журнал, владельца эскалации и политику для высокорисковых действий. Если строка попадает в «ручной шаг», платить за автономного агента поверх неё означает платить за риск, который потом всё равно закроешь человеком.

Всё это опирается на официальную базовую рамку NIST: AI RMF Generative AI Profile (NIST AI 600-1), опубликованную 26 июля 2024 года, которая строит управление рисками вокруг governance, происхождения контента, предрелизного тестирования и раскрытия инцидентов. Карта действий служит прикладной проекцией этих же принципов для конкретного процесса, а не заменяет их.

Таблица классификации действий на бот, агент и ручной шаг по обратимости

Как подключить агента и не переплатить за автономию?

Практический шаг после карты — подключение модели к пилоту, а не выдача автономии. По сути, ии агент api и ai agent api на этом этапе означают одно и то же: нужна совместимая точка входа, к которой цепляются клиенты, IDE, боты и бизнес-системы. Именно с этого шага начинается автоматизация и создание ии агентов на практике — не с выбора платформы, а с подключения модели через протокол, который система уже поддерживает. Здесь может помочь единый совместимый API provod.ai: сервис агрегирует модели вроде Claude, GPT, Gemini, DeepSeek и Qwen в одном каталоге и даёт API, совместимый с SDK OpenAI и Anthropic: меняешь ключ и base_url, остальной код агента не трогаешь. Оплата идёт с рублёвого баланса картой РФ, СБП или по счёту, без VPN и зарубежных карт.

from openai import OpenAI

client = OpenAI(
    api_key="PROVOD_KEY",
    base_url="https://api.provod.ai/v1",
)
# логируем каждый вызов инструмента; побочные эффекты - на паузу до подтверждения
resp = client.chat.completions.create(
    model="claude-opus-4-8",
    messages=[{"role": "user", "content": "черновик ответа клиенту"}],
)
Enter fullscreen mode Exit fullscreen mode

Смена base_url решает совместимость подключения: доступ к модели по-прежнему не разрешение на действие. Журнал вызовов и подтверждение человека на необратимых строках карты остаются задачей владельца процесса, а не настройкой API. Стабильная мультиканальная маршрутизация помогает, когда один вышестоящий канал временно недоступен: запросы продолжают идти через другой канал. Но маршрутизация относится к доступности модели, а не к обратимости действия, и даже идеально доступный канал не превращает необратимый шаг в безопасный для автономии.

Чего эта карта не решает

Карта задаёт решение об автономии, а не готовую архитектуру бота: она говорит, какие действия отдать человеку, но не проектирует оркестрацию, промпты, retry-логику и хранилище состояния. Это отдельная работа.

Она не измеряет реальную частоту ошибок. До пилота эта цифра неизвестна честно, и карта её не заменяет: она снижает риск решения, а не заявляет метрику. Не путай «мы классифицировали риск» с «мы измерили надёжность».

Приведённые цифры вендоров остаются внешними фактами одного продукта и одной внутренней выборки. 93% одобрений, проценты классификатора и пороги «3 и 20» относятся к Claude Code, а не к универсальному закону для любого агента. Другие фреймворки реализуют human-in-the-loop иначе. И рамка CSA/NIST на сегодня остаётся черновиком v1 независимого отраслевого документа, согласованным с NIST, но не официальным стандартом самого NIST. Бери её как одну credible-модель, а не как утверждённое требование.

Наконец, provod.ai здесь закрывает совместимый доступ к моделям и оплату, но не заменяет платформы автоматизации, приватную или on-prem инфраструктуру, функции вендора по подписке, работу по внедрению и не заменяет GigaChat. Автономию за тебя он не согласует: её согласует только твоя карта.


provod.ai — оптимизируйте RAG по качеству, скорости и цене

Поиск, переранжирование, анализ контекста и финальный ответ не обязаны выполнять одна и та же модель: подберите лучший инструмент для каждого этапа и сохраните общую интеграцию.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Считайте экономику пайплайна без ценового шума: каждая модель тарифицируется 1:1 с официальным провайдером, без собственной наценки provod.ai.

Настройте модельный состав RAG: форма регистрации · цены на модели · защита данных по 152-ФЗ · главная provod.ai

FAQ

Что такое ai агент простыми словами и чем он отличается от бота?
Бот работает в контуре «запрос-ответ» и в худшем случае выдаёт плохой текст. Агент имеет инструменты и память между шагами, поэтому его ошибка становится действием во внешнем мире. Отсюда и разная политика допуска.

Нужен ли ии агент без кода?
В большинстве случаев да, no-code-сборка достаточна. Но карту действий заполняют до выбора платформы: она не зависит от того, кодом собран агент или конструктором. Отсутствие кода не отменяет обязательства журналировать шаги и назначать владельца эскалации.

Как подключить ии агента к рабочим системам?
Через совместимый endpoint. Если система поддерживает OpenAI- или Anthropic-совместимые вызовы, подключение сводится к ключу и base_url. Автономию действий при этом настраивают отдельно, по карте.

Можно ли доверить финансовую операцию автономному агенту?
По карте нет: действие необратимо, значит, оно уходит человеку. Guidance Anthropic по computer-use прямо называет финансовые транзакции и согласие с условиями как решения, которые должен подтверждать человек.

Источники

provod.ai - один совместимый API для агентов с оплатой из России

Заполни карту «действие — риск — кто подтверждает» на своих задачах. Доступ к моделям для пилота подключи на provod.ai одним ключом и base_url: рублёвая оплата, без VPN и без наценки на модели.

Top comments (0)