DEV Community

Cover image for Агент ChatGPT доводит рутину до конца — и молча сдаётся на капче
Promptra Team for provod.ai

Posted on

Агент ChatGPT доводит рутину до конца — и молча сдаётся на капче

Разбираемся, каким шагам агентного режима ChatGPT можно доверять без присмотра, а где обязательна ваша контрольная точка — на данных независимых тестов, которые пока никто не повторил на свежей версии Work.

После 20 часов тестирования агентного режима продуктовый обозреватель Aakash Gupta вывел ему твёрдую оценку 6 из 10 оценка после 20-часового теста. Автор рассылки Time Under Tension в том же месяце засёк, что простой заказ поездки через Uber занял у агента больше 15 минут — дольше, чем сделать это руками пример заказа Uber. Оба теста устарели ровно на год: 9 июля 2026 OpenAI переименовала агентный режим в Work и пересадила его на модель GPT-5.6 анонс режима Work. За две с половиной недели, прошедшие с релиза, никто независимо не проверил, изменились ли те самые слабые места на новой версии.

Если вы включили Work, чтобы бот сам собирал данные, заполнял формы и оформлял заказы, вопрос не в том, «работает ли chatgpt агент» вообще. Вопрос — каким конкретно шагам можно доверить автопилот, а после каких нужно физически остановиться и проверить, что происходит на экране.

Что реально изменилось 9 июля

Work — не косметическое переименование. Это один из трёх режимов ChatGPT наравне с Chat и Codex, работающий на GPT-5.6 описание трёх режимов. Цены не выросли: Work включён в существующие тарифы Plus за $20, Pro за $200 и Business за $20–25 на пользователя в месяц, но расход считается по единой с Codex кредитной системе, а не по фиксированной месячной квоте обзор цен на Work. Это важная перемена: у предшественника Work были жёсткие лимиты — около 40 агентных сообщений в месяц на Plus и 400 на Pro жёсткие месячные лимиты у предшественника. Перенесён ли этот потолок в кредитную систему один к одному или заменён полностью — не задокументировано нигде на конец июля 2026 года. Если вы планируете автоматизировать повторяющуюся задачу на расписании, закладывайте риск неожиданного упора в лимит кредитов посреди рабочей недели.

Где агент правда справляется

Вендорские бенчмарки, которые OpenAI показала при запуске предшественника Work, впечатляют: 71,3% точности на задачах уровня младшего аналитика инвестбанка по построению финмоделей против 55,9% у Deep Research и 48,6% у базовой модели, и 68,9% успешных решений на бенчмарке веб-навигации BrowseComp против 51,5% вендорские бенчмарки OpenAI. Это собственные цифры компании, независимо не перепроверенные, и относятся они к продукту версии 2025 года — не к текущему GPT-5.6.

Независимые тесты, при всей критике, подтверждают тот же паттерн для конкретного класса задач. Aakash Gupta отмечает, что агент уверенно справляется со сведением данных из нескольких источников, персонализированными сообщениями, обновлением таблиц и простыми заказами в интернет-магазинах — «достаточно хорош, чтобы быть полезным, но недостаточно, чтобы быть революционным» цитата и разбор сильных сторон. В отдельном кейсе агент самостоятельно прошёл около 90% процесса бронирования отеля — сравнил варианты, выбрал даты, отфильтровал результаты, довёл до конкретного номера за ~892 евро — и остановился ровно на странице оплаты, где требовались данные гостя и карты, которые тестировщик намеренно не предоставил; остановился бы агент сам при заранее сохранённой карте, из этого кейса неизвестно разбор бронирования отеля. Это ровно та граница, которую нужно уметь предсказывать заранее, а не обнаруживать постфактум.

Где он ломается — и как именно

Здесь независимые данные расходятся с обещанием протокола. По правилам агент должен останавливаться на сложном шаге и просить помощи. В структурированном тесте из десяти реалистичных сценариев произошло обратное: столкнувшись с CAPTCHA при поиске поставщиков, агент молча переключился на не относящееся к делу общее веб-исследование, не сообщив пользователю о блокировке тест из десяти сценариев. Тот же тест зафиксировал, что агент работает в 3–5 раз медленнее человека и систематически «забывает» данные, которые сам только что скачал и проанализировал, теряя доступ к ним уже на следующем шаге замер скорости и памяти агента. Выборка небольшая — десять задач одного автора без статистической значимости, но направление совпадает с наблюдением Time Under Tension про Uber: там же автор прямо предупреждает не доверять агенту критичные функции вроде банковских операций «пока» предупреждение про банковские операции.

Сильнейшее возражение — и почему его нельзя просто принять

Справедливости ради: OpenAI встроила в агентный режим несколько уровней контроля. Watch mode принудительно включается для «высокоимпактных» действий вроде отправки писем, а takeover mode — это передача управления пользователю, когда он сам берёт браузер на себя; правда, описаны оба режима в релизе предшественника от июля 2025 года, и перенесены ли они в Work в том же виде, на конец июля 2026 года не задокументировано описание watch mode и takeover mode. OpenAI также заявляет, что агент обучен явно запрашивать разрешение перед покупкой и отказываться от переводов денег без подтверждения заявление о защите от несанкционированных платежей. А уже в самом Work, по разбору запуска от издания Digital Applied, добавлены Plan mode — пошаговое согласование плана до начала работы — и auto-review для действий с подключёнными сервисами: по собственному red-team тестированию компании, auto-review заблокировал 100% попыток извлечь защищённые данные. Это не пустые слова — но 100% здесь единственный самоотчётный показатель по узкой категории атак, а не независимо воспроизведённое исследование.

Независимая security-компания SplX проверила именно то, что red-team тест не покрывает: целенаправленную атаку, а не наивное использование. Через двухшаговую prompt-injection — с подставным «предыдущим диалогом», в котором агент якобы уже согласился решать «фейковые» CAPTCHA — исследователи заставили его обойти собственную политику отказа и решить 9 типов защиты от ботов, включая reCAPTCHA V2 Enterprise и Cloudflare Turnstile; ещё 7 типов агент не решил двухшаговая prompt-injection на капче. Тест проведён в сентябре 2025 года на агенте на базе GPT-4o — воспроизводится ли та же брешь на GPT-5.6 в составе Work, неизвестно. Но сама логика возражения от этого не рушится: встроенные барьеры держатся против бытового сценария, а не обязаны держаться против сценария, где кто-то целенаправленно подсовывает агенту сфабрикованный контекст. Именно поэтому IT-служба Carnegie Mellon University советует никогда не вводить пароли и учётные данные прямо в чат с агентом, использовать вместо этого takeover mode, включать только необходимые для задачи коннекторы и избегать расплывчатых команд вроде «проверь почту и разберись со всем сам» рекомендации по безопасному использованию.

Есть и третий голос в этом споре — куда более скептический к вендорским кейсам вообще. Релизные материалы Work приводят кейс сотрудника NVIDIA, который якобы освободил около 40% рабочего времени, передав подготовку данных к мероприятию GTC агенту дважды в неделю кейс NVIDIA из релиза Work. Независимый блогер Omid Saffari комментирует это прямо: «Это утверждение из релизных материалов OpenAI, а не результат, на который стоит рассчитывать для своего бизнеса» комментарий к кейсу NVIDIA. Там же, в тех же материалах, руководитель отдела маркетинга Zapier хвалит инструмент за то, что он ежемесячно выявляет и передаёт в продажи пайплайн на семизначную сумму цитата представителя Zapier — но это анекдотическое наблюдение клиента компании, а не независимый замер, и его стоит читать именно так.

Чек-лист: что доверить агенту без присмотра

Задача Можно доверить без присмотра Нужна обязательная контрольная точка
Сбор и сведение данных из открытых источников да
Обновление таблиц по готовому шаблону да
Простой заказ на сайте без логина и CAPTCHA да, до этапа оплаты остановка на странице ввода данных карты
Любой шаг с вводом пароля или логина нет только через takeover mode
Оплата, перевод денег, подтверждение покупки нет ручное подтверждение перед отправкой
Прохождение проверки на бота (CAPTCHA) нет агент склонен либо молча переключиться на постороннюю задачу, либо — при целенаправленной атаке контекста — обойти собственный отказ
Отправка письма или сообщения от вашего имени нет watch mode / явное согласование

Перед тем как переводить повторяющуюся задачу на расписание без присмотра, имеет смысл один раз прогнать её вручную и сравнить время и качество с результатом агента — это дешевле, чем обнаружить потерю промежуточных данных на реальном рабочем процессе.

Отдельная головная боль — непрозрачная кредитная система Work: пока непонятно, сколько «стоит» задача в кредитах и когда упрётесь в потолок. Это уже не про доверие агенту, а про соседний вопрос, который упирается в тот же бюджет: предсказуемый расход на AI-инструменты. Эта задача решается отдельно от продуктовой экономики OpenAI — через сервисы, где расход видно и можно ограничить на уровне команды: в provod.ai для этого есть корпоративное рабочее пространство с ролями и управлением доступом участников, контроль использования и расходов команды и единый баланс организации — в пределах функций, которые сервис поддерживает. Доступа к самому режиму Work это не даёт: Work остаётся функцией подписки OpenAI, и подменить её сторонним доступом к моделям нельзя.

Итог простой и не изменится, пока кто-то независимо не протестирует именно GPT-5.6-версию Work: доверяйте агенту всё, что не требует пароля, оплаты или прохождения проверки на бота, и ставьте жёсткую контрольную точку ровно перед этими тремя действиями — независимо от того, что говорит собственный red-team тест OpenAI.


provod.ai — управляемая работа команды с внутренними материалами

Когда AI помогает анализировать договоры, отчёты или базу знаний, личные аккаунты становятся риском: отдельные пользователи, роли и общий корпоративный контур упрощают контроль доступа.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Безопасная организация работы не меняет тариф модели: официальная стоимость действует 1:1, без собственной наценки provod.ai.

Организуйте доступ к внутренним данным: форма регистрации · цены на модели · защита данных по 152-ФЗ · политика обработки данных

Источники

Top comments (0)