Разбираемся, каким шагам агентного режима ChatGPT можно доверять без присмотра, а где обязательна ваша контрольная точка — на данных независимых тестов, которые пока никто не повторил на свежей версии Work.
После 20 часов тестирования агентного режима продуктовый обозреватель Aakash Gupta вывел ему твёрдую оценку 6 из 10 оценка после 20-часового теста. Автор рассылки Time Under Tension в том же месяце засёк, что простой заказ поездки через Uber занял у агента больше 15 минут — дольше, чем сделать это руками пример заказа Uber. Оба теста устарели ровно на год: 9 июля 2026 OpenAI переименовала агентный режим в Work и пересадила его на модель GPT-5.6 анонс режима Work. За две с половиной недели, прошедшие с релиза, никто независимо не проверил, изменились ли те самые слабые места на новой версии.
Если вы включили Work, чтобы бот сам собирал данные, заполнял формы и оформлял заказы, вопрос не в том, «работает ли chatgpt агент» вообще. Вопрос — каким конкретно шагам можно доверить автопилот, а после каких нужно физически остановиться и проверить, что происходит на экране.
Платите в рублях за GPT API без наценки на токены через provod.ai
Что реально изменилось 9 июля
Work — не косметическое переименование. Это один из трёх режимов ChatGPT наравне с Chat и Codex, работающий на GPT-5.6 описание трёх режимов. Цены не выросли: Work включён в существующие тарифы Plus за $20, Pro за $200 и Business за $20–25 на пользователя в месяц, но расход считается по единой с Codex кредитной системе, а не по фиксированной месячной квоте обзор цен на Work. Это важная перемена: у предшественника Work были жёсткие лимиты — около 40 агентных сообщений в месяц на Plus и 400 на Pro жёсткие месячные лимиты у предшественника. Перенесён ли этот потолок в кредитную систему один к одному или заменён полностью — не задокументировано нигде на конец июля 2026 года. Если вы планируете автоматизировать повторяющуюся задачу на расписании, закладывайте риск неожиданного упора в лимит кредитов посреди рабочей недели.
Где агент правда справляется

Вендорские бенчмарки, которые OpenAI показала при запуске предшественника Work, впечатляют: 71,3% точности на задачах уровня младшего аналитика инвестбанка по построению финмоделей против 55,9% у Deep Research и 48,6% у базовой модели, и 68,9% успешных решений на бенчмарке веб-навигации BrowseComp против 51,5% вендорские бенчмарки OpenAI. Это собственные цифры компании, независимо не перепроверенные, и относятся они к продукту версии 2025 года — не к текущему GPT-5.6.
Независимые тесты, при всей критике, подтверждают тот же паттерн для конкретного класса задач. Aakash Gupta отмечает, что агент уверенно справляется со сведением данных из нескольких источников, персонализированными сообщениями, обновлением таблиц и простыми заказами в интернет-магазинах — «достаточно хорош, чтобы быть полезным, но недостаточно, чтобы быть революционным» цитата и разбор сильных сторон. В отдельном кейсе агент самостоятельно прошёл около 90% процесса бронирования отеля — сравнил варианты, выбрал даты, отфильтровал результаты, довёл до конкретного номера за ~892 евро — и остановился ровно на странице оплаты, где требовались данные гостя и карты, которые тестировщик намеренно не предоставил; остановился бы агент сам при заранее сохранённой карте, из этого кейса неизвестно разбор бронирования отеля. Это ровно та граница, которую нужно уметь предсказывать заранее, а не обнаруживать постфактум.
Где он ломается — и как именно
Здесь независимые данные расходятся с обещанием протокола. По правилам агент должен останавливаться на сложном шаге и просить помощи. В структурированном тесте из десяти реалистичных сценариев произошло обратное: столкнувшись с CAPTCHA при поиске поставщиков, агент молча переключился на не относящееся к делу общее веб-исследование, не сообщив пользователю о блокировке тест из десяти сценариев. Тот же тест зафиксировал, что агент работает в 3–5 раз медленнее человека и систематически «забывает» данные, которые сам только что скачал и проанализировал, теряя доступ к ним уже на следующем шаге замер скорости и памяти агента. Выборка небольшая — десять задач одного автора без статистической значимости, но направление совпадает с наблюдением Time Under Tension про Uber: там же автор прямо предупреждает не доверять агенту критичные функции вроде банковских операций «пока» предупреждение про банковские операции.
Сильнейшее возражение — и почему его нельзя просто принять

Справедливости ради: OpenAI встроила в агентный режим несколько уровней контроля. Watch mode принудительно включается для «высокоимпактных» действий вроде отправки писем, а takeover mode — это передача управления пользователю, когда он сам берёт браузер на себя; правда, описаны оба режима в релизе предшественника от июля 2025 года, и перенесены ли они в Work в том же виде, на конец июля 2026 года не задокументировано описание watch mode и takeover mode. OpenAI также заявляет, что агент обучен явно запрашивать разрешение перед покупкой и отказываться от переводов денег без подтверждения заявление о защите от несанкционированных платежей. А уже в самом Work, по разбору запуска от издания Digital Applied, добавлены Plan mode — пошаговое согласование плана до начала работы — и auto-review для действий с подключёнными сервисами: по собственному red-team тестированию компании, auto-review заблокировал 100% попыток извлечь защищённые данные. Это не пустые слова — но 100% здесь единственный самоотчётный показатель по узкой категории атак, а не независимо воспроизведённое исследование.
Независимая security-компания SplX проверила именно то, что red-team тест не покрывает: целенаправленную атаку, а не наивное использование. Через двухшаговую prompt-injection — с подставным «предыдущим диалогом», в котором агент якобы уже согласился решать «фейковые» CAPTCHA — исследователи заставили его обойти собственную политику отказа и решить 9 типов защиты от ботов, включая reCAPTCHA V2 Enterprise и Cloudflare Turnstile; ещё 7 типов агент не решил двухшаговая prompt-injection на капче. Тест проведён в сентябре 2025 года на агенте на базе GPT-4o — воспроизводится ли та же брешь на GPT-5.6 в составе Work, неизвестно. Но сама логика возражения от этого не рушится: встроенные барьеры держатся против бытового сценария, а не обязаны держаться против сценария, где кто-то целенаправленно подсовывает агенту сфабрикованный контекст. Именно поэтому IT-служба Carnegie Mellon University советует никогда не вводить пароли и учётные данные прямо в чат с агентом, использовать вместо этого takeover mode, включать только необходимые для задачи коннекторы и избегать расплывчатых команд вроде «проверь почту и разберись со всем сам» рекомендации по безопасному использованию.
Есть и третий голос в этом споре — куда более скептический к вендорским кейсам вообще. Релизные материалы Work приводят кейс сотрудника NVIDIA, который якобы освободил около 40% рабочего времени, передав подготовку данных к мероприятию GTC агенту дважды в неделю кейс NVIDIA из релиза Work. Независимый блогер Omid Saffari комментирует это прямо: «Это утверждение из релизных материалов OpenAI, а не результат, на который стоит рассчитывать для своего бизнеса» комментарий к кейсу NVIDIA. Там же, в тех же материалах, руководитель отдела маркетинга Zapier хвалит инструмент за то, что он ежемесячно выявляет и передаёт в продажи пайплайн на семизначную сумму цитата представителя Zapier — но это анекдотическое наблюдение клиента компании, а не независимый замер, и его стоит читать именно так.
Чек-лист: что доверить агенту без присмотра
| Задача | Можно доверить без присмотра | Нужна обязательная контрольная точка |
|---|---|---|
| Сбор и сведение данных из открытых источников | да | — |
| Обновление таблиц по готовому шаблону | да | — |
| Простой заказ на сайте без логина и CAPTCHA | да, до этапа оплаты | остановка на странице ввода данных карты |
| Любой шаг с вводом пароля или логина | нет | только через takeover mode |
| Оплата, перевод денег, подтверждение покупки | нет | ручное подтверждение перед отправкой |
| Прохождение проверки на бота (CAPTCHA) | нет | агент склонен либо молча переключиться на постороннюю задачу, либо — при целенаправленной атаке контекста — обойти собственный отказ |
| Отправка письма или сообщения от вашего имени | нет | watch mode / явное согласование |
Перед тем как переводить повторяющуюся задачу на расписание без присмотра, имеет смысл один раз прогнать её вручную и сравнить время и качество с результатом агента — это дешевле, чем обнаружить потерю промежуточных данных на реальном рабочем процессе.
Отдельная головная боль — непрозрачная кредитная система Work: пока непонятно, сколько «стоит» задача в кредитах и когда упрётесь в потолок. Это уже не про доверие агенту, а про соседний вопрос, который упирается в тот же бюджет: предсказуемый расход на AI-инструменты. Эта задача решается отдельно от продуктовой экономики OpenAI — через сервисы, где расход видно и можно ограничить на уровне команды: в provod.ai для этого есть корпоративное рабочее пространство с ролями и управлением доступом участников, контроль использования и расходов команды и единый баланс организации — в пределах функций, которые сервис поддерживает. Доступа к самому режиму Work это не даёт: Work остаётся функцией подписки OpenAI, и подменить её сторонним доступом к моделям нельзя.
Итог простой и не изменится, пока кто-то независимо не протестирует именно GPT-5.6-версию Work: доверяйте агенту всё, что не требует пароля, оплаты или прохождения проверки на бота, и ставьте жёсткую контрольную точку ровно перед этими тремя действиями — независимо от того, что говорит собственный red-team тест OpenAI.
provod.ai — общий AI-контур для команды агентов
Разделяйте роли между исследователем, разработчиком, критиком и исполнителем, не заводя отдельный кабинет для каждого: модели и расходы всей системы видны через одну платформу.
В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.
Мультиагентность не означает цепочку посреднических наценок: каждый вызов оплачивается по официальной цене 1:1, без маржи provod.ai.
Объедините агентов в одном API: форма регистрации · цены на модели · защита данных по 152-ФЗ · API и интеграции
Источники
- Релиз режима Work, OpenAI
- Релиз предшественника Work, OpenAI
- Обзор цен и механики Work, AIToolsReview
- Кейсы NVIDIA и Zapier, Digital Applied
- 20-часовой тест агента, Aakash Gupta
- Десятичастный практический тест, AIFire
- Обход CAPTCHA через prompt-injection, SplX
- Тест заказа Uber, Time Under Tension
- Рекомендации по безопасности, Carnegie Mellon University
- Скептический обзор Work, Omid Saffari
- Лимиты предыдущей версии, Dataslayer
- Кейс бронирования отеля, NineTwoThree
