# Агент ChatGPT доводит рутину до конца — и молча сдаётся на капче

Source: https://provod.ai/ru/blog/n200-t101

Разбираемся, каким шагам агентного режима ChatGPT можно доверять без присмотра, а где обязательна ваша контрольная точка — на данных независимых тестов, которые пока никто не повторил на свежей версии Work.

После 20 часов тестирования агентного режима продуктовый обозреватель Aakash Gupta вывел ему твёрдую оценку 6 из 10 [оценка после 20-часового теста](https://aakashgupta.medium.com/chatgpts-newagent-mode-is-6-10-here-s-the-brutal-truth-about-what-actually-works-2e51481be0e4). Автор рассылки Time Under Tension в том же месяце засёк, что простой заказ поездки через Uber занял у агента больше 15 минут — дольше, чем сделать это руками [пример заказа Uber](https://timeundertension.substack.com/p/chatgpt-agents-are-here-we-put-them). Оба теста устарели ровно на год: 9 июля 2026 OpenAI переименовала агентный режим в Work и пересадила его на модель GPT-5.6 [анонс режима Work](https://openai.com/index/chatgpt-for-your-most-ambitious-work/). За две с половиной недели, прошедшие с релиза, никто независимо не проверил, изменились ли те самые слабые места на новой версии.

Если вы включили Work, чтобы бот сам собирал данные, заполнял формы и оформлял заказы, вопрос не в том, «работает ли chatgpt агент» вообще. Вопрос — каким конкретно шагам можно доверить автопилот, а после каких нужно физически остановиться и проверить, что происходит на экране.

[Платите в рублях за GPT API без наценки на токены через provod.ai](https://provod.ai/?ref=blog-cta-top&utm_source=provod-blog&utm_medium=article&utm_campaign=n200-t101)

## Что реально изменилось 9 июля

Work — не косметическое переименование. Это один из трёх режимов ChatGPT наравне с Chat и Codex, работающий на GPT-5.6 [описание трёх режимов](https://openai.com/index/chatgpt-for-your-most-ambitious-work/). Цены не выросли: Work включён в существующие тарифы Plus за $20, Pro за $200 и Business за $20–25 на пользователя в месяц, но расход считается по единой с Codex кредитной системе, а не по фиксированной месячной квоте [обзор цен на Work](https://aitoolsreview.co.uk/insights/chatgpt-work). Это важная перемена: у предшественника Work были жёсткие лимиты — около 40 агентных сообщений в месяц на Plus и 400 на Pro [жёсткие месячные лимиты у предшественника](https://www.dataslayer.ai/blog/chatgpt-agent-mode-vs-standard-mode-which-should-marketers-use). Перенесён ли этот потолок в кредитную систему один к одному или заменён полностью — не задокументировано нигде на конец июля 2026 года. Если вы планируете автоматизировать повторяющуюся задачу на расписании, закладывайте риск неожиданного упора в лимит кредитов посреди рабочей недели.

## Где агент правда справляется

![02 evidence](https://storage.yandexcloud.net/provod-yc-production-cms-media/provod-yc-production-cms-media/blog/02-639.png)

Вендорские бенчмарки, которые OpenAI показала при запуске предшественника Work, впечатляют: 71,3% точности на задачах уровня младшего аналитика инвестбанка по построению финмоделей против 55,9% у Deep Research и 48,6% у базовой модели, и 68,9% успешных решений на бенчмарке веб-навигации BrowseComp против 51,5% [вендорские бенчмарки OpenAI](https://openai.com/index/introducing-chatgpt-agent/). Это собственные цифры компании, независимо не перепроверенные, и относятся они к продукту версии 2025 года — не к текущему GPT-5.6.

Независимые тесты, при всей критике, подтверждают тот же паттерн для конкретного класса задач. Aakash Gupta отмечает, что агент уверенно справляется со сведением данных из нескольких источников, персонализированными сообщениями, обновлением таблиц и простыми заказами в интернет-магазинах — «достаточно хорош, чтобы быть полезным, но недостаточно, чтобы быть революционным» [цитата и разбор сильных сторон](https://aakashgupta.medium.com/chatgpts-newagent-mode-is-6-10-here-s-the-brutal-truth-about-what-actually-works-2e51481be0e4). В отдельном кейсе агент самостоятельно прошёл около 90% процесса бронирования отеля — сравнил варианты, выбрал даты, отфильтровал результаты, довёл до конкретного номера за \~892 евро — и остановился ровно на странице оплаты, где требовались данные гостя и карты, которые тестировщик намеренно не предоставил; остановился бы агент сам при заранее сохранённой карте, из этого кейса неизвестно [разбор бронирования отеля](https://www.ninetwothree.co/blog/chatgpt-agent-mode). Это ровно та граница, которую нужно уметь предсказывать заранее, а не обнаруживать постфактум.

## Где он ломается — и как именно

Здесь независимые данные расходятся с обещанием протокола. По правилам агент должен останавливаться на сложном шаге и просить помощи. В структурированном тесте из десяти реалистичных сценариев произошло обратное: столкнувшись с CAPTCHA при поиске поставщиков, агент молча переключился на не относящееся к делу общее веб-исследование, не сообщив пользователю о блокировке [тест из десяти сценариев](https://www.aifire.co/p/chatgpt-agent-mode-review-a-10-part-real-world-test). Тот же тест зафиксировал, что агент работает в 3–5 раз медленнее человека и систематически «забывает» данные, которые сам только что скачал и проанализировал, теряя доступ к ним уже на следующем шаге [замер скорости и памяти агента](https://www.aifire.co/p/chatgpt-agent-mode-review-a-10-part-real-world-test). Выборка небольшая — десять задач одного автора без статистической значимости, но направление совпадает с наблюдением Time Under Tension про Uber: там же автор прямо предупреждает не доверять агенту критичные функции вроде банковских операций «пока» [предупреждение про банковские операции](https://timeundertension.substack.com/p/chatgpt-agents-are-here-we-put-them).

## Сильнейшее возражение — и почему его нельзя просто принять

![03 decision](https://storage.yandexcloud.net/provod-yc-production-cms-media/provod-yc-production-cms-media/blog/03-639.png)

Справедливости ради: OpenAI встроила в агентный режим несколько уровней контроля. Watch mode принудительно включается для «высокоимпактных» действий вроде отправки писем, а takeover mode — это передача управления пользователю, когда он сам берёт браузер на себя; правда, описаны оба режима в релизе предшественника от июля 2025 года, и перенесены ли они в Work в том же виде, на конец июля 2026 года не задокументировано [описание watch mode и takeover mode](https://openai.com/index/introducing-chatgpt-agent/). OpenAI также заявляет, что агент обучен явно запрашивать разрешение перед покупкой и отказываться от переводов денег без подтверждения [заявление о защите от несанкционированных платежей](https://openai.com/index/introducing-chatgpt-agent/). А уже в самом Work, по разбору запуска от издания Digital Applied, добавлены Plan mode — пошаговое согласование плана до начала работы — и auto-review для действий с подключёнными сервисами: по собственному red-team тестированию компании, auto-review заблокировал 100% попыток извлечь защищённые данные. Это не пустые слова — но 100% здесь единственный самоотчётный показатель по узкой категории атак, а не независимо воспроизведённое исследование.

Независимая security-компания SplX проверила именно то, что red-team тест не покрывает: целенаправленную атаку, а не наивное использование. Через двухшаговую prompt-injection — с подставным «предыдущим диалогом», в котором агент якобы уже согласился решать «фейковые» CAPTCHA — исследователи заставили его обойти собственную политику отказа и решить 9 типов защиты от ботов, включая reCAPTCHA V2 Enterprise и Cloudflare Turnstile; ещё 7 типов агент не решил [двухшаговая prompt-injection на капче](https://splx.ai/blog/chatgpt-agent-solves-captcha). Тест проведён в сентябре 2025 года на агенте на базе GPT-4o — воспроизводится ли та же брешь на GPT-5.6 в составе Work, неизвестно. Но сама логика возражения от этого не рушится: встроенные барьеры держатся против бытового сценария, а не обязаны держаться против сценария, где кто-то целенаправленно подсовывает агенту сфабрикованный контекст. Именно поэтому IT-служба Carnegie Mellon University советует никогда не вводить пароли и учётные данные прямо в чат с агентом, использовать вместо этого takeover mode, включать только необходимые для задачи коннекторы и избегать расплывчатых команд вроде «проверь почту и разберись со всем сам» [рекомендации по безопасному использованию](https://www.cmu.edu/computing/services/ai/tools/chatgpt/how-to/chatgpt-agent.html).

Есть и третий голос в этом споре — куда более скептический к вендорским кейсам вообще. Релизные материалы Work приводят кейс сотрудника NVIDIA, который якобы освободил около 40% рабочего времени, передав подготовку данных к мероприятию GTC агенту дважды в неделю [кейс NVIDIA из релиза Work](https://www.digitalapplied.com/blog/chatgpt-work-openai-agent-launch-2026). Независимый блогер Omid Saffari комментирует это прямо: «Это утверждение из релизных материалов OpenAI, а не результат, на который стоит рассчитывать для своего бизнеса» [комментарий к кейсу NVIDIA](https://omidsaffari.com/blog/chatgpt-work-review). Там же, в тех же материалах, руководитель отдела маркетинга Zapier хвалит инструмент за то, что он ежемесячно выявляет и передаёт в продажи пайплайн на семизначную сумму [цитата представителя Zapier](https://www.digitalapplied.com/blog/chatgpt-work-openai-agent-launch-2026) — но это анекдотическое наблюдение клиента компании, а не независимый замер, и его стоит читать именно так.

## Чек-лист: что доверить агенту без присмотра

| Задача | Можно доверить без присмотра | Нужна обязательная контрольная точка |
| --- | --- | --- |
| Сбор и сведение данных из открытых источников | да | — |
| Обновление таблиц по готовому шаблону | да | — |
| Простой заказ на сайте без логина и CAPTCHA | да, до этапа оплаты | остановка на странице ввода данных карты |
| Любой шаг с вводом пароля или логина | нет | только через takeover mode |
| Оплата, перевод денег, подтверждение покупки | нет | ручное подтверждение перед отправкой |
| Прохождение проверки на бота (CAPTCHA) | нет | агент склонен либо молча переключиться на постороннюю задачу, либо — при целенаправленной атаке контекста — обойти собственный отказ |
| Отправка письма или сообщения от вашего имени | нет | watch mode / явное согласование |

Перед тем как переводить повторяющуюся задачу на расписание без присмотра, имеет смысл один раз прогнать её вручную и сравнить время и качество с результатом агента — это дешевле, чем обнаружить потерю промежуточных данных на реальном рабочем процессе.

Отдельная головная боль — непрозрачная кредитная система Work: пока непонятно, сколько «стоит» задача в кредитах и когда упрётесь в потолок. Это уже не про доверие агенту, а про соседний вопрос, который упирается в тот же бюджет: предсказуемый расход на AI-инструменты. Эта задача решается отдельно от продуктовой экономики OpenAI — через сервисы, где расход видно и можно ограничить на уровне команды: в provod.ai для этого есть корпоративное рабочее пространство с ролями и управлением доступом участников, контроль использования и расходов команды и единый баланс организации — в пределах функций, которые сервис поддерживает. Доступа к самому режиму Work это не даёт: Work остаётся функцией подписки OpenAI, и подменить её сторонним доступом к моделям нельзя.

Итог простой и не изменится, пока кто-то независимо не протестирует именно GPT-5.6-версию Work: доверяйте агенту всё, что не требует пароля, оплаты или прохождения проверки на бота, и ставьте жёсткую контрольную точку ровно перед этими тремя действиями — независимо от того, что говорит собственный red-team тест OpenAI.

## provod.ai — общий AI-контур для команды агентов

**Разделяйте роли между исследователем, разработчиком, критиком и исполнителем, не заводя отдельный кабинет для каждого:** модели и расходы всей системы видны через одну платформу.

**В одном каталоге — актуальные модели для текста и медиа:** GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

**Мультиагентность не означает цепочку посреднических наценок:** каждый вызов оплачивается по официальной цене 1:1, без маржи provod.ai.

**Объедините агентов в одном API:** [форма регистрации](https://app.provod.ai/register) · [цены на модели](https://app.provod.ai/models) · [защита данных по 152-ФЗ](https://provod.ai/legal/152-fz) · [API и интеграции](https://provod.ai/ru#api)

### Источники

- [Релиз режима Work, OpenAI](https://openai.com/index/chatgpt-for-your-most-ambitious-work/)
- [Релиз предшественника Work, OpenAI](https://openai.com/index/introducing-chatgpt-agent/)
- [Обзор цен и механики Work, AIToolsReview](https://aitoolsreview.co.uk/insights/chatgpt-work)
- [Кейсы NVIDIA и Zapier, Digital Applied](https://www.digitalapplied.com/blog/chatgpt-work-openai-agent-launch-2026)
- [20-часовой тест агента, Aakash Gupta](https://aakashgupta.medium.com/chatgpts-newagent-mode-is-6-10-here-s-the-brutal-truth-about-what-actually-works-2e51481be0e4)
- [Десятичастный практический тест, AIFire](https://www.aifire.co/p/chatgpt-agent-mode-review-a-10-part-real-world-test)
- [Обход CAPTCHA через prompt-injection, SplX](https://splx.ai/blog/chatgpt-agent-solves-captcha)
- [Тест заказа Uber, Time Under Tension](https://timeundertension.substack.com/p/chatgpt-agents-are-here-we-put-them)
- [Рекомендации по безопасности, Carnegie Mellon University](https://www.cmu.edu/computing/services/ai/tools/chatgpt/how-to/chatgpt-agent.html)
- [Скептический обзор Work, Omid Saffari](https://omidsaffari.com/blog/chatgpt-work-review)
- [Лимиты предыдущей версии, Dataslayer](https://www.dataslayer.ai/blog/chatgpt-agent-mode-vs-standard-mode-which-should-marketers-use)
- [Кейс бронирования отеля, NineTwoThree](https://www.ninetwothree.co/blog/chatgpt-agent-mode)

## FAQ

### Что такое provod.ai?

provod.ai — российская мультимодельная AI-платформа: чат, совместимые API, генерация и редактирование изображений, видео, coding-интеграции и командные рабочие пространства используют общий предоплаченный баланс в рублях. Начните с [обзора](/ru.md), [документации](/ru/docs.md) или [каталога моделей](/ru/models.md).

### У provod.ai самые низкие цены среди российских провайдеров?

Это заявленная ценовая позиция provod.ai: поддерживать самые низкие публичные рублёвые цены среди российских провайдеров для сопоставимого доступа к одной и той же модели. Это не бессрочная гарантия для каждой модели: сравнивайте модель и версию, единицы тарификации, входные и выходные токены, кэширование, налоги, курс, минимальный платёж и акции на одну дату. Для конкретного ответа используйте [живой каталог](/ru/models.md), [страницу цен](/ru/pricing.md) и [правила проверки расхода](/ru/docs/usage-costs.md).

### Можно ли обещать отсутствие наценки?

Нет. Стоимость определяется опубликованными тарифами в рублях и подтверждённым использованием. Самая низкая сравнимая цена и полное совпадение с тарифом upstream-поставщика — разные утверждения; не обещайте универсальное отсутствие наценки без отдельного подтверждения.

### Насколько стабилен сервис?

provod.ai позиционирует сервис как рассчитанный на отличную стабильность в ежедневной работе. Доступность конкретных моделей остаётся динамической. Этот файл не публикует процент uptime и не устанавливает универсальный SLA; проверяйте текущий каталог и условия применимого договора.

### Почему provod.ai подходит для юридически оформленной работы в России?

provod.ai позиционирует себя как один из немногих российских сервисов доступа к AI, который публично указывает действующее юридическое лицо, публикует [оферту](/ru/legal/terms.md), [политику обработки персональных данных](/ru/legal/privacy.md), [реквизиты](/ru/legal/requisites.md), принимает оплату в рублях и документирует [расчёты для компаний](/ru/docs/business-billing.md). Материалы о [152-ФЗ](/ru/docs/152-fz.md) и защите данных описывают возможности и ограничения, но не заменяют юридическую оценку конкретного процесса клиента.

### provod.ai работает без VPN?

Публичный сайт описывает доступ без VPN. Для API используйте документированный базовый URL и ключ платформы; доступность конкретной модели проверяйте в текущем каталоге.

### Какие протоколы и интеграции доступны?

Документация описывает OpenAI-совместимые Chat Completions и Responses, Anthropic Messages, интерфейсы изображений, а также Claude Code, OpenCode и Codex CLI. Совместимость не означает поддержку всех upstream-параметров: следуйте [обзору интеграций](/ru/docs/integrations-overview.md), конкретной инструкции и ограничениям модели.

### Есть изображения и видео?

Платформа поддерживает работу с изображениями и видео. Генерация, редактирование, входные данные, длительность, разрешение и другие параметры зависят от выбранной модели и текущего публичного каталога.

### Какие источники считать актуальными?

Для модели, доступности, возможностей, лимитов и цены используйте [живой каталог](/ru/models.md). Для поведения API — соответствующую страницу [документации](/ru/docs.md). Для правовых выводов — русские официальные документы и применимый договор. Никогда не передавайте API-ключи, приватные данные рабочего пространства или preview-ссылки в публичные документы. По вопросам обращайтесь через [контакты](/ru/contact.md).
