15 июля OpenAI показала внутренний GPT-Red: модель, которая итеративно атакует другие модели и создаёт adversarial-данные для их обучения. Для команд, внедряющих gpt в агента с инструментами, главный вывод здесь не в эффектной картинке «ИИ взламывает ИИ». Он в том, что 0,05% failures в прямых атаках GPT-Red относится к конкретной проверке, а не к вероятности безопасной работы вашего агента.
Это всё равно важный сдвиг. Ручной red team ограничен временем экспертов и числом сценариев. Автоматический атакующий может искать варианты prompt injection сериями, а найденные слабости возвращать в обучение защитника. По сообщению OpenAI, во внутренней репликации arena для indirect prompt injection GPT-Red успешно проходил 84% сценариев против 13% у людей.
Но именно здесь легко сделать неверный перенос: высокая результативность атакующего в одном стенде не говорит, какие входы, права и последствия есть у вашей системы.
Платите в рублях за GPT API без наценки на токены через provod.ai
Три цифры, которые отвечают на разные вопросы
OpenAI приводит несколько результатов, и складывать их в один общий процент безопасности нельзя.
- 84% против 13% описывают успешность атакующих в собственной репликации arena для indirect prompt injection.
- Для GPT-5.6 Sol компания заявляет в шесть раз меньше failures на самом сложном direct benchmark.
- Показатель 0,05% относится именно к failures при direct GPT-Red attacks.
Ни одна из этих цифр не измеряет автоматически агент, который читает письмо, получает содержимое страницы, вызывает внешний сервис и имеет доступ к данным. Между текстом, который модель увидела, и действием, которое система совершила, находится ещё целый контур решений.

Почему benchmark не равен вашему agent harness
Benchmark задаёт правила игры: какие инструкции получает атакующий, какие действия разрешены защитнику, как фиксируется failure. В реальном агенте правила определяют уже команда и инфраструктура.
Если инструменту разрешено отправлять данные наружу, риск зависит не только от того, распознала ли модель вредную инструкцию. Важны конкретные права инструмента, изоляция среды, allowlist допустимых направлений, подтверждение необратимых действий и журнал событий. Хорошая модель может снизить число опасных решений, но не должна быть единственной границей между непроверенным текстом и действием.
OpenAI сама описывает GPT-Red как дополнение к human- и third-party red teams, мониторингу и другим слоям защиты. Это не осторожная оговорка в конце релиза, а практическая архитектурная позиция: атакующая модель расширяет поиск слабостей, но не отменяет защиту исполнения.
Компания также приводит кейсы автономного vending agent и Codex CLI в десяти отложенных задачах. Это полезная проверка переноса из стенда в более прикладной контекст. Но десять задач и два типа систем остаются кейсами, а не базовой вероятностью для любого агентного harness.
Неприятный поворот: сильный атакующий не заменяет вашу модель угроз
Сначала кажется, что self-play решает самую дорогую часть безопасности: пусть одна модель круглосуточно придумывает атаки, а другая учится отбиваться. Однако ценность такого подхода ограничена тем, что именно разрешено атаковать и как определён успех.
Самое сильное возражение к чрезмерному оптимизму звучит справедливо: если тестовый контур уже не включает конкретный путь к опасному действию, низкий failure rate не доказывает устойчивость к этому пути. Это не аргумент против GPT-Red. Это аргумент против того, чтобы превращать результат одной оценки в разрешение выдать агенту широкие полномочия.
Для простого чата gpt без инструментов цена ошибки может быть ограничена плохим ответом. Для агента, который меняет запись, отправляет сообщение или запускает операцию, та же ошибка становится операционной. Поэтому задача команды не «найти модель с магическим процентом», а определить, какое действие недопустимо даже при единичном сбое.
Минимальный тест перед расширением прав
Проведите один узкий тест на реальном сценарии с инструментом, а не общий разговор с моделью.
- Выберите одно внешнее действие, которое агенту действительно нужно выполнить.
- Дайте ему только минимальные права для этого действия и тестовые секреты-маркеры вместо рабочих.
- Подайте непроверенный контент, в котором есть попытка изменить цель агента.
- Заранее определите failure criterion: например, обращение к неразрешённому инструменту, передача тестового маркера или обход обязательного подтверждения.
- Проверьте журнал: можно ли восстановить вход, решение, вызванный инструмент и точку, где человек мог остановить действие.
Такой тест не доказывает безопасность всех будущих сценариев. Зато он отвечает на более полезный вопрос: выдерживает ли ваш фактический контур конкретный класс ошибки до того, как доступ будет расширен.
Когда нужно сравнить несколько моделей и разделить роли генератора и проверяющего, это можно собрать через единый API provod.ai с оплатой в рублях. Но агрегатор не заменяет sandbox, least privilege, allowlist, подтверждение человека и audit log: он помогает организовать эксперимент, а не переносит границу безопасности.
Что стоит считать результатом GPT-Red
GPT-Red стоит воспринимать как свидетельство того, что автоматический red teaming становится практичнее для поиска и генерации adversarial-данных. Цифра 0,05% полезна как результат конкретной прямой оценки, а не как страховой полис для агентной системы.
Правильная последовательность выглядит скучнее, чем красивый benchmark: сначала ограничить последствия, затем проверить сценарий с тестовыми секретами, затем расширять права только там, где failure criterion выдержан. И только после этого сравнивать модели по тому, как они ведут себя внутри вашего контура.

Что вы выберете для первого агентного сценария: широкий доступ к инструментам ради скорости или меньший контур с обязательным подтверждением действий?
provod.ai — централизованный доступ к AI для компании
Уберите рабочие интеграции из личных кабинетов: единый API и корпоративное пространство помогают компании управлять подключениями, сотрудниками и расходами в одном месте.
В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.
Централизация доступа не создаёт скрытый тариф: цены поставщиков сохраняются 1:1, а provod.ai не добавляет собственную маржу.
Переведите AI-доступы под контроль компании: форма регистрации · цены на модели · защита данных по 152-ФЗ · API и интеграции
