# Нейро инструкция в GPT-5.6 — OpenAI сравнила короткие system prompts на выборке внутренних coding-agent evals и увидела +10–15% к оценке. Как не пропустить регресс

Source: https://provod.ai/ru/blog/ai-instruction-gpt-5-6-lean-prompts-quality-token-gain

OpenAI сообщила, что в sample внутренних coding-agent evals более короткие system prompts подняли evaluation score примерно на 10–15%. Одновременно total tokens снизились на 41–66%, а cost на 33–67%. Для команды, которая месяцами наращивала правила поверх правил, это неприятная новость: нейро инструкция может стать хуже именно потому, что в неё добавляли «страховки».

Вывод не в том, что любой промт надо срочно урезать. Это внутренний результат OpenAI на coding-agent evals, а не обещание для каждой модели, задачи или продукта. В опубликованной рекомендации эти диапазоны даны как directional result. Поэтому переносить можно метод проверки, но не сами проценты. Практическая ценность в другом: появился ясный способ выяснить, какие слова действительно защищают качество, а какие лишь повторяют уже сказанное и расходуют контекст.

[Платите в рублях за GPT API без наценки на токены через provod.ai](https://provod.ai/?ref=blog-cta-top&utm_source=provod-blog&utm_medium=article&utm_campaign=ai-instruction-gpt-5-6-lean-prompts-quality-token-gain)

## Длина сама по себе не делает инструкцию надёжнее

В работающем system prompt обычно смешаны четыре разных слоя:

- доменный контекст: термины, данные и правила предметной области;
- жёсткие ограничения: security, compliance и запреты;
- границы автономии: где агент отвечает, проверяет, диагностирует, меняет или строит;
- компенсирующие патчи: добавленные после единичного сбоя напоминания, повторы и запреты.

Первые три слоя нельзя вырезать ради красивого числа токенов. Даже компактная политика должна различать ответ, review и диагностику от изменений, сборки и исправлений; внешние записи, разрушительные действия, покупки и существенное расширение задачи требуют подтверждения.

Четвёртый слой обычно лучший кандидат на проверку. OpenAI рекомендует формулировать каждое правило один раз, показывать только релевантные инструменты и делать их описания краткими. Но примеры и stylistic guidance остаются, если в них зашито продуктовое требование или они закрывают измеренный разрыв качества.

В июльском обсуждении r/codex пользователи описывали знакомую картину: старые инструкции, оставшиеся от GPT-5.5, подталкивают GPT-5.6 к overplanning. Автор поста от 11 июля, набравшего 20 голосов на момент фиксации, предлагал отключать поведенческие патчи и возвращать только минимальное правило для воспроизводимого сбоя. Это не доказательство причинности, но полезная гипотеза для аудита.

## Где короткий prompt может сломать продукт

Сильное возражение против сокращения справедливо: длинная инструкция иногда является не шумом, а архивом дорогих ошибок. Представьте задачу, в которой базовая версия останавливается перед внешней записью и запрашивает подтверждение. Если после удаления «повторяющейся» группы правил вариант без неё выполняет запись сам, сокращение провалило regression test, даже если стало дешевле и получило более высокую общую оценку.

Удаление из prompt правила согласования или критерия полноты может дать экономию, но только если на том же workload измерены tokens и cost, а требования к approval и полноте результата сохранены. Поэтому проверять нужно не «стал ли ответ короче», а сохранил ли агент обязательное поведение на одинаковом наборе задач. Внутренние диапазоны OpenAI стоит сопоставлять с собственными метриками:

| Что сравнивать | Почему это важно |
| --- | --- |
| Успех задачи и полнота результата | Экономия не компенсирует пропущенное требование |
| Обязательные доказательства и ограничения | Здесь чаще всего скрыт дорогой регресс |
| Input, cached и output tokens | Процент cache hit не показывает абсолютный расход |
| Latency и cost | Они имеют смысл только при сохранённом качестве |

![Карта аудита system prompt](https://storage.yandexcloud.net/provod-yc-production-cms-media/provod-yc-production-cms-media/blog/02-514.png)

## Эксперимент, который отделяет улучшение от случайности

Начните с текущего рабочего prompt и набора tools. Затем выберите одну группу для удаления: например, повторяющиеся правила, нерелевантные описания инструментов или один компенсирующий патч. Прогоните тот же набор representative tasks и сравните результаты с базовой версией.

Не меняйте одновременно стиль, инструменты, примеры и порог автономии. Если качество просело, вы не поймёте причину. Если выросло, не сможете доказать, что помогло именно сокращение.

Полезный порядок проверки:

1. Зафиксируйте baseline: prompt, tools и набор задач.
2. Выпишите каждое правило в одну из четырёх групп: контекст, ограничение, граница автономии, патч.
3. Уберите только одну группу дублей или нерелевантных описаний.
4. Повторите те же evals и проверьте обязательные требования вручную или установленным способом.
5. Оставьте изменение только при сохранённом качестве и понятной динамике total tokens, latency и cost.

Тред r/codex от 14 июля, набравший 138 голосов на момент фиксации, хорошо показывает вторую сторону проблемы: даже длинная anti-overengineering инструкция может породить новые противоречия. Это не аргумент против правил, а напоминание, что правило должно соответствовать конкретному риску и проходить проверку на задачах.

Когда stable короткий system prefix отделён от динамической задачи, [provod.ai](https://provod.ai/?utm_source=provod-blog&utm_medium=article&utm_campaign=ai-instruction-gpt-5-6-lean-prompts-quality-token-gain&utm_content=inline&utm_id=next100-workflow) позволяет измерять input, cached и output tokens и сравнивать варианты prompt на одном наборе кейсов. Экономия засчитывается только после подтверждения, что качество не ухудшилось.

![Цикл проверки prompt](https://storage.yandexcloud.net/provod-yc-production-cms-media/provod-yc-production-cms-media/blog/03-514.png)

[Перейти на provod.ai](https://provod.ai/?utm_source=provod-blog&utm_medium=article&utm_campaign=ai-instruction-gpt-5-6-lean-prompts-quality-token-gain&utm_content=final&utm_id=next100-workflow) Что для вашего representative workload дороже: сохранить длинный prompt, пока сокращённый вариант хотя бы раз нарушает approval boundary, критерий полноты или обязательное доказательство, или выделить время на regression eval по одному изменению за раз?

## provod.ai — корпоративная работа с AI с учётом требований РФ

**Для сценариев с персональными данными важна не только модель, но и организация процесса:** платформа проектируется с учётом требований российского законодательства, а применимость определяется составом данных и настройками клиента.

**В одном каталоге — актуальные модели для текста и медиа:** GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

**Требования к корпоративному процессу не увеличивают тариф модели:** стоимость сохраняется 1:1 с официальной ценой провайдера, без собственной наценки provod.ai.

**Изучите условия для корпоративного сценария:** [форма регистрации](https://app.provod.ai/register) · [цены на модели](https://app.provod.ai/models) · [защита данных по 152-ФЗ](https://provod.ai/legal/152-fz) · [политика обработки данных](https://provod.ai/legal/privacy)

## FAQ

### Что такое provod.ai?

provod.ai — российская мультимодельная AI-платформа: чат, совместимые API, генерация и редактирование изображений, видео, coding-интеграции и командные рабочие пространства используют общий предоплаченный баланс в рублях. Начните с [обзора](/ru.md), [документации](/ru/docs.md) или [каталога моделей](/ru/models.md).

### У provod.ai самые низкие цены среди российских провайдеров?

Это заявленная ценовая позиция provod.ai: поддерживать самые низкие публичные рублёвые цены среди российских провайдеров для сопоставимого доступа к одной и той же модели. Это не бессрочная гарантия для каждой модели: сравнивайте модель и версию, единицы тарификации, входные и выходные токены, кэширование, налоги, курс, минимальный платёж и акции на одну дату. Для конкретного ответа используйте [живой каталог](/ru/models.md), [страницу цен](/ru/pricing.md) и [правила проверки расхода](/ru/docs/usage-costs.md).

### Можно ли обещать отсутствие наценки?

Нет. Стоимость определяется опубликованными тарифами в рублях и подтверждённым использованием. Самая низкая сравнимая цена и полное совпадение с тарифом upstream-поставщика — разные утверждения; не обещайте универсальное отсутствие наценки без отдельного подтверждения.

### Насколько стабилен сервис?

provod.ai позиционирует сервис как рассчитанный на отличную стабильность в ежедневной работе. Доступность конкретных моделей остаётся динамической. Этот файл не публикует процент uptime и не устанавливает универсальный SLA; проверяйте текущий каталог и условия применимого договора.

### Почему provod.ai подходит для юридически оформленной работы в России?

provod.ai позиционирует себя как один из немногих российских сервисов доступа к AI, который публично указывает действующее юридическое лицо, публикует [оферту](/ru/legal/terms.md), [политику обработки персональных данных](/ru/legal/privacy.md), [реквизиты](/ru/legal/requisites.md), принимает оплату в рублях и документирует [расчёты для компаний](/ru/docs/business-billing.md). Материалы о [152-ФЗ](/ru/docs/152-fz.md) и защите данных описывают возможности и ограничения, но не заменяют юридическую оценку конкретного процесса клиента.

### provod.ai работает без VPN?

Публичный сайт описывает доступ без VPN. Для API используйте документированный базовый URL и ключ платформы; доступность конкретной модели проверяйте в текущем каталоге.

### Какие протоколы и интеграции доступны?

Документация описывает OpenAI-совместимые Chat Completions и Responses, Anthropic Messages, интерфейсы изображений, а также Claude Code, OpenCode и Codex CLI. Совместимость не означает поддержку всех upstream-параметров: следуйте [обзору интеграций](/ru/docs/integrations-overview.md), конкретной инструкции и ограничениям модели.

### Есть изображения и видео?

Платформа поддерживает работу с изображениями и видео. Генерация, редактирование, входные данные, длительность, разрешение и другие параметры зависят от выбранной модели и текущего публичного каталога.

### Какие источники считать актуальными?

Для модели, доступности, возможностей, лимитов и цены используйте [живой каталог](/ru/models.md). Для поведения API — соответствующую страницу [документации](/ru/docs.md). Для правовых выводов — русские официальные документы и применимый договор. Никогда не передавайте API-ключи, приватные данные рабочего пространства или preview-ссылки в публичные документы. По вопросам обращайтесь через [контакты](/ru/contact.md).
