Роль эксперта и вежливость не поднимают точность в независимых замерах, повтор одной инструкции разными словами OpenAI велит вычищать из запроса, а структура и объём вывода результат двигают — но непредсказуемо и по-разному на разных моделях
В отчёте Wharton School на GPQA Diamond один и тот же вопрос гоняли по сто раз, меняя только одно слово — «Please» на «I order». На части вопросов результат сдвигался на 60 процентных пунктов в обе стороны — то в плюс, то в минус. При усреднении по всему датасету эффект вежливости исчезал: он реален локально и случаен глобально, и именно так рождаются «магические» промпты — кто-то один раз попал в удачное совпадение и написал об этом статью, а Ethan Mollick, профессор Wharton School прямо называет промпт-инжиниринг contingent — зависящим от контекста настолько, что предсказать эффект заранее нельзя.
Если вы третий день переписываете один и тот же запрос, добавляя «ты — топовый маркетолог» и «пожалуйста, ответь подробно», а модель по-прежнему выдаёт воду не того формата — дело не в недостатке магии. Дело в том, что вы правите не те слоты.
Платите в рублях за AI-модели без наценки на токены через provod.ai
Что действительно двигает результат
OpenAI в актуальном гайде по промптингу формулирует правило почти буквально: каждую инструкцию — один раз, без повторов и дублирующих примеров. По внутренним замерам компании, переход на «постные» промпты без лишней структуры поднял результаты эвалов на 10–15% при сокращении токенов на 41–66% и стоимости на 33–67%. Цифры вендорские, без раскрытой методики — но направление совпадает с независимыми данными: тот же отчёт Wharton фиксирует, что удаление инструкций по формату вывода снижает качество ответа. Указание формата входит в саму постановку задачи.
Anthropic в своих рекомендациях называет рабочими элементами конкретность требований и ограничений, объяснение мотивации инструкции, прямое указание желаемого вида результата и примеры там, где словами объяснить сложно. Общий принцип компании — «лучший промпт не самый длинный и не самый сложный». Совпадение двух конкурирующих вендоров и независимого академического замера — редкий случай согласия в этой теме, и он указывает на пять элементов: действие с задачей, входные данные, жёсткие ограничения, формат и объём вывода, критерий приёмки. Остальное — тюнинг, а не спецификация.
Персона и тон не работают, и это проверено дважды
Здесь данные особенно неудобны для магазинов промптов, где карточка часто начинается с «Ты — опытный SMM-стратег». Работа Findings of EMNLP 2024 прогнала 162 роли по 2410 фактическим вопросам на четырёх семействах моделей — добавление персоны в системный промпт не дало прироста против контроля без персоны вообще. Подобрать задним числом «лучшую» роль для конкретного вопроса можно, но заранее угадать её не получается лучше случайного выбора.
Второй, более свежий Wharton-отчёт проверил экспертные персоны на шести моделях и двух сложных бенчмарках — GPQA Diamond и MMLU-Pro. Результат тот же: персона по теме задачи не даёт значимого прироста точности почти нигде, а вот персона «низкого знания» — обыватель, ребёнок — точность стабильно портит. Anthropic независимо приходит к тому же выводу в собственном блоге: тяжеловесный role prompting современным моделям чаще всего просто не нужен.
С вежливостью ситуация ещё более сырая. Более раннее исследование университета Васэда находило, что грубость вредит; препринт Mind Your Tone на 250 промптах и одной модели получил обратный результат — 84,8% точности у очень грубых формулировок против 80,8% у очень вежливых. Три работы, три разных вывода на англоязычных данных — воспроизводимого эффекта тона попросту нет, и строить на нём стратегию бессмысленно в любую сторону.
Откуда берётся вода

Склонность модели отвечать длиннее, чем нужно, — не каприз конкретной нейросети, а системное искажение обучения. Reward-модели в RLHF систематически предпочитают более длинные ответы независимо от их фактического качества — это зафиксировано в работе о коррекции length bias. Отсюда практическое следствие: просьба «отвечай кратко» работает через раз, потому что не задаёт критерий, а модель по умолчанию тянется к развёрнутости, которую она же и считает «хорошим» ответом.
Лечится это спецификацией объёма и структуры: сколько пунктов, сколько слов в каждом, что убрать — вступление, повторы, общие оговорки, а что сохранить — цифры, решения, следующий шаг. У OpenAI для этого даже есть отдельный параметр text.verbosity с тремя уровнями, доступный через API; в обычном чате остаётся текстовая часть той же рекомендации — прописать её словами в промпте.
Возражение, которое нельзя обойти
Здесь появляется главная сложность честного разговора про структуру: она работает, но результат её работы непредсказуем. Исследование форматов вывода на GPT-3.5-turbo и GPT-4 показало разброс результата до 40% на одной и той же задаче перевода кода — просто от смены оформления с обычного текста на JSON или YAML; при этом GPT-4 оказалась заметно устойчивее к смене формата, чем более слабая модель. То есть чем современнее модель, тем меньше её колбасит от оформления — но полностью иммунитета нет ни у одной.
При этом в свежем гайде для семейства моделей, запущенного 9 июля 2026 года, OpenAI прямо предупреждает, что старые инструкции вроде «будь краток» теперь пересокращают ответ, а XML-блоки «работай, пока не решишь» и скрипты-преамбулы стали контрпродуктивны. Ещё недавно те же приёмы советовали как best practice. Значит, универсального чек-листа, который переживёт смену модели, не существует в принципе — любой набор правил нужно проверять на своей задаче и своей модели, а не переносить из статьи один в один. Если у вас клиент, подключённый по OpenAI-совместимому протоколу, и он одинаково смотрит на пять моделей через один API — например, через provod.ai, где смена модели требует только другого имени в запросе, а не переписывания клиента, — эту проверку реально прогнать за один вечер вместо отдельной интеграции под каждого вендора.
Промпт или промт

Академический орфографический словарь фиксирует только «промпт», и Яндекс с ноября 2025 года перешёл на эту норму в своих сервисах. Но 80% поисковых запросов люди пишут иначе — с «промт нейросети» ищут чаще, чем с нормативным вариантом, и аудитория 18–34 лет делает это в 2,5 раза активнее остальных, реже других используя правильное написание. Ольга Иванова, ведущий научный сотрудник Института русского языка им. В. В. Виноградова РАН и ответственный редактор орфографического словаря, объясняет расхождение не безграмотностью, а фонетикой: «есть артикуляционная трудность в произнесении группы согласных мпт» — русскому языку тяжело даётся это стечение звуков, поэтому «п» выпадает уже при произношении и переносится в письмо.
Отдельный источник путаницы — сама компания PROMT, чьё имя с 1991 года стало нарицательным для любых машинных переводчиков, как «ксерокс» для копиров. Она признаёт орфографическую норму против собственного бренда: правильно только «промпт», это калька с английского prompt. В тексте статьи и в заголовках нормативный вариант работает лучше для доверия, поисковый — лучше для охвата: выбор зависит от того, что важнее для конкретной публикации.
Купить шаблон или собрать свой
PromptBase на момент снимка заявляет 310 тысяч промптов и больше 500 тысяч пользователей, цена карточки — от $2,99 до $7,99, подписка с доступом к 250 тысячам промптов — от $19 в месяц. Основной ассортимент — генерация изображений и видео, а не текстовые рабочие задачи. При этом бесплатный встроенный оптимизатор OpenAI детектирует ровно тот набор дефектов, за исправление которых платят в магазинах: логические противоречия и невыполнимые инструкции, требование структурированного вывода без описания самого формата, конфликт правил с примерами, отсутствие спецификации для краевых случаев.
И даже удачно купленный промпт не вечен. Simon Willison, независимый разработчик, разбирая очередной гайд OpenAI, цитирует прямую рекомендацию вендора не считать новую модель drop-in-заменой предыдущей — «treat it as a new model family to tune for, not a drop-in replacement». Промпт, который идеально работал на прошлой версии модели, при следующем релизе может потребовать переписывания заново — так прямо и сформулировано в официальной рекомендации разработчика моделей. Карточка за $7,99 такого пересмотра не переживёт, а собранный самостоятельно запрос переписывать проще: слоты остаются те же, меняются только формулировки внутри них.
Рабочая карточка: что писать, что выбрасывать
| Слот | Обязательно в запросе |
|---|---|
| Действие с задачей | Что именно сделать: сравнить, посчитать, переписать, классифицировать |
| Входные данные | Исходный текст, цифры, контекст — без них модель додумывает сама |
| Жёсткие ограничения | Что нельзя: не выдумывать факты, не использовать термины вне списка, не превышать бюджет |
| Формат и объём вывода | Не «кратко», а «не более 7 пунктов, каждый до 15 слов, без вступления и итогового абзаца» |
| Критерий приёмки | «Ответ годен, если…» — конкретное условие, по которому вы сами проверите результат |
| Слот | На выброс |
|---|---|
| Экспертная персона | «Ты — маркетолог с 20-летним опытом» — не даёт прироста точности в двух независимых замерах (EMNLP 2024 и Wharton), и то же самое отдельно утверждает Anthropic |
| Вежливые обороты | «Пожалуйста», «будь добр» — эффект не воспроизводится между исследованиями |
| Абсолюты «always» и «never» | «Всегда отвечай списком», «никогда не пиши вступлений» — в разборе гайда GPT-5.6 отнесены к практикам, ставшим контрпродуктивными |
| Обещание чаевых или угрозы | Не подтверждено ни одним источником из перечисленных выше |
| Повтор одной инструкции разными словами | Прямо названо вредным в текущем гайде OpenAI |
Проверить это на своей задаче стоит буквально: взять реальный рабочий запрос, прогнать голую версию и версию с пятью слотами по три-пять раз каждую, сравнить с заранее записанным критерием приёмки. Пятнадцать минут против подписки за $19 в месяц — и результат, который будет держаться до следующего релиза модели, а не до следующей статьи с чужим шаблоном.
provod.ai — маршрутизация моделей внутри агентного сценария
Не поручайте одной модели весь процесс: для планирования, кода, поиска, проверки и финального ответа можно выбрать разные модели, сохранив один API и единый контроль расходов.
В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.
Экономика каждого шага остаётся видимой: все модели тарифицируются 1:1 по официальным ценам, без дополнительной комиссии provod.ai за маршрутизацию.
Соберите эффективного AI-агента: форма регистрации · цены на модели · защита данных по 152-ФЗ · API и интеграции
Источники
- OpenAI — Prompt guidance для GPT-5.6
- Anthropic — Best practices for prompt engineering
- Wharton Generative AI Labs — Prompting Science Report 4 о персонах
- Wharton Generative AI Labs — Technical Report о вежливости и форматах
- Findings of EMNLP 2024 — исследование персон в системных промптах
- Mind Your Tone — исследование вежливости промптов
- Исследование влияния форматирования промпта на результат
- Яндекс — новость о написании «промпт» и «промт»
- PROMT — блог о правильном написании термина
- PromptBase — маркетплейс промптов
- OpenAI Cookbook — Optimize Prompts
- Simon Willison — разбор гайда по промптингу
- Decrypt — обзор новых гайдлайнов GPT-5.6
- Исследование length bias в reward-моделях RLHF
