← Все статьи
Новости8 мин чтения

Промты для GPT Image 2: кириллица получается с первого раза, персонаж — не всегда

Двенадцать вывесок с кириллицей — двенадцать без ошибок, но при переносе персонажа в новый чат совпадение внешности падает до 80–85%: одна и та же модель, два разных результата

Обложка статьи: Промты для GPT Image 2: кириллица получается с первого раза, персонаж — не всегда

Двенадцать вывесок с кириллицей — двенадцать без ошибок, но при переносе персонажа в новый чат совпадение внешности падает до 80–85%: одна и та же модель, два разных результата

Эти два числа стоят рядом в одном обзоре и описывают одну и ту же модель, выпущенную 21 апреля 2026 года — GPT Image 2. Разрыв между ними проходит по границе ответственности: часть задачи модель закрывает архитектурно, остальное вам придётся закрыть структурой промпта самостоятельно. Дизайнер, который планирует серию из десяти-двадцати изображений с одним героем, узнаёт цену этой границы по счёту за токены после третьей неудачной попытки. При официальном тарифе $30 за 1 млн токенов вывода изображения (прайс-лист OpenAI) двадцать случайных дублей превращаются в отдельную строку расхода.

Рендер текста, включая кириллицу, GPT Image 2 действительно решает без специальных ухищрений — это заслуга архитектуры модели. А вот воспроизводимость персонажа и композиции без дублей — не свойство модели «из коробки», а результат явной структуры промпта, и именно эту структуру OpenAI рекомендует как способ удержать результат.

Платите в рублях за GPT API без наценки на токены через provod.ai

Что именно чинит структура промпта

В гайде по промптингу для image-моделей OpenAI прямо называет технику: character anchor. Персонажа описывают один раз, подробно и однозначно, это изображение сохраняют и передают как входное для каждой следующей сцены, а в промпт добавляют явный запрет — «Do not redesign the character». Без этой фразы модель трактует каждый новый запрос как повод для лёгкой интерпретации, и за несколько независимых обращений внешность плывёт. С якорем и запретом дрейф не исчезает полностью, но становится управляемым. Гайд формулирует это как методическую рекомендацию и не приводит процентов успеха для серий разной длины.

Для текста в кадре логика похожая. Гайд рекомендует ставить фразу в кавычки или прописные буквы, указывать шрифт, размер, цвет и точное место размещения, а для сложных или редких слов — прописывать их по буквам, letter-by-letter. Отдельно требуется формулировка против дублирования: «Ensure text appears once». Кириллица в гайде отдельно не упомянута — рекомендации сформулированы языково-нейтрально. Само по себе это показательно: успех кириллических тестов держится на токенизации модели, отдельной инструкции про русский алфавит в гайде просто нет.

Технические потолки, о которых молчат обзоры на русском

Есть расхождение, которое стоит проверить перед тем, как вы закладываете разрешение в бриф. Официальная документация модели указывает жёсткий технический предел: до 3840 пикселей по длинной стороне, соотношение сторон не больше 3:1, суммарно от 655 360 до 8 294 400 пикселей, а всё, что выше 2560×1440, помечено как «экспериментальное качество» (страница модели gpt-image-2). Русскоязычный обзор AITUNNEL при этом заявляет режим 4096×4096 в бете — цифра не подтверждена первичным источником и, вероятнее всего, описывает апскейл через сторонний сервис поверх нативного вывода модели. Для печатного макета разница критична: если заложить финальный тираж на несуществующее нативное разрешение, переделка всплывёт уже в типографии, когда промпт давно закрыт.

Есть и лимит скорости: от 5 до 250 изображений в минуту в зависимости от тира доступа (там же). Для серии из двадцати вариантов персонажа на низком тире это оборачивается ощутимой задержкой между попытками.

Голос практика за, голос практика против

02 evidence

Пользователь Reddit peakpirate007, судя по цитате, воспроизведённой сразу в двух независимых материалах — Build Fast with AI и WeShop AI — описывает апгрейд так: «character consistency + text rendering upgrades are wild», и отдельно уточняет, что эффект проявляется при настройке модели под конкретный рабочий процесс — товарную фотографию, UI-мокапы, инфографику; использование по умолчанию такого впечатления не даёт. Прямой ссылки на исходный пост инструменты поиска не нашли, атрибуция подтверждена только через агрегаторы — ограничение источника, которое стоит держать в уме; отбрасывать наблюдение из-за этого не обязательно.

Симметрично звучит возражение с другой стороны индустрии. Пользователь r/graphic_design baldierot, чью реплику приводит независимый обзор WeShop AI, формулирует жёстче: «language is an imprecise medium for achieving precise results». По его опыту, модель непригодна именно для графдизайна — задач, где важны точное размещение, иерархия и сетка, а не просто «похожий» результат. Это сильное возражение, и оно не снимается никакой структурой промпта: character anchor решает задачу «тот же персонаж в новой сцене», но не решает задачу «элемент строго на 24 пикселях от края с точной привязкой к модульной сетке». Автор того же обзора, Marine, по сути формулирует границу между двумя лагерями точнее обоих: модель хороша там, где нужна согласованность сцены, текста и персонажа, и слаба там, где нужен инструментальный контроль над геометрией макета. baldierot прав по существу — его возражение просто бьёт по другой задаче, чем сериальная генерация с одним персонажем.

Практический вывод для читателя: если задача — набор рекламных карточек с одним героем и текстом на кириллице, структура промпта закрывает большую часть проблемы. Если задача — верстка с точной сеткой, GPT Image 2 не заменит Figma или Illustrator, и никакая формулировка промпта этого не изменит.

Где серия ломается даже при правильной структуре

Даже с якорем есть эффект, который пользователи Hyro0o0 и GuyNamedWhatever описывают в том же обзоре WeShop AI: после нескольких циклов итеративной правки (edit-цепочек) на изображении появляется устойчивый «noise pattern» и деградация теней — будто система накладывает эффекты поверх уже готового кадра вместо того, чтобы пересобрать сцену заново. Наблюдение анекдотическое, число итераций до появления артефакта не зафиксировано контролируемым тестом — но практический сигнал понятен: если после третьей-четвёртой правки в цепочке композиция начинает «шуметь», не продолжайте редактировать один и тот же файл — начните новую генерацию с тем же character anchor вместо очередного edit поверх уже испорченного слоя.

Отдельно стоит проверять сами метрики. AITUNNEL приводит 80–85% совпадения персонажа между независимыми запросами против уверенной консистентности внутри одной сессии — до восьми изображений подряд. Методология не раскрыта, критерий «совпадения» не описан, так что относиться к цифре стоит как к индикатору: воспроизводимым бенчмарком она не является. Похожая осторожность нужна и для заявления про кириллицу «выше 99% на 48 языках»: тест 12 из 12 — маленькая выборка от коммерческого ресейлера доступа. Показательно, что вендорский материал на Habr от Study AI формулирует прогресс через архитектуру: раньше слово «шашлык» модель превращала в «шаылсык», «Москва» — в «Мосвка», а в новой версии, построенной на GPT-5.4, подобные типографские искажения устранены на уровне токенизации, без патча поверх старой модели. Конкретных примеров «до/после» именно на GPT Image 2 материал не приводит: перед нами описание механизма, измеренного результата там нет.

Доступ, бюджет и где рвётся интеграция

03 decision

Прямой доступ к API из России ограничен по географии и способу оплаты, поэтому практический доступ к модели обычно идёт через совместимый прокси-эндпоинт — смену base_url на сторонний сервис с оплатой в рублях (AITUNNEL — источник 9). Свойств самой модели это не меняет, но добавляет операционный риск: разные прокси по-разному соблюдают условия использования OpenAI, и перед серийным тестом стоит понимать, через какой канал идут запросы. Если клиент уже написан под OpenAI-совместимый протокол, замена base URL и ключа — это то немногое, что можно сделать без переписывания интеграции; именно так работает подключение через provod.ai, российский сервис доступа к моделям с оплатой в рублях без иностранной карты.

Поиск по фразе «промты для gpt images» в основном выдаёт коллекции готовых формулировок без объяснения механики drift и без разбора технических потолков разрешения — а именно эти два фактора определяют, сколько дублей вы получите на серии из десяти кадров.

Чек-лист структуры промпта перед первой серией

БлокЧто писатьЗачем
Фон/сценаТочное окружение, свет, ракурс, планЗадаёт контекст, который персонаж не должен «перетягивать» на себя
Персонаж-якорьДословное, повторяемое описание — рост, одежда, цвет волос, особые приметы; вставить референсное изображение как image inputОфициальная техника OpenAI против дрейфа между независимыми запросами
Текст в кадреФраза в кавычках или CAPS, шрифт/размер/цвет/место; сложные и редкие слова — по буквамСнижает риск опечаток и смещения в кириллическом и любом другом тексте
Ограничения«Do not redesign the character» и «Ensure text appears once» — обе формулировки взяты из гайда OpenAI; если надпись всё равно двоится, допишите своими словами отдельный запрет на повтор текстаЯвно блокирует два самых частых типа дублей
Параметры запросаquality: high/medium под задачу; при подаче референсного изображения персонажа проверьте в документации параметр, отвечающий за жёсткость следования референсуОпределяет, насколько жёстко модель держится референса при пересборке сцены

Заполняйте эту таблицу перед каждой новой серией: персонаж, сцена и текст в следующем брифе почти всегда другие, и структуру придётся собирать заново — по памяти она не копируется.

provod.ai — единый контур для растущего числа команд и сценариев

Добавляйте сотрудников, продукты и новые модели без отдельной закупки для каждого направления: общий API и рабочее пространство снижают операционный хаос по мере роста.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Рост использования не включает процент агрегатора поверх модели: провайдерская цена сохраняется 1:1, без собственной маржи provod.ai.

Подготовьте AI-контур к росту: форма регистрации · цены на модели · защита данных по 152-ФЗ · API и интеграции

Источники