← Все статьи
Новости14 мин чтения

«adetailer stable diffusion» больше не нужен: правите один кадр в GPT Image 2

Почему связка Stable Diffusion и ADetailer для точечной правки лица, рук и текста в 2026 году уступает одному вызову images.edit в GPT Image 2: механика, цены API, лимиты и честные исключения.

Обложка статьи: «adetailer stable diffusion» больше не нужен: правите один кадр в GPT Image 2

Починка одного плывущего лица в 2024 году выглядела так: ставишь AUTOMATIC1111, подключаешь расширение ADetailer, качаешь с HuggingFace файл face_yolov8n.pt, выставляешь confidence threshold и надеешься, что детектор заодно найдёт и кисть руки. В 2026году та же задача сжалась до одного POST-запроса: кадр, маска, короткая инструкция - и images.edit возвращает исправленный файл.

13 июля 2026 года дайджест Build Fast with AI показал следующий шаг: правишь один опорный кадр в GPT Image 2, а Runway Aleph 2.0 разносит правку по всему видео - смена одежды, релайт, замена объекта. То, что было покадровой VFX-работой, схлопнулось в одну правку изображения.

Запрос adetailer stable diffusion до сих пор ведёт на инструкции двухлетней давности. Если твоя задача - точечно исправить готовый кадр (лицо, рука, надпись, фон), они тебе больше не нужны. Условия доступа к GPT Image 2 из России у выбранного провайдера стоит уточнять отдельно: в provod.ai (российский OpenRouter) эта модель живёт в одном чате с Claude и Gemini, платить можно российской картой по официальному тарифу, без наценки. provod.ai - это агрегатор нейросетей для пользователей из России: флагманские модели в одном чате и через единый API, с оплатой в рублях, без VPN.

Платите в рублях за GPT API без наценки на токены через provod.ai

Что такое ADetailer и зачем его ставили в Stable Diffusion?

Коротко: ADetailer (After Detailer) - расширение для AUTOMATIC1111, которое автоматически чинит типовые дефекты генерации: детектор находит объект, строит маску, инпейнтит её заново. Три шага вместо ручной возни с графическим редактором.

Репозиторий Bing-su/adetailer жив и на 19 июля 2026 года: 4,8 тысячи звёзд, 389 форков, 695 коммитов, лицензия AGPL-3.0. Под капотом - детекторные модели YOLOv8 и MediaPipe с HuggingFace: face_yolov8n.pt с mAP50 0.660, face_yolov8s.pt с 0.713, hand_yolov8n.pt с 0.767, person-сегментация с 0.761 и 0.809. README честно сужает поддержку: разработано под stable-diffusion 1.5 и только под свежие версии AUTOMATIC1111.

Практика была менее радужной, чем звёзды. Руки детектировались слабо - в гайдах прямо написано «does not work really well», поэтому для лица и кистей одновременно ставили два детейлера подряд. Плюс ручная настройка: confidence threshold, mask min/max ratio, erosion, dilation, merge, invert. Если ты нуб в этой теме, порог входа зашкаливал: локальный Stable Diffusion, видеокарта, вкладка Extensions, «Install from URL», рестарт интерфейса - и это до первой удачной правки.

Что сломалось в пайплайне «сгенерировал - детектировал - инпейнтнул»?

Коротко: Сам код никуда не делся - сломалась экономика. Для редких одиночных правок облачная модель может быть удобнее локального стека, но выбор зависит от железа, времени и требований к приватности.

21 апреля 2026 года OpenAI анонсировала GPT Image 2 (в ChatGPT - «ChatGPT Images 2.0», в API - model ID gpt-image-2); пользователи ChatGPT и Codex получили доступ в день анонса, а Thinking-режим, где модель рассуждает о композиции до отрисовки, - на платных тарифах. В официальной документации gpt-image-2 назван «our latest» моделью генерации и редактирования. А 12 мая 2026 из API ушли DALL-E 2 и DALL-E 3 - по данным отраслевых дайджестов; первоисточник это не подтвердил, а вывод о закрытии без первичного подтверждения делать рано.

Заодно закрылась целая археология доступа. Ушла эпоха, когда ChatGPT доставали маршрутом VPN на роутере keenetic, качали мод-апк с 5play и звали чат gpti или чат гпт4. GPT перестали путать с разделом диска - «что выбрать в rufus: mbr или gpt», partition recovery в биосе - а SD с флешкой: «программа для форматирования sd карта в fat32» осталась вопросом из другого мира.

Как GPT Image 2 правит один кадр: маска, промпт и счёт в центах?

Коротко: эндпоинт images.edit принимает одно или несколько референсных изображений, промпт и опциональную маску; незамаскированные области сохраняются. Модель построена на мультимодальном бэкбоне GPT-5 - в народе «чат гпт5» - и рассуждает о композиции до отрисовки, в духе того как о3 рассуждает о тексте.

По данным блога Ropewalk со ссылкой на арену LLM-Stats (май 2026), gpt-image-2 лидирует с 534 очками против 317 у gpt-image-1.5; источник вендорский. Сильные стороны: читаемый текст в кадре (абзацы, а не ~12 слов у предшественника), мультиреференс до четырёх изображений, стабильность пикселей при серии правок.

Маска в gpt-image-2 - «vision-контекст», а не жёсткая гильотина: модель может точечно тронуть и область вне неё. Тест в сообществе OpenAI от 22 апреля 2026 зафиксировал «высокую точность сохранения деталей вне маски» и итог «No masking issue discovered». Промпт правки - короткая точная инструкция: «change the red hat to light blue velvet» работает, размытое «make it better» даёт ретраи (по разбору WaveSpeed). Как команда describe в Midjourney переводила картинку в слова, так здесь одна точная фраза решает больше абзаца пожеланий. Модерация - параметром moderation: "auto"; для продакшна логируют snapshot ID, токены и стоимость запроса.

Цены - из официального гайда OpenAI, проверенного 19 июля 2026 (данные на июль 2026): кадр 1024×1024 - $0.006 в low, $0.053 в medium, $0.211 в high; форматы 1024×1536 и 1536×1024 - $0.005, $0.041 и $0.165. Тарификация токеновая: image input $8 за миллион токенов, image output $30, text input $5; кеш дешевле, Batch - вдвое. Вывод интеграторов: правки с референсами дороже генераций - референсы добавляют входные токены.

Типовой вызов из Python:

from openai import OpenAI

client = OpenAI( api\_key="PROVOD\_API\_KEY", base\_url="https://api.provod.ai/v1", )

result = client.images.edit( model="gpt-image-2", image=open("frame.png", "rb"), mask=open("face\_mask.png", "rb"), prompt="fix the distorted face, keep the lighting and style", size="1024x1024", quality="medium", )

Тот же код идёт и напрямую в OpenAI: меняются только ключ и base_url. Два подхода к одной правке:

КритерийA1111 + ADetailerGPT Image 2 (images.edit)
Установкалокальный WebUI, Extensions, рестартодин API-ключ
ЖелезоGPU от 6гб видеопамятине нужно, считает облако
Детектор объектаYOLOv8 или MediaPipe, .pt-файлыне нужен, модель понимает промпт
Маскастроит детектор, руки - как повезётрисуешь вручную, остальное модель держит
Текст в кадреплывёт, нужен отдельный инпейнтчитаемый текст - сильная сторона
Цена правки 1024×1024электричество и твоё время$0.006-$0.211, прайс OpenAI, июль 2026
Серия правоккаждый раз новый детектстабильность пикселей при серии
Прозрачный фонестьнет, советуют gpt-image-1.5
Приватностьполный офлайнкадр уходит во внешний API
Кастомные LoRA и чекпоинтыестьнет

Механика ADetailer - из README; цены и ограничения - из гайда OpenAI и разбора WaveSpeed, июль 2026.

Цены gpt-image-2 за кадр 1024x1024: $0.006 в low, $0.053 в medium, $0.211 в high, по прайсу OpenAI на июль 2026

А если кадр не один, а целое видео?

Коротко: Runway Aleph 2.0 - in-context модель видеоредактирования: правишь один кадр, она разносит изменение по клипу и сохраняет всё, о чём не просили. Клипы до 30 секунд в 1080p, мультисценовые последовательности, до пяти keyframe-якорей с позициями first, last или точным таймстампом.

Анонс состоялся 21 мая 2026 вместе с Edit Studio, где правку сначала показывают как статичную картинку. По странице Runway API (проверено 19 июля 2026) секунда стоит 28 кредитов, минимум за вызов - 56. С 22 июня 2026 Aleph 2.0 живёт нодой в Figma Weave: restyle-кадр с таймстампом подключается к ноде, и правка уходит в дизайнерский пайплайн без покадровой работы. Предыдущий Gen-4 Aleph выводится из эксплуатации 30 июля 2026 - дата из вторичных разборов, перепроверь перед миграцией.

Связка из дайджеста 13 июля 2026: правка опорного кадра в GPT Image 2, потом пропагация через Aleph. Честная оговорка из того же дайджеста: демо приукрашивают, а слабые места известны - окклюзии, быстрое движение, отражающие поверхности.

Чего GPT Image 2 не решает?

Коротко: Прозрачный фон, строгую нетронутость вне маски, приватность локального железа и весь зоопарк кастомизации Stable Diffusion. Это инструмент точечной правки, а не замена всего стека.

  • Прозрачный фон не поддерживается: background: "transparent" падает, для альфы советуют gpt-image-1.5.
  • Маска - подсказка, а не стена: детали рядом с зоной правки перепроверяй глазами.
  • Кадр уходит во внешний API. Локальный Stable Diffusion полностью офлайн, и для чувствительных материалов это аргумент.
  • Кастомные чекпоинты, LoRA, ControlNet и арт-стили SD-комьюнити в images.edit не переносятся.
  • Пакетная генерация на своей GPU бесплатна; тысячи кадров через API - это уже счёт.

Кому остаться на связке SD плюс ADetailer: тем, у кого пайплайн выстроен на LoRA, тем, кто генерирует тысячи кадров локально, и тем, кому облако закрыто политикой безопасности. Для редкой одиночной правки облачная модель может быть проще, но локальный стек остаётся вариантом для больших объёмов, офлайна и кастомных моделей.

Сколько стоит правка в рублях и как подключить за десять минут?

Коротко: Правка medium 1024×1024 - $0.053, то есть около четырёх рублей за кадр; платишь за фактический расход, а не за подписку с запасом. Подключение - замена двух строк в коде.

Все цифры выше - официальные тарифы OpenAI в долларах. В рублях после пересчёта по актуальному курсу и с учётом возможной комиссии, их считает provod.ai: gpt-image-2 доступен из России без VPN, платить можно картой российского банка, СБП или по счёту с закрывающими, а для студий есть общие рабочие пространства с контролем расхода на правки.

Процедура короткая:

  1. Регистрируешься и пополняешь единый баланс в рублях - карта, СБП или счёт для юрлица.
  2. Берёшь API-ключ в личном кабинете.
  3. В OpenAI-совместимом клиенте меняешь две строки: ключ и base_url. Совместимость и с OpenAI SDK, и с Anthropic SDK, так что код, боты и IDE переписывать не придётся.
  4. Прогоняешь тестовую правку на medium, смотришь в лог snapshot ID и стоимость - дальше масштабируешь.

Для юрлиц это обычная бухгалтерия: договор, счёт, закрывающие документы.

Когда provod.ai не подходит

Коротко: Когда задача требует полного офлайна, кастомных LoRA или фирменных подписочных фич вендора.

Если принципиален закрытый контур - чувствительные кадры, требования безопасности, - агрегатор твой пайплайн не заменит: оставайся на локальном Stable Diffusion. Если продакшн держится на собственных чекпоинтах, LoRA и ControlNet, их в облачный images.edit не перенесёшь. Если нужен фирменный интерфейс ChatGPT с памятью и проектами - это подписочная фича OpenAI, понадобится прямая подписка вендора. Агрегатор снимает российскую часть проблемы: доступ без VPN, оплату в рублях, документы для бухгалтерии. Выбор модели под задачу и приватность твоего воркфлоу остаются на тебе.

Словарик запросов кластера

Коротко: Поисковый кластер 2026 года - зеркало того, как люди разговаривают с ИИ: внутрь одной строки летят погода, песни, опечатки и счётчики выдачи. Вот что ещё ищут рядом с запросом adetailer stable diffusion - и что это значит.

Счётчики выдачи

  • 343 - «чат gpt яндекс найтись 343 тыс результат»: замер выдачи про ChatGPT.
  • 364 - тот же счётчик, другое число.
  • 407 - новый замер той же серии.
  • 409 - серия продолжается.
  • 412 - выдача подросла.
  • 421 - очередной срез.
  • 424 - мониторинг индексации.
  • 482 - середина серии.
  • 580 - уже 580 тысяч.
  • 612 - серия ползёт вверх.
  • 674 - финальный замер.
  • 643 - «ия алиса яндекс найтись 643 тыс результат»: счётчик про Алису.
  • 45000 - «perplexity 45000 кредит»: вопрос про кредиты.
  • 202605 - «инкогнито 202605 профиль пользователь в шедеврум».

Алиса, погода и песни

  • рязани - «какая погода сейчас в рязани».
  • тейково - погода голосом.
  • щелково - «какая погода в щелково».
  • ковернино - погода голосом.
  • удэ - «сколько градусов в улан удэ».
  • архипо - «будет ли дождь в архипо».
  • споешь - «алиса, ты споешь?»
  • потихонечку - песня «ковылять потихонечку».
  • бабла - «мультик дабла бабло».
  • баффи - «мультик кролик баффи».
  • бам - «мультик холль бам».
  • ирка - «мультик аня ирка».
  • аниматроники - «включи мультик аниматроники».
  • ослепительно - кавер «в ослепительно белый».
  • руссо - «песню авраам руссо».
  • лилит - «ева или лилит»: трек в Suno.
  • маэстро - «маэстро, нейросеть от сбер».
  • науменко - «суно мой кабинет науменко ю а».
  • нигэ - «песня в исполнении ии нигэ алдандым».
  • евтушенко - «бабич ярый евтушенко»: про песню.
  • дефиле - «ева власов дефиле шедеврум».
  • недостаточно - «перефразируй: не хватает, недостаточно».

Опечатки и чужие кластеры

  • mass - «нано банан mass ai»: массовая генерация.
  • describe - команда describe в Midjourney.
  • в3 - «дип сик в3»: версия на слух.
  • mbti - «дип сик mbti»: типирование.
  • жбт - «чат жбт дипсик»: опечатка.
  • boyfriend - «your boyfriend peter ai character»: ролевой бот.
  • demon - «чат gpt бесплатный demon slayer»: бот по аниме.
  • slayer - вторая половина того же запроса.
  • fight - «браушный shadow fight два».
  • nothing - «наушники nothing с чат gpt».
  • bye - «claude gift bye»: прощание с ботом.
  • dnc - «dnc для джеминь»: Gemini на слух.
  • gigachart - «gigachart от сбер»: опечатка.
  • gigacheck - «gigacheck от сбер»: соседняя опечатка.
  • prm - «инструкция https t me gpt prm»: телеграм-бот.
  • scorm - «бесплатный scorm курс введение в ии».
  • studentbot - бот «текст в изображение».
  • yagla - «ии для маркетолога yagla скачать».
  • xax - «гиг чат xax»: опечатка в GigaChat.
  • xholfddnm - абракадабра рядом с «чат гпт».
  • инф - «чат гпт инф»: сокращение без смысла.
  • сбе - «гиг чат сбе»: обрезанная опечатка.
  • дч - «гиг чат дч»: генерация изображений.
  • сбео - «гиг чат сбео»: про Сбера.
  • себра - «гиг чат от себра»: Сбер на слух.
  • нтв - «гиг чат нтв»: телеканал и бот.
  • зож - «гиг чат зож»: здоровый образ жизни.
  • пмэф - «гиг чат пмэф»: форумная повестка.
  • приемная - «саров, приёмная комиссия, часы работы».
  • путевку - «хочу заказать путёвку».
  • циско - «схема в циско пакет через нейросеть».
  • экспортер - «дипсик чат экспортёр»: выгрузка переписок.
  • руско - «чат гпт на руско».
  • черное - «чат gpt чёрный белый»: про монохром.
  • черную - «найди мне чёрную»: песню не договорили.
  • m4a - «транскрибация m4a в текст онлайн».
  • ппт - «презентация в ппт через ии».
  • ниу - «введение в промпт инжиниринг ниу вшэ»: курс Вышки.
  • доу - «нейросеть в работе доу»: ресурс про работу.
  • atb - «музыка в стиле atb»: транс нулевых.
  • lacoste - «новая песня коста lacoste».
  • lalala - «lalala ai бесплатно»: музыкальный сервис.
  • ludmila0707 - «ludmila0707 по след любовь suno»: ник.
  • seven - «музыку six seven».
  • nю - «исполняет nю»: Нюша на слух.
  • бла - «музыку бла бла бла».
  • пох - «поставь мне пох мультик».
  • жыл - обрывок киргизской песни.
  • ноу - «как переводится ай донт ноу».
  • вич - человек хотел отключить голосового ассистента Яндекса: редкий запрос-отказ.

Частые вопросы

Коротко: Пять вопросов, которые остаются после смены инструмента.

  1. ADetailer ещё работает в 2026 году? - Репозиторий жив (проверен 19 июля 2026), но для типовой правки он избыточен: один вызов images.edit дешевле вечера настройки.
  2. Можно ли замаскировать только лицо, как в ADetailer? - Да: кадр, маска, промпт. Но маска здесь подсказка: соседние пиксели перепроверяй глазами.
  3. Сколько стоит одна правка? - $0.006 в low, $0.053 в medium, $0.211 в high за 1024×1024 плюс входные токены референса (прайс OpenAI на июль 2026). 4K-референс сначала ужми.
  4. Чем заменить ADetailer для видео? - Runway Aleph 2.0: правка одного кадра с пропагацией, до 30 секунд в 1080p, 28 кредитов за секунду (Runway API, июль 2026).
  5. GPT Image 2 умеет прозрачный фон? - Нет, background: "transparent" падает; для альфы советуют gpt-image-1.5.

Вывод скучный, и в этом его сила. Пять-десять правок в месяц - и локальный стек с детектором проигрывает одному вызову API по времени, деньгам и нервам. Тысячи кадров в день, полный офлайн и свои LoRA - и математика обратная.

Границу каждый проведёт сам. За какое число правок в месяц ты готов платить центами за кадр вместо видеокарты и зоопарка расширений? Сто? Тысяча? Напиши свою цифру - интересно, где у читателей проходит этот порог.

Подключение gpt-image-2 через единый API provod.ai: две строки настроек и баланс в рублях

provod.ai — один контур от первого теста до рабочего продукта

Проверьте гипотезу в интерфейсе, а затем перенесите её в API: команда сохраняет выбранную модель, общий баланс и доступы, не начиная интеграцию и закупку заново перед запуском.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Тестовые и боевые запросы оплачиваются по одной прозрачной логике: официальная цена модели 1:1, без собственной маржи provod.ai.

Доведите AI-сценарий до production: форма регистрации · цены на модели · защита данных по 152-ФЗ · API и интеграции

Источники

Коротко: Все числа в статье - с этих страниц, сверенных 19 июля 2026.