← Все статьи
Новости5 мин чтения

Нано банана. Июльская жалоба и контр-отчёт — как отличить регресс от смены модели

Два июльских отчёта о качестве Nano Banana спорят о регрессе. Разбираем same-input тест, который отличает его от смены условий в Flow. Противоречивые отзывы.

Обложка статьи: Нано банана. Июльская жалоба и контр-отчёт — как отличить регресс от смены модели

9 июля пользователь r/Bard описал, что нано банана стала хуже держать лица, игнорировать инструкции и работать с референсами. 13 июля в r/GoogleFlow появился противоположный контр-отчёт: автор сообщил о более чем 100 сгенерированных изображениях без тех же сообщений об ошибках.

Оба наблюдения могут быть честными. Но ни одно не отвечает на главный рабочий вопрос: испортилась ли модель, или изменились условия, в которых её запускали? Для команды, которая получает нестабильные визуалы в дедлайне, это разница между баг-репортом, сменой инструмента и бесполезной перепиской о «качестве».

Платите в рублях за AI-модели без наценки на токены через provod.ai

Сначала разделите названия

30 июня Google представила Nano Banana 2 Lite как быстрый и экономичный вариант Gemini Image для задач скорости и масштаба. В документации для разработчиков эта модель называется gemini-3.1-flash-lite-image.

Из этого не следует, что любой результат с бытовым именем Nano Banana относится именно к ней. Nano Banana 2, 2 Lite и Pro нельзя записывать в одну колонку таблицы. Тем более нельзя считать, что результат в Flow и результат через публичный API получены в одинаковых условиях.

Это не утверждение о скрытом устройстве Flow. Просто без фиксации поверхности, доступного tier, аккаунта и идентификатора модели сравнение неидентифицируемо. Слово «Banana» в заметках о тесте слишком широкое, чтобы по нему искать регресс.

Что показала жалоба, а что нет

В июльской жалобе речь шла не об одном артефакте. Пользователь отметил три класса проблем: инструкция не выполняется, лицо хуже сохраняется между изображениями, референс перестаёт работать ожидаемым образом. Пост получил 9 голосов.

Это полезный сигнал для воспроизведения, но не измеренный инцидент платформы. Неизвестны точный набор изображений, формулировки, режимы, последовательность попыток и условия аккаунта. Из такого отчёта нельзя вывести массовый downgrade.

Контр-отчёт через четыре дня тоже не является опровержением. Его автор получил более 100 изображений без обсуждавшихся сообщений об ошибках, а пост получил 13 голосов. Это показывает лишь, что при его входных данных и в его условиях проблема не проявилась. Он не говорит, что другие аккаунты, референсы и запросы обязаны вести себя так же.

Здесь и происходит важный поворот. Интуитивно хочется выбрать сторону: либо «всё сломали», либо «у меня работает, значит жалоба надуманна». Практически ценнее признать третью версию: наблюдения описывают разные срезы одной системы.

Тест, который превращает спор в решение

Минимальный regression harness не требует большого бенчмарка. Он требует дисциплины.

Зафиксируйте один reference set и один prompt. Отдельно запишите:

  • выбранную модель или её доступное название;
  • поверхность запуска: Flow или API;
  • tier аккаунта;
  • aspect ratio;
  • дату и время серии;
  • все выходные изображения.

Сделайте по 20 запусков до и после предполагаемого изменения условий. Если «до» уже недоступно, сравнивайте две явно названные конфигурации, а не память о том, как результат выглядел неделю назад.

Для каждого запуска нужен один исход, а не общий вердикт «плохо»:

ИсходЧто фиксировать
faceСохранилась ли нужная идентичность лица
referenceСработал ли референс как источник требуемых признаков
instructionВыполнена ли проверяемая часть инструкции
safetyЕсть ли блокировка или безопасный отказ
transportВозникла ли техническая ошибка доставки или запуска

Такой журнал не докажет внутреннюю причину поведения Flow. Зато он отделит разные симптомы. Ошибка транспорта не равна ухудшению визуального качества. Safety-исход не равен провалу референса. А один неудачный портрет не равен регрессу модели.

Матрица same-input теста: условия запуска и пять типов исходов

Самое сильное возражение

Можно справедливо сказать, что 20 прогонов мало и генеративная система вариативна. Это верно. Такой тест не превращает локальное наблюдение в независимую оценку всей модели.

Но альтернатива хуже не потому, что она «не научная», а потому, что в ней вообще не видно предмета спора. Без одинакового prompt, референса и условий нельзя отличить дрейф входа от смены модели, а случайный удачный или неудачный набор изображений становится аргументом сам по себе.

Поэтому 20 запусков нужны не для окончательного приговора Google. Они нужны для следующего действия.

  • Если в одной зафиксированной конфигурации повторяются face, reference или instruction, оформляйте баг-репорт с входами, выходами и распределением исходов.
  • Если проблема проявляется только на одной поверхности или tier, не называйте её регрессом всей Nano Banana. Описывайте границу проявления.
  • Если ломается только конкретный референс или формулировка, сначала ремонтируйте вход: у вас есть гипотеза о prompt/reference drift.
  • Если для проекта важнее предсказуемость, а не поиск причины, запускайте тот же вход в нескольких image-моделях и сравнивайте сохранённые исходы. Это можно организовать через воспроизводимый кросс-модельный тест в provod.ai, не выдавая сравнение за объяснение причин поведения Flow.

Полезная формулировка для команды звучит скучнее, чем «нано банана стала хуже», но экономит время: «В Flow, при таком аккаунте, таком референсе и таком prompt в 20 попытках повторился такой-то тип отказа». С ней можно менять инструмент осознанно, чинить вход или передавать проблему дальше.

Дерево решений: что делать после same-input теста

Перейти на provod.ai Если дедлайн близок, что вы выберете: потратить время на доказательство локального регресса или перейти на сравнение нескольких моделей с тем же входом?

provod.ai — единая точка доступа к AI для российского бизнеса

Совместите технический и организационный контуры: модели подключаются через общий API, расчёты идут в рублях, юридические лица получают документы, а команда работает в корпоративном пространстве.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Доступность из России сочетается с прямой экономикой: официальный тариф модели переносится 1:1, без собственной наценки provod.ai.

Соберите корпоративный AI-контур: форма регистрации · цены на модели · защита данных по 152-ФЗ · реквизиты для договора