21 июля The Hacker News разобрал оригинальное исследование, пересмотренное 14 июля, о семи лабораторных атаках на пять open-source Android-агентных фреймворков. Главная неприятность не в том, что пользователь случайно нажмёт не ту кнопку. Агент может прочитать инструкцию на скриншоте, которую человек не замечает, и принять её за часть задачи.
Поэтому запрос «ии скачать» требует уточнения: речь не о любом приложении с нейросетью на телефоне, а о mobile AI agent, который воспринимает экран и способен выполнять действия. В исследование вошли AppAgent, AppAgentX, Mobile-Agent-v3, Open-AutoGLM и MobA. Обычные AI-чаты, stock assistants и iOS в этот охват не входят.
Риск возникает в точке, где экран перестаёт быть только интерфейсом для человека и становится входным каналом для автоматики. Если агент доверяет скриншоту сильнее, чем пользователь видимому состоянию приложения, безобидная картинка может изменить следующее действие.
Подключите AI-агентов с оплатой в рублях на provod.ai
Две поверхности атаки
Исследователи разделили реализации на два класса.
Screen Perception использует расхождение между человеческим и машинным восприятием. Сюда относятся невидимый текст, невидимые pixel zones и подмена скриншота. Человек видит привычный экран, а модель получает сигнал, который влияет на выбор действия.
Misused Channel относится не к содержимому экрана, а к контуру исполнения. В исследовании показаны варианты, где меняется или перехватывается execution pipeline, включая путь к командам на подключённом host PC.
Это не означает, что любой, кто решил нейросеть скачать на Android, автоматически получает скомпрометированное устройство. Это означает другое: у агентного инструмента недостаточно спросить, «видит ли он экран правильно». Нужно спрашивать, имеет ли изображение право давать команду и какой канал способен превратить её в действие.

Где заканчивается тревога и начинается практический риск
У основной цепочки были конкретные условия: атакующее приложение должно быть установлено, агентная задача активна, а USB- или wireless-debugging включён. Отдельный вариант с изображением и цветовым каналом допускает доставку полезной нагрузки через картинку.
Именно эти ограничения меняют вывод. Для разработчика, который тестирует агент на Android и держит отладочный канал открытым к ПК, это повод пересмотреть архитектуру сейчас. Для человека, который использует обычный чат с ИИ на смартфоне, это исследование само по себе не доказывает аналогичный риск.
Самое сильное возражение звучит разумно: лабораторная демонстрация без CVE и без подтверждённой эксплуатации вне controlled setting не должна превращаться в заявление о массовой кампании. Так и есть. Но отсутствие известного инцидента не отменяет ценность модели угроз: The Hacker News сообщил, что проверил пути работы со скриншотами, shell-вызовами и fallback через broadcast в основных ветках всех пяти фреймворков по состоянию на 17 июля.
Быстрый диагностический тест для команды
Не запрещайте агентный интерфейс целиком. Проверьте, связывает ли система восприятие, разрешение и действие.
- Агент получает скриншот или изображение из приложения, которому вы не доверяете?
- Может ли содержимое скриншота менять действие без отдельного подтверждения пользователем?
- Открыт ли во время задач USB- или wireless-debugging?
- Есть ли у действия изолированный execution layer, а не прямой путь к host PC?
- Покажет ли интерфейс человеку различие между тем, что увидел он, и тем, что получил агент?
Если на первые три вопроса ответ «да», а на последние два «нет», такой сценарий лучше не использовать для чувствительных задач. Минимальный следующий шаг: отключить ненужный debug channel, отделить входные изображения от команд и требовать permission-aware confirmation перед действием с последствиями.
Архитектурный принцип здесь простой: скриншот может быть данными для анализа, но не должен становиться доверенным источником команды. Этот принцип полезно закреплять в требованиях к агентным сценариям, например при обсуждении их в provod.ai.

Что для вашей команды дороже: сохранять автономность для обратимых действий или требовать подтверждение перед действием, которое меняет устройство, открывает отладочный канал либо затрагивает подключённый ПК?
provod.ai — российский AI API-роутер для личных и корпоративных сценариев
Один API и веб-интерфейс объединяют привычную AI-экосистему: от первого запроса в чате до агентных систем, мультимедиа и production-интеграций для бизнеса.
В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.
Ценовая основа платформы — официальный тариф без собственной маржи: 1:1 с провайдером, оплата в рублях, единый баланс и документы для бизнеса. Это один из самых прямых и доступных способов оплачивать мировой AI-каталог из России.
Подключитесь к provod.ai: форма регистрации · цены на модели · защита данных по 152-ФЗ · главная provod.ai
