← Все статьи
Новости4 мин чтения

ИИ скачать на Android: 7 атак на пять агентных фреймворков — как скриншот становится командой

21 июля: семь лабораторных атак на пять Android-агентных фреймворков. Искажение скриншота и канал исполнения при включённом debugging. Скриншот может.

Обложка статьи: ИИ скачать на Android: 7 атак на пять агентных фреймворков — как скриншот становится командой

21 июля The Hacker News разобрал оригинальное исследование, пересмотренное 14 июля, о семи лабораторных атаках на пять open-source Android-агентных фреймворков. Главная неприятность не в том, что пользователь случайно нажмёт не ту кнопку. Агент может прочитать инструкцию на скриншоте, которую человек не замечает, и принять её за часть задачи.

Поэтому запрос «ии скачать» требует уточнения: речь не о любом приложении с нейросетью на телефоне, а о mobile AI agent, который воспринимает экран и способен выполнять действия. В исследование вошли AppAgent, AppAgentX, Mobile-Agent-v3, Open-AutoGLM и MobA. Обычные AI-чаты, stock assistants и iOS в этот охват не входят.

Риск возникает в точке, где экран перестаёт быть только интерфейсом для человека и становится входным каналом для автоматики. Если агент доверяет скриншоту сильнее, чем пользователь видимому состоянию приложения, безобидная картинка может изменить следующее действие.

Подключите AI-агентов с оплатой в рублях на provod.ai

Две поверхности атаки

Исследователи разделили реализации на два класса.

Screen Perception использует расхождение между человеческим и машинным восприятием. Сюда относятся невидимый текст, невидимые pixel zones и подмена скриншота. Человек видит привычный экран, а модель получает сигнал, который влияет на выбор действия.

Misused Channel относится не к содержимому экрана, а к контуру исполнения. В исследовании показаны варианты, где меняется или перехватывается execution pipeline, включая путь к командам на подключённом host PC.

Это не означает, что любой, кто решил нейросеть скачать на Android, автоматически получает скомпрометированное устройство. Это означает другое: у агентного инструмента недостаточно спросить, «видит ли он экран правильно». Нужно спрашивать, имеет ли изображение право давать команду и какой канал способен превратить её в действие.

Схема модели угроз для Android-агента

Где заканчивается тревога и начинается практический риск

У основной цепочки были конкретные условия: атакующее приложение должно быть установлено, агентная задача активна, а USB- или wireless-debugging включён. Отдельный вариант с изображением и цветовым каналом допускает доставку полезной нагрузки через картинку.

Именно эти ограничения меняют вывод. Для разработчика, который тестирует агент на Android и держит отладочный канал открытым к ПК, это повод пересмотреть архитектуру сейчас. Для человека, который использует обычный чат с ИИ на смартфоне, это исследование само по себе не доказывает аналогичный риск.

Самое сильное возражение звучит разумно: лабораторная демонстрация без CVE и без подтверждённой эксплуатации вне controlled setting не должна превращаться в заявление о массовой кампании. Так и есть. Но отсутствие известного инцидента не отменяет ценность модели угроз: The Hacker News сообщил, что проверил пути работы со скриншотами, shell-вызовами и fallback через broadcast в основных ветках всех пяти фреймворков по состоянию на 17 июля.

Быстрый диагностический тест для команды

Не запрещайте агентный интерфейс целиком. Проверьте, связывает ли система восприятие, разрешение и действие.

  1. Агент получает скриншот или изображение из приложения, которому вы не доверяете?
  2. Может ли содержимое скриншота менять действие без отдельного подтверждения пользователем?
  3. Открыт ли во время задач USB- или wireless-debugging?
  4. Есть ли у действия изолированный execution layer, а не прямой путь к host PC?
  5. Покажет ли интерфейс человеку различие между тем, что увидел он, и тем, что получил агент?

Если на первые три вопроса ответ «да», а на последние два «нет», такой сценарий лучше не использовать для чувствительных задач. Минимальный следующий шаг: отключить ненужный debug channel, отделить входные изображения от команд и требовать permission-aware confirmation перед действием с последствиями.

Архитектурный принцип здесь простой: скриншот может быть данными для анализа, но не должен становиться доверенным источником команды. Этот принцип полезно закреплять в требованиях к агентным сценариям, например при обсуждении их в provod.ai.

Карточка выбора архитектуры

Перейти на provod.ai

Что для вашей команды дороже: сохранять автономность для обратимых действий или требовать подтверждение перед действием, которое меняет устройство, открывает отладочный канал либо затрагивает подключённый ПК?

provod.ai — российский AI API-роутер для личных и корпоративных сценариев

Один API и веб-интерфейс объединяют привычную AI-экосистему: от первого запроса в чате до агентных систем, мультимедиа и production-интеграций для бизнеса.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Ценовая основа платформы — официальный тариф без собственной маржи: 1:1 с провайдером, оплата в рублях, единый баланс и документы для бизнеса. Это один из самых прямых и доступных способов оплачивать мировой AI-каталог из России.

Подключитесь к provod.ai: форма регистрации · цены на модели · защита данных по 152-ФЗ · главная provod.ai