← Все статьи
Новости8 мин чтения

Определить текст на ИИ: почему ни один детектор не тянет на приговор

Независимый тест 14 сервисов не нашёл ни одного с точностью выше 80% — а заказчик рискует отказать фрилансеру в оплате из-за одного процента детектора.

Обложка статьи: Определить текст на ИИ: почему ни один детектор не тянет на приговор

Независимый тест 14 сервисов не нашёл ни одного с точностью выше 80% — а заказчик рискует отказать фрилансеру в оплате из-за одного процента детектора.

Когда редактор получает текст с пометкой «87% AI» и решает не платить, он пытается определить текст на ИИ по одной цифре — той самой, которую ни одна независимая лаборатория пока не смогла воспроизвести на приемлемом уровне надёжности. Это результат самого строгого из независимых тестов, на которые опираются оценки в этой статье; он датирован 2023 годом, а независимого повторного теста актуальных версий детекторов в открытых источниках не найдено.

Платите в рублях за AI-модели без наценки на токены через provod.ai

Что показал самый жёсткий тест

Группа исследователей во главе с Дебора Вебер-Вульф прогнала 14 детекторов — среди них Turnitin и PlagiarismCheck — через набор текстов, включавший человеческие эссе, чистую генерацию, машинный перевод и перефразированные версии. Результат: ни один инструмент не преодолел порог 80% точности, только пять из четырнадцати превысили 70%. Шесть детекторов давали ложные срабатывания на человеческом тексте, тринадцать из четырнадцати пропускали реально сгенерированный контент. Хуже всего дело обстояло с переведёнными и перефразированными текстами — именно та ситуация, в которой чаще всего оказывается заказчик, получающий текст от фрилансера, работавшего с иностранными источниками или редактировавшего черновик через несколько итераций (Weber-Wulff et al., arXiv).

Это не единичный сбой. OpenAI закрыл собственный классификатор текста через полгода после запуска: он верно распознавал ИИ-текст лишь в 26% случаев, а человеческий текст ошибочно помечал как машинный в 9% случаев — особенно на коротких фрагментах до 1000 символов (TechCrunch). Turnitin, куда более авторитетный игрок в академической проверке, публично признал: заявленная точность до 1% ложных срабатываний на практике обернулась примерно 4% на уровне отдельных предложений, причём больше половины этих ошибок соседствовали с настоящими ИИ-фрагментами — то есть система путала границы, а не просто иногда ошибалась (Inside Higher Ed).

Кого детектор обвиняет чаще всего

02 evidence

Стэнфордская команда под руководством Джеймса Зоу протестировала семь популярных детекторов на эссе восьмиклассников-носителей языка и на эссе TOEFL, написанных не носителями английского. С первой группой детекторы справлялись почти безошибочно. Со второй — ложно помечали как ИИ-текст больше половины работ, а один из инструментов дал ложное срабатывание почти в 98% случаев. Зоу формулирует вывод жёстко: «We should be extremely careful about and maybe try to avoid using these detectors» — «нам стоит быть крайне осторожными и, возможно, вообще избегать использования этих детекторов» (ScienceDaily).

Это прямо касается коммерческой приёмки текстов на русском языке: детектор наказывает не за факт использования модели, а за стиль, отклоняющийся от статистической нормы обучающего корпуса — избыточно правильную грамматику, непривычную структуру предложений, следы перевода. Именно этот механизм описывает и Дмитрий Бескромный, основатель bQ Group: он называет ориентирами подозрения избыточную корректность, идеальную структуру и отсутствие живого авторского голоса, но прямо говорит, что качественный гибридный текст — человек плюс ИИ-редактура — различить невозможно (Setters Media). Иначе говоря, детектор одинаково хорошо ловит и хорошо отредактированную нейросеть, и просто хорошо написанный текст нестандартным автором — не отличая одно от другого.

Цену такой путаницы легко представить на живом примере, пусть и анекдотическом: автора поста на коллективном блоге Habr обвинили в использовании нейросети из-за форматирования — жирного текста и однострочных комментариев. Аргументы о том, что форматирование было ручным, сообщество проигнорировало (Habr). В комментариях под постом это стоило репутации; в коммерческом контракте на месте репутации — гонорар.

Аргумент вендоров и его цена

03 decision

Справедливости ради: разработчики детекторов не претендуют на роль судьи. Российский сервис eTXT заявляет точность распознавания 85–98% для русского языка при цене 1,30 рубля за 1000 символов (минимальный заказ — 20 000 символов), но прямо называет результат вероятностной оценкой, которая не заменяет проверку человеком (eTXT). Обзор рынка на vc.ru упоминает похожую позицию у GPTZero, Originality.AI и других игроков и приводит грубую оценку: для русскоязычных текстов лучшие инструменты дают 70–85% точности против 85–95% для «чистого» английского ИИ-текста, а хорошо отредактированный текст с добавленным личным опытом детекторы обычно вообще не помечают (vc.ru). Логика вендоров понятна: если использовать сигнал дисциплинированно — как один из аргументов наряду с историей правок и разговором с автором, — он снижает риск ошибки вместо того, чтобы его создавать. Отказ от инструмента вовсе лишает заказчика хоть какого-то раннего предупреждения.

Проблема в том, что на практике сигнал редко используют дисциплинированно. Именно об этом говорит вся линейка независимых тестов выше: цифра точности выглядит как готовое основание для решения именно потому, что она одна и выглядит объективной, — а разговор с исполнителем требует времени и социальной неловкости. Обзор лидеров рынка детекторов на Setters Media отмечает, что даже вендоры вроде Winston AI, Originality.ai и Copyleaks, заявляющие 92–99,98% точности, признают: абсолютно точного детектора не существует и не может существовать в принципе. Именно в этом зазоре между «вероятностный сигнал» в документации вендора и «87% — точно нейросеть» в письме заказчику рождаются несправедливые отказы в оплате.

Есть и встречный факт, работающий в пользу настороженности заказчика: исследование ReText.AI на 12 996 дипломных работах с 2013 по 2025 год зафиксировало рост доли текста с признаками ИИ с 9,9% в 2022 году до 42,3% в 2025-м (Habr / ReText.AI). Это собственное исследование разработчика детектора, поэтому к абсолютным цифрам стоит относиться с той же осторожностью, что и к другим вендорским заявлениям, — но сама тенденция говорит: игнорировать проблему совсем тоже не выход. Вопрос не «включать детектор или нет», а «что делать, когда он что-то показал».

Что делать вместо процента

Практический ответ — сместить точку принятия решения с числа детектора на процесс приёмки: если задача — надёжно определить текст на ИИ, одного процента недостаточно, нужен процесс, который не ломается от одной ложной цифры.

  • Запросить историю правок. Версии в Google Docs или Word показывают, писался ли текст постепенно или вставлен одним блоком — это куда надёжнее любого статистического анализа стиля.
  • Проверить источники и цитаты. Модели выдумывают факты и ссылки чаще, чем меняют стиль; попросить исполнителя показать материалы, на которые опирается текст, — способ поймать реальную проблему, а не косвенный признак.
  • Провести короткое интервью по содержанию. Пять минут разговора о том, почему в тексте выбран именно такой аргумент или пример, отличают автора, понимающего материал, от человека, просто скопировавшего вывод модели, — причём вне зависимости от того, помогала ли ему нейросеть.

Если хочется прогнать текст через детектор — используйте минимум два разных инструмента и относитесь к расхождению между ними как к сигналу для разговора, а не к среднему арифметическому для решения. Weber-Wulff и её соавторы именно поэтому тестировали 14 сервисов сразу: единичный результат ничего не доказывает, потому что ни один инструмент по отдельности не набрал те 80%, ниже которых решение об отказе в оплате становится статистически необоснованным.

Есть и способ тренировать не алгоритм, а собственный глаз: стоит хотя бы раз прогнать похожий бриф через несколько разных моделей одним и тем же промптом, чтобы увидеть вживую типовые обороты, которые обычно и путают с «признаками ИИ». Ровный ритм абзацев в одиночной выдаче выглядит просто аккуратной работой, а в пяти ответах подряд опознаётся как повадка модели. Для такого сравнения не обязательно заводить отдельную подписку на каждую модель: у provod.ai это доступ к каталогу моделей через один API, и если редакционный инструмент уже поддерживает OpenAI-совместимый протокол, достаточно сменить base URL, не переписывая интеграцию. Если такая сверка станет регулярной частью работы редакции, а не разовым спором, дальше это уже операционный вопрос — доступ нескольких сотрудников, оплата в рублях и закрывающие документы от российского юрлица, а не личная карта одного редактора.

Пункт в договоре с исполнителем тоже стоит переформулировать: не «текст не должен содержать признаков ИИ по версии детектора X», а «использование ИИ-инструментов как черновика или помощника допустимо, но сдача непроверенного или фактически недостоверного текста — основание для возврата на доработку». Это разводит два разных вопроса — использовалась ли модель и был ли текст добросовестно проверен — которые детектор всё равно не умеет различать.

Цена одностороннего доверия к проценту вполне конкретна: исполнитель теряет оплату за текст, который написал сам, просто потому что его стиль оказался «слишком правильным» для обучающей выборки чужого алгоритма. Пока ни один независимый тест не показал детектор, которому можно доверять эту цену безоговорочно.

provod.ai — от идеи и текста до изображения, видео и звука

Соберите контентный процесс без переключения между десятками сервисов: сценарий, визуал, ролик, музыка и аудио используют единый кабинет, API и баланс команды.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Каждый формат оплачивается по базовой цене поставщика 1:1: provod.ai объединяет расчёты, но не добавляет свою наценку.

Соберите медиапроизводство на provod.ai: форма регистрации · цены на модели · защита данных по 152-ФЗ · главная provod.ai

Источники