← Все статьи
Новости8 мин чтения

Нейросеть для текстовых документов побеждает юриста в выжимке — и проигрывает в сверке версий договора

Бенчмарк VLAIR развёл общий тренд надвое: там, где нужно не потерять смысл, модель обходит человека, а там, где нужно поймать различие между редакциями, счёт пока не в её пользу.

Обложка статьи: Нейросеть для текстовых документов побеждает юриста в выжимке — и проигрывает в сверке версий договора

Бенчмарк VLAIR развёл общий тренд надвое: там, где нужно не потерять смысл, модель обходит человека, а там, где нужно поймать различие между редакциями, счёт пока не в её пользу.

В феврале 2025 года независимая исследовательская компания Vals AI прогнала несколько корпоративных ИИ-инструментов через одинаковый набор юридических задач и получила результат, неудобный сразу для обеих сторон спора об ИИ в праве. На суммаризации длинного документа юристы-люди набрали 50,3%, а CoCounsel — 77,2%, Harvey Assistant — 72,1%. На ответах по документу с обязательной ссылкой на конкретный фрагмент разрыв ещё шире: Harvey — 94,8%, CoCounsel — 89,6%, юристы — 70,1%. Но на задаче, ради которой читатель открыл два .docx с разными версиями одного договора, — на сверке редакций (redlining) — расклад переворачивается: юристы — 79,7%, лучший из протестированных инструментов Harvey — 65,0%, Vincent AI — 53,6%. На хронологии событий из документов — ровная ничья, 80,2% против 80,2% у юристов, что лишь подтверждает: превосходство ИИ не универсально, оно привязано к типу задачи, а не к «искусственному интеллекту» как таковому. Все четыре результата — из отчёта VLAIR за февраль 2025 года, где на каждую задачу приходится 10–30 вопросов — выборка достаточная для ориентира, но не для точного универсального показателя.

Подключите модели для поиска и баз знаний с оплатой в рублях на provod.ai

Почему сверка версий — другая задача, чем выжимка

Суммаризация и ответы с цитатой — это задачи на извлечение смысла из текста, который лежит перед моделью целиком. Сверка версий — это задача на удержание позиционного контекста: нужно помнить структуру документа А, держать её же для документа Б и находить не совпадение, а расхождение, причём именно в тех местах, где расхождение малозаметно. Это ровно тот тип работы, где длинный контекст ведёт себя хуже, чем кажется по паспорту модели. Независимый бенчмарк NoLiMa показал: точность поиска конкретного факта в тексте резко падает уже на отметке 32 000 токенов — у GPT-4o с 99,3% до 69,7%, у Claude 3.5 Sonnet с 87,5% до 29,8% (NoLiMa, февраль 2025). Договор на 40–60 страниц с приложениями легко выходит за эту отметку, даже если производитель заявляет контекстное окно на уровне 128 000 токенов — примерно столько сегодня декларируют для GigaChat 2 Max и актуальной YandexGPT (обзор контекстных окон, 2026). Заявленный лимит и рабочая точность внутри него — разные вещи.

Новый академический бенчмарк CLAUSE (EACL Findings 2026) идёт дальше: на выборке из более чем 7500 намеренно искажённых реальных контрактов по десяти категориям аномалий модели систематически пропускают тонкие юридические несоответствия и слабо обосновывают те ошибки, которые всё же находят (CLAUSE, ноябрь 2025). Числовых показателей по конкретным моделям в открытом abstract нет — только качественный вывод, поэтому опираться на CLAUSE как на точную цифру пока рано. Но сам факт, что авторы строили датасет именно на искажённых версиях контрактов, а не на статичных документах, — сигнал в ту же сторону, что и VLAIR: сверка редакций — отдельная, более трудная задача, унаследованная от более старого экспертного датасета CUAD (510 контрактов, 13 000+ размеченных фрагментов, 41 категория условий), который лежит в основе большинства современных контрактных бенчмарков (CUAD, NeurIPS 2021).

Хэллюцинации не исчезли за полтора года

02 evidence

Профессор права Стэнфорда Daniel E. Ho, соавтор исследования Stanford RegLab, настаивает: при заявленной частоте ошибок пользователь обязан перепроверять каждое утверждение и каждую ссылку, которые выдаёт ИИ-инструмент — иначе экономия времени существует только на бумаге. Цифры, на которые он опирается, жёсткие: Lexis+ AI — 17% ошибочных или выдуманных ответов, Westlaw AI-Assisted Research — 33%, GPT-4 без юридической специализации — 43% (Stanford RegLab, май 2024). Тест проводился в мае 2024 года на конкретных версиях продуктов, и это стоит держать в уме — актуальные версии могли измениться. Но в октябре 2025 года Vals AI провела повторное слепое исследование по 210 вопросам юридического ресёрча и получила обратную картину: юристы — 71% точности, протестированные ИИ-инструменты и ChatGPT — 79–81% (LawNext, октябрь 2025). Это не значит, что хэллюцинации исчезли где-то между маем 2024 и октябрём 2025 — это значит, что юридический ресёрч и сверка версий договора измеряют разные навыки, и обобщать «ИИ теперь надёжнее юриста» по одному раунду тестов нельзя. Отраслевой разбор AI Law Librarians прямо предупреждает: точные проценты быстро устаревают, и подавать их как окончательный вердикт — методологическая ошибка (AI Law Librarians, февраль 2026).

Цена доверия черновику

03 decision

Есть единичный, но показательный кейс: нейросеть за час подготовила черновик политики обработки персональных данных, но формулировки согласия не соответствовали требованиям закона — ошибку нашёл только старший юрист перед публикацией, а потенциальный штраф оценивался до 300 000 рублей (СберБизнес Live). Это не статистика — это анекдотическое наблюдение из издания, аффилированного со Сбером, заинтересованным в продвижении собственных ИИ-инструментов. Но механизм ошибки совпадает с тем, что показывает VLAIR: модель хорошо держит структуру и общий смысл, и заметно хуже — нюансы конкретной сделки или конкретной юрисдикции. Автор практических материалов для юристов Тимур Яковлев формулирует рабочую схему короче: «ИИ готовит первый вариант, обозначает риски — юрист проверяет и берёт ответственность» (Клерк.ру, 2026). По его наблюдению, ИИ реже ошибается в структуре документа и почти никогда — в ссылках на разделы, но чаще — именно в деталях сделки. Это личное практическое наблюдение, не контролируемый тест, но оно совпадает с направлением, которое задают VLAIR и CLAUSE.

Протокол сверки, который не полагается на честное слово модели

Из всего этого вытекает конкретный порядок работы, в котором нейросеть для текстовых документов остаётся на выжимке и на черновой таблице различий, а решение по критичным пунктам принимает человек. Полное доверие автоматической таблице различий не оправдано данными; полный отказ от неё — тоже, потому что на выжимке и на цитировании модель выигрывает с большим отрывом.

ШагЧто делатьЗачем
1Разбить документ на пронумерованные смысловые блоки (пункт, подпункт, приложение)Снижает нагрузку на контекст — NoLiMa показывает деградацию точности уже на 32 000 токенах
2Запросить у модели таблицу изменений с указанием номера блока и дословной цитатой не длиннее 20 словВ VLAIR именно требование цитаты дало ИИ лучший результат — 94,8% на Document Q&A против 70,1% у юристов
3Вручную сверить только блоки с суммами, сроками, зонами ответственности и автопродлениемЭто категории, где по данным VLAIR redlining (65,0% против 79,7%) ошибки ИИ наиболее вероятны и наиболее дороги
4Не принимать отсутствие изменений в блоке на веру без дословной цитаты — пустая строка в таблице тоже требует проверкиМодель может пропустить расхождение, а не только исказить его — это отдельный тип ошибки, который сложнее заметить

Прежде чем закладывать конкретный инструмент в рабочий процесс, стоит прогнать 15–20 реальных вопросов по одному тестовому договору через несколько доступных моделей и вручную оценить долю пропущенных пунктов — примерно так же, как это делали в VLAIR и CLAUSE, только на своём документе и своей юрисдикции. Ни один из независимых бенчмарков не тестировал GigaChat, YandexGPT или Claude на русскоязычных договорах по российскому праву напрямую, так что перенос процентов «как есть» рискован. Для такого сравнения удобно, когда несколько моделей доступны через один API без переписывания клиента под каждого вендора — provod.ai даёт такой доступ к каталогу моделей через OpenAI-совместимый протокол, и для проверки гипотезы достаточно сменить base URL, а не переписывать интеграцию заново.

Главный вывод здесь не про модель, а про задачу. Считать, что ИИ уже «умеет договоры», потому что он на 95% точен в ответах с цитатой, — ошибка того же рода, что считать его ненадёжным вовсе, потому что на redlining он проигрывает человеку. Мерить надёжность имеет смысл поштучно — по конкретной операции внутри документа, у каждой из которых своя цена ошибки.

provod.ai — управляемый AI-контур для корпоративных данных

Для внутренних документов важны доступы, роли и контроль расходов: provod.ai даёт рабочие пространства, отдельные аккаунты сотрудников и централизованное управление AI. Платформа проектируется с учётом требований РФ к обработке и защите персональных данных; применимость зависит от конкретного сценария и настроек клиента.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Корпоративный контроль не превращается в ценовой коэффициент: стоимость моделей сохраняется 1:1 с официальными тарифами, без собственной наценки provod.ai.

Изучите корпоративный контур provod.ai: форма регистрации · цены на модели · защита данных по 152-ФЗ · политика обработки данных

Источники