← Все статьи
Новости9 мин чтения

Perplexity против ChatGPT: почему треть ссылок от лучшего ИИ-поиска всё равно врёт

Крупнейшее независимое исследование цитат ИИ-поиска показало: даже у лидера доля ошибок превышает треть ответов. Инструмент для рабочих задач приходится выбирать вместе с протоколом проверки — точности самой по себе не хватит ни у одного из них.

Обложка статьи: Perplexity против ChatGPT: почему треть ссылок от лучшего ИИ-поиска всё равно врёт

Крупнейшее независимое исследование цитат ИИ-поиска показало: даже у лидера доля ошибок превышает треть ответов. Инструмент для рабочих задач приходится выбирать вместе с протоколом проверки — точности самой по себе не хватит ни у одного из них.

1600 запросов, восемь инструментов, ровно 200 попыток на каждый. Так выглядела методология теста Tow Center for Digital Journalism — самого масштабного независимого замера точности цитирования из тех, что публиковались открыто. Итог по всем восьми продуктам: некорректный ответ более чем в 60% случаев. Худший результат — Grok-3 с 94% ошибок. Лучший — бесплатная версия Perplexity с 37%. Треть неверных цитат у победителя — это системный уровень риска, с которым придётся жить любому, кто решит взять ИИ-поиск как основной инструмент для работы с фактурой.

Дальше данные начинают расходиться с интуицией. Логично было бы предположить, что платная версия точнее бесплатной — за что ещё платить $20 в месяц. Но в том же исследовании Perplexity Pro ошибалась чаще free-тарифа: платная модель реже отказывалась отвечать и чаще выдавала уверенный, но неверный ответ вместо честного «не знаю». Исследователи описали это как компромисс между уверенностью и точностью — продукт, который платит за то, чтобы казаться увереннее, накапливает больше ошибок именно там, где отказ был бы честнее ответа.

Соавтор исследования Клаудия Яжвиньская формулирует вывод жёстко: «Collectively, they provided incorrect answers to more than 60 percent of queries» — совокупно восемь протестированных чат-ботов дали неверные ответы более чем в 60% запросов, пишет Nieman Lab. Это и есть самое сильное возражение против всей идеи, что «ИИ-поиск точнее чата»: разброс между конкретными продуктами (37% против 94%) больше, чем разница между категориями поиск-vs-чат. Точность здесь определяет конкретная реализация; знание того, поисковик перед вами или чат, почти ничего не предсказывает.

Платите в рублях за GPT API без наценки на токены через provod.ai

Что технически отличает Claude от дефолтного ChatGPT

Технический механизм всё же важен, просто он работает не там, где его обычно ищут. В веб-инструменте Claude цитаты включены всегда и содержат cited_text — дословную выдержку до 150 символов из найденной страницы, жёстко привязанную к конкретному URL, согласно официальной документации Anthropic. Это не гарантия фактической точности ответа, но это гарантия того, что цитата технически не может быть оторвана от реального фрагмента текста — модель обязана сослаться на то, что действительно нашла, а не на перефразированное собственное знание.

При этом Claude по умолчанию ищет в вебе избирательно — для новостей, цен, статистики и информации о людях и организациях, которая могла измениться, а на устоявшиеся факты отвечает без обращения к сети. Архитектурно это чат с опциональным поиском: сеть подключается по решению модели. Perplexity устроен ровно наоборот — поиск обязателен первым шагом перед любым ответом. Разница в архитектуре реальна. Просто она не измерена независимо в одном тесте с Claude — исследование Tow Center его вообще не включало, оно тестировало только ChatGPT Search и Perplexity в версиях марта 2025 года.

Голоса за и против

02 evidence

Аравинд Шринивас, CEO и сооснователь Perplexity, публично называет цитаты «валютой» продукта: «Citations are our currency», — говорил он в интервью Fast Company в 2024 году, отвечая на обвинения в плагиате. Там же он признал «шероховатости» (rough edges) в работе функции агрегации контента — конкретный повод для этого признания зафиксировал Forbes: расследование показало случай, когда Perplexity сослался на AI-сгенерированный материал, почти дословно повторявший формулировки оригинальной статьи Forbes про экс-CEO Google Эрика Шмидта. Это единичный документированный кейс середины 2024 года, до заявленных компанией исправлений; системную частоту по нему не оценить, но и списывать проблему цитирования низкокачественных источников со счетов рано.

Автор независимого обзора на Medium, публикующийся под именем Binis, проверял оба инструмента на выборке из 13 академических запросов за неделю и получил ChatGPT с тремя выдуманными ссылками из 13, против нуля у Perplexity в той же выборке. Его вывод честнее, чем цифры: «Always verify every source independently — even with Perplexity», — пишет он. Тринадцать запросов от одного человека — не контролируемое исследование, и сравнивать эту цифру с 37% Tow Center напрямую нельзя. Но направление совпадает с крупным тестом: Perplexity стабильно выигрывает у ChatGPT по частоте выдуманных цитат, просто масштаб разрыва в анекдотическом тесте выглядит куда драматичнее, чем в контролируемом.

Существует и рейтинг, построенный по совсем другому критерию — насколько ответ понравился человеку. Независимая краудсорсинговая площадка LMArena Search Arena собрала 7 тысяч голосов пользователей с 18 марта по 13 апреля 2025 года и получила статистическое равенство между Perplexity Sonar-Reasoning-Pro-High (1136 баллов) и Gemini-2.5-Pro-Grounding (1142 балла), с явным опережением веб-поисковых моделей OpenAI; топ-4 места заняли модели Perplexity. Сама Perplexity подаёт этот результат в блоге как доминирование, ссылаясь на собственный бенчмарк SimpleQA с F-score 0.858 против 0.773 у базовой модели — вендорские цифры на выбранном самой компанией тесте, которые честнее читать как маркетинг с числами. И важно понимать разницу методологий: Arena измеряет, какой ответ понравился людям, а не то, совпадает ли цитата с источником. Это разные критерии, которые в маркетинговых материалах легко склеиваются в один вывод.

Где на самом деле расходятся Perplexity и ChatGPT

03 decision

Расходятся эти два инструмента ещё и в том, откуда берут материал. GEO-компания Averi, ссылаясь на данные Profound, приводит цифру: из 680 млн проанализированных цитирований только 11% доменов встречались одновременно и у ChatGPT, и у Perplexity. ChatGPT на 47,9% топ-цитат опирается на Wikipedia, Perplexity на 46,7% — на Reddit. Это вендорская публикация поставщика услуг AI-видимости с явным коммерческим интересом в подчёркивании различий, а цифры взяты у стороннего поставщика — доверять им стоит с осторожностью. Но сам факт того, что два инструмента системно черпают из разных пластов интернета, объясняет, почему их ответы на один и тот же запрос расходятся уже на уровне индекса источников, до всякой разницы в «умности» модели.

Практический вывод из всего этого: цена решения больше не в деньгах. Perplexity Pro и ChatGPT Plus стоят одинаково — $20 в месяц (или $200 в год), это подтверждают независимые трекеры тарифов: Finout по Perplexity и CometAPI по ChatGPT — обе цифры собраны через сторонние источники, потому что официальные страницы цен на момент проверки возвращали ошибку доступа, и сверить их перед решением всё-таки стоит. При паритете цены выбирать perplexity или chatgpt по бюджету бессмысленно — критерий должен быть в типе задачи.

Если вы разрабатываете и хотите прогнать один и тот же тестовый запрос через несколько моделей с веб-доступом, не открывая три разных вкладки с тремя логинами, практичнее работать через единый OpenAI-совместимый API-доступ — там модель меняется сменой имени в запросе, без переписывания клиента под каждый вендорский протокол; так это устроено, например, в provod.ai. А если сама причина колебаний — нежелание тянуть сразу две фиксированные подписки по $20, при том что оба инструмента ошибаются в цитатах с сопоставимой частотой, разумная альтернатива — рабочее пространство с оплатой по факту использования и контролем расходов в рублях, а не два параллельных абонемента «на всякий случай».

Чек-лист: проверка цитаты за 5 минут

Ни один из инструментов, включая лидера теста, не годится как источник непроверенной ссылки. Рабочий протокол:

  1. Возьмите 3–5 прямых цитат из ответа — не пересказ, а именно фрагмент в кавычках или со ссылкой.
  2. Откройте каждую указанную страницу вручную, не доверяя превью в интерфейсе.
  3. Сверьте: утверждение действительно есть на странице — дословно или по смыслу, без домысливания.
  4. Отметьте отдельно случаи, где ссылка ведёт на материал, который сам пересказывает первоисточник без ссылки на него, — это косвенная цитата, а не первичный факт.
  5. Если хотя бы одна из пяти проверок провалилась, считайте весь ответ черновиком, а не готовым фактом.

При доле ошибок 37% у лучшего инструмента и больше 60% совокупно эти пять минут остаются минимальной защитой от публикации чужой галлюцинации под своим именем.

provod.ai — единый контур для растущего числа команд и сценариев

Добавляйте сотрудников, продукты и новые модели без отдельной закупки для каждого направления: общий API и рабочее пространство снижают операционный хаос по мере роста.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Рост использования не включает процент агрегатора поверх модели: провайдерская цена сохраняется 1:1, без собственной маржи provod.ai.

Подготовьте AI-контур к росту: форма регистрации · цены на модели · защита данных по 152-ФЗ · API и интеграции

Источники