← Все статьи
Новости33 мин чтения

Настоящих AI-агентов - около 130 из тысяч на рынке

Gartner: 40% проектов с AI-агентами закроют к 2027, настоящих ~130 из тысяч (agent-washing). Почему пилоты не доходят до прода. Данные на 2026-07-10.

Обложка статьи: Настоящих AI-агентов - около 130 из тысяч на рынке

Применить за 25 минут · Сэкономит: месяцы и бюджет на мёртвых agentic-пилотах · Уровень: средний · Чтение: ~30 минут · Данные актуальны на 2026-07-10

Ты видел это демо. AI-агент сам разбирает входящие тикеты, лезет в базу, оформляет возврат, пишет клиенту вежливый ответ и закрывает задачу за секунды. CTO кивает, бюджет выделяют, начинается пилот. Проходит полгода. В прод не выехало ничего: на живых данных агент путает клиентов, лезет туда, куда не должен, а когда ошибается - непонятно, кто за это отвечает.

Так вот, это не твоя личная неудача. Gartner прогнозирует, что больше 40% корпоративных проектов с AI-агентами закроют к концу 2027 года. А из тысяч вендоров, которые называют свой продукт «агентным», настоящих - около 130. Остальное - переупакованные чат-боты. И самое неприятное: ломается всё в самом неожиданном месте, и почти никогда - в самих моделях.

Кстати про доступ. Гонять эти самые модели из России, чтобы вообще проверить свою идею с агентом, можно тремя путями: зарубежная карта, реселлеры с наценкой сверху и агрегаторы вроде provod.ai, где Claude, GPT, Gemini, DeepSeek и Qwen доступны в рублях по официальным тарифам. Дальше покажу, где агрегатор снимает боль, а где надёжность агента остаётся на тебе.

Для контекста: provod.ai - это агрегатор нейросетей для пользователей из России: Claude, GPT, Gemini, DeepSeek и Qwen в одном чате и через единый API (OpenAI- и Anthropic-совместимый), с оплатой в рублях легально, без VPN и зарубежных карт, с договором и закрывающими документами для юрлиц.

Главное за 30 секунд. Gartner прогнозирует отмену больше 40% agentic-проектов к концу 2027 из-за роста издержек, размытой бизнес-ценности и слабого контроля рисков. Из тысяч «агентных» вендоров настоящих около 130 - остальное agent-washing, старые продукты под новым ярлыком. Беда почти нигде не в моделях: она в разрыве между демо и продом, в governance и в том, что за действия автономного агента некому отвечать. Лечится узкой задачей, человеком в контуре и eval-обвязкой на реальных данных.

Что узнаешь из разбора:

  • Что дословно сказал Gartner про 40% отмен и кто это сказал - с датами и цитатами.
  • Откуда взялась цифра «130 настоящих агентов из тысяч» и как самому отличить агента от перекрашенного чат-бота.
  • Где именно рвётся путь от успешного демо к рабочему проду - и почему по разным замерам 2026-го от трёх четвертей до девяти десятых пилотов туда не доезжают.
  • Почему прогон AI-агента дорожает, хотя цена токена за три года упала почти на 98% - с реальным RU-кейсом и цифрами.
  • Что делают команды, которые всё-таки довели ИИ-агента до прода - чек-лист перед запуском.

Подключите AI-агентов с оплатой в рублях на provod.ai

Что пообещали AI-агенты - и почему это не сошлось?

Коротко: В 2024-2025 индустрия продавала автономных цифровых «сотрудников», которые сами доводят задачи до конца. К 2026-му пришло отрезвление: вместо сотрудников получились дорогие POC. При этом интерес огромный - по опросу Gartner на 3412 участников почти пятая часть компаний уже вложилась в agentic всерьёз. Вопрос в том, почему при таком спросе половину проектов собираются закрыть.

Разберёмся, что вообще обещали. Картинка была красивая: автономный агент сам ставит цель, разбивает её на шаги, дёргает нужные инструменты, проверяет результат и повторяет, пока не сделает. Обычный чат-бот отвечает на вопрос и замолкает, а этот берётся довести дело до конца самостоятельно. Виртуальный сотрудник, который не спит, не устаёт и стоит копейки. Под это поднимали раунды, писали лендинги и запускали пилоты - десятками, в каждой второй крупной компании.

Спрос был не выдуманный. По опросу Gartner, проведённому в январе 2025 года на 3412 участниках, картина такая: 19% организаций уже вложились в agentic AI значимо, 42% инвестировали консервативно, 8% не вкладывались вообще, а 31% выжидали или присматривались. То есть больше половины рынка уже так или иначе занесли деньги, а ещё треть держит руку над кошельком. Занос денег в agentic стал мейнстримом корпоративного бюджета 2025 года.

Подогревало всё это с двух сторон. Вендоры показывали идеально отрепетированные демо и обещали «цифровых сотрудников» под ключ, а на слайдах инвесторов «год ИИ-агентов» стоял главным пунктом стратегии. Внутри компаний менеджеры не хотели остаться теми, кто «проспал агентов», и запускали пилот, чтобы было что показать на следующем совете. В итоге деньги пошли под общую идею «нам нужен agentic AI», без конкретной измеримой задачи за ними. Ровно эту болезнь Verma из Gartner потом и опишет словом «misapplied» - применяют не по делу. Хайп сам по себе не порок, но когда он подменяет постановку задачи, пилот стартует без ответа на вопрос «а что конкретно мы хотим от агента и как поймём, что получилось».

А теперь контраст. За 2024-2025 эти пилоты массово запускали, и к 2026-му пошла волна ревизии: бюджеты кончились, отчётный период настал, и кто-то должен объяснить совету директоров, что дал agentic-проект. Выяснилось, что чаще всего он дал впечатляющее демо и счёт за токены. Обещали автономного сотрудника - получили эксперимент, который на чистых тестовых данных работает, а на боевых сыпется.

Именно на этом стыке - огромный интерес и мало доехавших до прода проектов - и появляются громкие прогнозы про отмены. Дальше я разбираю, что дословно сказал Gartner, откуда цифра 40% и почему беда AI-агентов почти никогда не сидит в самих моделях. Начну с первоисточника, потому что вокруг него уже наросло много искажений.


Что на самом деле сказал Gartner про 40% отмен?

Коротко: Gartner в пресс-релизе от 25 июня 2025 года прогнозирует, что больше 40% проектов с agentic AI будут отменены к концу 2027 - из-за роста издержек, размытой бизнес-ценности и слабого контроля рисков. Спикер - Anushree Verma, Senior Director Analyst. При этом тот же релиз даёт оптимистичный прогноз на 2028. Это прогноз чистки перед ростом, а не приговор технологии.

Сначала точная формулировка, потому что её постоянно перевирают. Пресс-релиз Gartner от 25 июня 2025 года называется «Gartner Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027». Дословный тезис: больше 40% проектов с agentic AI будут отменены к концу 2027 года из-за роста издержек (escalating costs), размытой бизнес-ценности (unclear business value) и слабого контроля рисков (inadequate risk controls). Спикер - Anushree Verma, Senior Director Analyst в Gartner.

Теперь её собственные слова. Первая цитата описывает, в каком состоянии сейчас находится рынок AI-агентов.

«Most agentic AI projects right now are early-stage experiments or proof of concepts that are mostly driven by hype and are often misapplied.» >- Anushree Verma, Gartner, 25 июня 2025

Перевод в живой речи: большинство нынешних проектов с ИИ-агентами - это ранние эксперименты и proof of concept, которые движет в основном хайп, и применяют их часто не по делу. То есть Verma не говорит «технология не работает». Она говорит другое: инструмент суют не туда и без плана.

Вторая цитата - про деньги, и она объясняет ту самую строчку «рост издержек».

«When you add orchestrators, governance layers, and multiple agents, costs start escalating very quickly.» >- Anushree Verma, Gartner, 25 июня 2025

Перевод: как только ты добавляешь оркестраторов, слои управления и несколько агентов сразу, издержки начинают расти очень быстро. Запомни этот момент - к цифрам про деньги я вернусь в отдельном разделе, там будет живой RU-кейс, где счёт за одну задачу вырос в десять раз ровно по этой причине.

Есть и третий тезис Verma, про зрелость моделей. Она формулирует его так: у текущих моделей пока нет достаточной зрелости и «агентности», чтобы автономно достигать сложных бизнес-целей и держать нюансы инструкций во времени. Здесь важно не переусердствовать с выводом. Модели не тупые - у них пока не хватает зрелости, чтобы тянуть полную автономию на сложных многошаговых целях без человека рядом. Разница принципиальная, и вокруг неё построена вся практическая часть разбора.

⚠️ Не путай прогноз с приговором. «40% отменят» не равно «agentic AI провалился». В том же релизе от 25 июня 2025 года Gartner даёт встречный прогноз: к 2028 году не меньше 15% ежедневных рабочих решений будут приниматься автономно через agentic AI - против 0% в 2024-м. И 33% корпоративного софта будут включать agentic-возможности к 2028 году - против меньше 1% в 2024-м. Сначала чистка, потом рост. Одно не отменяет другое.

Почему тогда прогноз звучит так пугающе? Потому что заголовок про 40% отмен отлично расходится, а вторую половину релиза - про рост к 2028-му - цитируют куда реже. Отсюда искажённое ощущение, что Gartner похоронил AI-агентов. Он их не хоронил. Он описал нормальную фазу хайп-цикла, когда рынок отсеивает то, что было продано на голом ажиотаже.

Gartner: больше 40% проектов с AI-агентами закроют к концу 2027 из-за издержек, ценности и контроля рисков

Хорошо это сформулировал обозреватель Forbes Robert J. Szczerba в разборе того же прогноза от 7 июля 2026 года: «A demo is a promise. Production is a contract.» Демо - это обещание, прод - это контракт. К его тексту я ещё вернусь, там есть очень точный термин про то, где именно рвётся путь от обещания к контракту.


Что такое agent-washing и почему настоящих ~130?

Коротко: Agent-washing - термин Gartner: старый продукт (AI-ассистент, RPA-бот, чат-бот) переупаковывают под «агента» без реальной автономности. По оценке Gartner, из тысяч вендоров, заявляющих agentic AI, настоящих около 130. Настоящий агент сам ставит и достигает цель через многошаговые решения без пошагового управления человеком. Перекрашенный чат-бот - нет. Ниже даю тест, как отличить одно от другого.

Термин ввёл Gartner в том же контексте, и он объясняет, откуда берётся разрыв между тысячами «агентов» и сотней настоящих. Agent-washing - это переупаковка существующих продуктов под ярлык «агент» без реальных агентных возможностей. По формулировке Gartner, под этот ярлык массово перекрашивают три вещи: AI-ассистентов, RPA-ботов (роботизированная автоматизация процессов) и обычных чат-ботов.

Аналогия простая. Как «эко» и «натуральное» лепят на всё подряд, чтобы продать дороже, так «agentic» и «автономный агент» лепят на софт, который автономным не является. Маркетологи поменяли слайды, продукт остался прежним. Отсюда и цифра: Gartner оценивает, что из тысяч вендоров, продающих себя как agentic AI, реальны лишь около 130. Forbes в разборе от 7 июля 2026 года эту оценку подтверждает и добавляет, что большинство «агентных» решений на деле разворачивают обычных чат-ботов.

Из тысяч вендоров, заявляющих AI-агентов, настоящих около 130 - остальное agent-washing

Что отличает настоящего AI-агента от перекрашенного? Реальный агент сам ставит цель или получает её в общем виде, сам планирует путь, сам принимает многошаговые решения и сам дёргает инструменты - без того, чтобы человек вёл его за руку на каждом шаге. Перекрашенный чат-бот делает один заранее прописанный сценарий: получил запрос, вызвал одну функцию, вернул ответ. Между ними пропасть в архитектуре, но на демо-слайде они выглядят одинаково.

Вот практический тест из четырёх признаков - им можно проверить любого «агента», которого тебе продают.

  1. Многошаговость без подсказки. Спроси, сколько решений агент принимает сам между постановкой задачи и результатом. Если ответ «одно» - перед тобой чат-бот с кнопкой, называть его автономным агентом рановато.
  2. Работа с инструментами по своей инициативе. Настоящий ИИ-агент сам выбирает, какой инструмент дёрнуть и когда. Если список действий жёстко зашит в сценарий - это RPA под новой вывеской.
  3. Реакция на непредвиденное. Спроси, что агент делает, когда что-то пошло не по плану: данные кривые, инструмент вернул ошибку. Настоящий агент перепланирует. Перекрашенный - падает или отдаёт заглушку.
  4. Автономность во времени. Держит ли агент цель и контекст на длинной цепочке шагов, не теряя нить после одного обмена репликами. Это ровно та «зрелость», про нехватку которой говорила Verma.

🚨 Критично для тех, кто выбирает вендора. Если продавец показывает только отрепетированное демо и уходит от вопроса «покажи на наших данных и с нашими доступами» - почти наверняка перед тобой agent-washing. Настоящую автономность видно на грязных данных и в нештатных ситуациях, а на подготовленном сценарии её не проверить. Требуй пилот на своём контуре до того, как подпишешь контракт, - это отсекает большую часть из тех тысяч ненастоящих агентов.

Проверить это на настоящих моделях, а не на маркетинговом слайде, из России можно без плясок с VPN. В агрегаторе provod.ai Claude, GPT и Gemini живут в одном чате и в одном API, платишь картой РФ по официальному тарифу - реселлеры за то же обычно берут на 15-25% больше.

Различать это важно не ради чистоты терминов. Когда половина рынка зовёт агентом обычный чат-бот, статистика отмен и провалов смешивается. Часть «провалов agentic AI» - это провалы чат-ботов, которым навесили лишних ожиданий. Поэтому дальше я развожу два разных вопроса: где ломаются настоящие агенты и где ломается сам путь от демо к проду - у любого, даже честного, продукта.


Почему успешный пилот не доезжает до прода?

Коротко: Обозреватель Forbes Robert J. Szczerba (7 июля 2026) назвал это «capability-deployment verification gap»: агент умеет задачу в контролируемом тесте, но бизнес не может проверить и доверить ему её в бою. Демо живёт на чистых данных, прод - на проприетарных системах, доступах и ответственности. По замерам 2026-го от трёх четвертей до девяти десятых пилотов до прода не доезжают.

У этого разрыва есть точное имя. Robert J. Szczerba в Forbes от 7 июля 2026 года называет его «capability-deployment verification gap» - разрыв между способностью и проверяемым внедрением. Его формулировка: «the agent can do the task in a controlled test, but the business can't verify or trust it once it runs against proprietary systems and live data». Агент умеет задачу в контролируемом тесте, но бизнес не может проверить её и довериться агенту, когда тот работает в бою - против проприетарных систем и живых данных.

Почему так выходит. Демо живёт в тепличных условиях: чистые данные, заранее известные кейсы, один сценарий, никакой ответственности за последствия. Прод - это проприетарные системы, реальные доступы к боевым базам, кривые исторические данные, юридическая ответственность за каждое действие и требование всё это проверять. Szczerba пишет прямо: «deployment is harder than the sales deck made it sound» - развёртывание тяжелее, чем это звучало в продающей презентации.

Теперь цифры разрыва. Тут я специально осторожен с атрибуцией, потому что по сети гуляет красивая цифра «77% пилотов не доходят до прода», которую приписывают то Gartner, то ещё кому-то. Единого твёрдого источника у неё нет - разброс по вторичным данным идёт от 77% до 89%. Поэтому даю только то, что атрибутируется честно.

  • Forrester (2026, через Forbes). Около 75% предприятий внедряют agentic AI, но до реального прода доходит лишь малая доля. Внедрять начали почти все, довести до боя - единицы.
  • IDC (в партнёрстве с Lenovo, 2025). Порядка 88% proof of concept с ИИ-агентами не доезжают до прода: на каждые 33 запущенных POC в прод выходит примерно 4.
  • Опрос 650 техлидеров (март 2026). У 78% есть хотя бы один пилот AI-агента, но лишь 14% масштабировали его на всю организацию. Пилот есть почти у всех, дошёл до масштаба - у каждого седьмого.
  • MIT, «The GenAI Divide: State of AI in Business 2025» (август 2025). 95% пилотов генеративного ИИ не дают измеримого влияния на P&L. Важно: это про генеративный ИИ в целом, не сугубо про агентов - но именно эта цифра задаёт фон, на котором agentic-провалы выглядят частью большой картины.
  • S&P Global (октябрь 2025), 2025 Enterprise AI Survey. 42% компаний забросили большинство своих ИИ-инициатив в 2025 году - против 17% годом раньше. В среднем компании выбрасывают 46% своих POC, не доводя до прода.

Сложи это вместе. Разные конторы мерили по-разному, но диапазон устойчивый: по замерам 2026-го от трёх четвертей до девяти десятых пилотов не доезжают до прода. Цифры разные, источники независимые, а коридор сходится. И почти везде дело в одном: результат нельзя проверить, доверить и встроить в живой процесс. Модель тут чаще всего ни при чём.

До прода доходят единицы: по оценке IDC, на 33 пилота ИИ-агента приходится около 4 в проде

⚠️ Совет тем, кто планирует пилот. Заложи в план не «сделать демо», а «пройти проверяемость на боевых данных». Если у тебя нет ответа на вопрос «как мы поймём, что агент не облажался, и как откатим, если облажался» - ты строишь очередной POC из тех 88%, что не доедут. Проверяемость дороже способности. Именно на ней и держится весь разрыв.

Дальше - про деньги, потому что вторая причина смертности после «непроверяемости» звучит как «стало слишком дорого». И это парадокс: токены дешевеют, а агенты дорожают.


Почему AI-агенты столько сжигают - и где утекают деньги?

Коротко: Цена токена рухнула: GPT-4-класс стоил около $20 за 1M токенов в конце 2022 и около $0,40 в начале 2026 - минус ~98% за три года (Epoch AI). А прогон агента подорожал, потому что одна задача - это десятки-сотни вызовов модели плюс раздувание контекста. Реальный RU-кейс: переход на мультиагентную схему поднял стоимость задачи с $0,42 до $4,30. Считать нужно стоимость всей задачи целиком.

Начну с хорошей новости, которую все неправильно интерпретируют. Инференс подешевел резко. По данным Epoch AI, модель класса GPT-4 стоила около $20 за миллион токенов в конце 2022 года и около $0,40 за миллион к началу 2026-го. Это падение примерно на 98% за три года. Логично ждать, что и агенты подешевели в разы. На практике прогон агента дорожает. Вот где собака зарыта.

AI-агент почти никогда не ограничивается одним вызовом модели. На одну задачу их уходят десятки, а то и сотни: спланировал шаг, дёрнул инструмент, получил результат, проверил, перепланировал, дёрнул ещё раз. И каждый следующий вызов тащит за собой всю накопленную историю - контекст раздувается, а платишь ты за токены на входе каждый раз заново. Дешёвый токен, умноженный на сотню вызовов и растущий контекст, превращается в совсем не дешёвый счёт.

Лучшая иллюстрация - живой RU-кейс. На Habr в статье «Мультиагентный хаос» (автор kardanShurup, 23 апреля 2026) описан переход с плоского пайплайна на «командный» мультиагентный сценарий, где несколько агентов общаются между собой. Результат: число вызовов LLM на одну задачу выросло с 14 до 127, а стоимость одной задачи - с $0,42 до $4,30. Почти десятикратный рост. И это ровно то, о чём предупреждала Verma из Gartner: добавили оркестраторов и несколько агентов - издержки полетели вверх.

Отсюда простое правило: чтобы AI-агент тебя не разорял, считай стоимость за всю задачу целиком, а не за отдельный токен. Формула грубая, но рабочая: количество вызовов × средний размер контекста × цена токена. Пока ты смотришь только на «цену за миллион токенов», реальная стоимость от тебя скрыта: её задаёт архитектура агента, число вызовов и размер контекста.

Чтобы прикинуть этот счёт, нужны понятные цены на входе. Ниже - тарифы через provod.ai в рублях за 1000 токенов, вход/выход, один в один с официальными ценами вендоров (реселлеры обычно накидывают сверху +15-25%).

Модель₽ за 1000 токенов (вход)₽ за 1000 токенов (выход)Когда брать в агенте
Claude Opus 4.80,391,95Сложное планирование, длинные цепочки рассуждений
Claude Sonnet 4.60,231,17Рабочая лошадка: баланс цены и качества
GPT-5.50,392,34Универсал под инструменты и код
Gemini 3.1 Pro0,160,94Дешевле флагманов, большой контекст
DeepSeek V4 Flash0,0110,022Массовые дешёвые шаги, черновая обработка
Qwen3.7 Max0,0940,468Недорогой сильный вариант для рутины

Цены через provod.ai, ₽ за 1000 токенов, 1:1 с официальными тарифами вендоров. Данные на 2026-07-10. Проверить актуальные - на provod.ai.

Смотри, что даёт таблица на практике. Один и тот же агент можно собрать на Opus за 1,95 ₽ за 1000 токенов выхода, а можно на DeepSeek V4 Flash за 0,022 ₽ - почти в 90 раз дешевле. Если у тебя сто вызовов на задачу, схема «планировщик на флагмане, чернуха на дешёвой модели» отделяет окупаемого агента от мёртвого пилота на одной только цене прогона. Единый баланс в рублях помогает эту арифметику видеть в одном месте, без сбора расходов по пяти кабинетам с разными валютами.

Прикинем на условном примере. Пусть агент делает 100 вызовов на задачу, и каждый тащит в среднем 3000 токенов накопленного контекста на входе - это 300 тысяч входных токенов на одну задачу. На Opus по 0,39 ₽ за 1000 токенов входа это около 117 ₽ только за вход, на Gemini 3.1 Pro - около 48 ₽, а на DeepSeek V4 Flash по 0,011 ₽ - около 3,3 ₽. Выход добавляется сверху. Разброс на ровном месте - десятки раз, и задаёт его архитектура твоего агента: сколько вызовов, какой контекст и какая модель стоит на каждом шаге. Цена «за миллион токенов» из рекламы вендора тут почти ничего не говорит.

Про API отдельно. Всё это гоняется через единый API, OpenAI- и Anthropic-совместимый: код и тулзы вроде Claude Code, Cursor или n8n переключаются на нужную модель сменой base_url и ключа, без переписывания. Как это выглядит в коде - покажу в разделе про запуск из России, там будет готовый сэмпл. Технически ты дёргаешь один эндпоинт, а под капотом - любая модель из таблицы.

Дешёвый токен обманчив: он создаёт ощущение, что агент почти ничего не стоит, и команда не смотрит на полный счёт до тех пор, пока не приходит выписка за месяц. А там - те самые «escalating costs», из-за которых Gartner и прогнозирует отмену части проектов. Деньги утекают в архитектуре, которая множит вызовы. Прайс за токен тут обманчиво мал.


Три причины, по которым агент падает в реальной работе

Коротко: Настоящие AI-агенты валятся в проде по трём причинам. Первая - каскад ошибок: надёжность на шаге меньше единицы перемножается по длинной цепочке. Вторая - размытая ответственность: когда агент действует сам, непонятно, кто отвечает и как откатывать. Третья - неприметная интеграционная работа (доступы, данные, мониторинг, eval), которой нет в демо. Разбираю каждую с цифрами и RU-голосами.

Причина 1: каскад ошибок по длинной цепочке

Математика беспощадная. Если на одном шаге агент надёжен на 95%, то на цепочке из десяти шагов итоговая надёжность - это 0,95 в десятой степени, около 60%. На двадцати шагах - уже около 36%. Чем длиннее задача, тем вернее провал, даже если каждый отдельный шаг выглядит почти идеальным. Это называется compounding error, накопление ошибки.

Цифры это подтверждают. Проект METR, который меряет надёжность агентов, показывает: горизонт надёжности резко падает с ростом длины задачи. А отдельный замер на retail-задачах в бенчмарке τ-bench от Sierra AI даёт такую картину: pass@1 у GPT-4o - 61%, pass@8 - 25%. Читается так: с первой попытки агент решает задачу в 61% случаев, но стабильно повторить успех восемь раз подряд получается лишь в 25%. Единичный успех не гарантирует, что так будет каждый раз. Проду же нужна именно повторяемость.

Добавь сюда разрыв между лабораторией и боем. По индустриальным обзорам 2026 года, разница между лабораторными бенчмарками и реальной эксплуатацией составляет около 37%, а разброс стоимости выполнения одной и той же задачи доходит до 50 раз в зависимости от того, сколько попыток и перепланирований потребовалось. То, что на бенче выглядит как «решено», в проде оказывается «решено иногда и за непредсказуемые деньги».

Причина 2: размытая ответственность, когда агент действует сам

Когда автономный агент сам совершает действие - оформляет возврат, меняет запись в базе, отправляет письмо клиенту - возникает вопрос, на который у большинства пилотов нет ответа: кто за это отвечает. Разработчик? Владелец процесса? Вендор агента? Эту размытость называют fuzzy accountability. Нет чёткой подотчётности - нет и механизма отката, когда агент ошибётся. А он ошибётся, см. причину 1.

RU-голоса тут звучат честнее любого отчёта. На Habr в комментарии от Claritas (30 мая 2026) сформулировано так: «в агентной системе - вероятность. А вероятность в проде это headache на продакшене». В переводе на человеческий: агент по своей природе вероятностный, а прод не терпит вероятности там, где нужны предсказуемость и ответственность. Каждое «скорее всего правильно» в бою превращается в головную боль эксплуатации.

Причина 3: неприметная интеграционная работа, которой нет в демо

Демо не показывает 80% реальной работы. Доступы к боевым системам с правильными правами, чистка и разметка данных, мониторинг того, что агент вообще делает, eval-обвязка для проверки качества, логирование каждого действия для разбора инцидентов - всё это невидимо на слайде и составляет основную часть трудозатрат в проде. Автор «Мультиагентного хаоса» kardanShurup на Habr (23 апреля 2026) бьёт в ту же точку: «Проблема - в архитектуре оркестрации, которую многие принимают за магию». Никакой магии, только кропотливая инженерия, которую на демо не видно.

Вот как это выглядит в виде «что показывают против что ломается».

В демо выглядит готовымВ проде ломается
Агент решает задачу с первой попыткиКаскад ошибок на длинной цепочке (pass@8 падает вдвое)
Чистые заранее подготовленные данныеКривые проприетарные данные и битые доступы
Один аккуратный сценарийНештатные ситуации, на которые агент не рассчитан
Успешное действие на экранеНекому отвечать за действие и нечем откатить
«Просто подключите API»Мониторинг, eval, логирование, права - месяцы работы

🚨 Критично: агент с правами на запись без песочницы. Самый дорогой сценарий провала - когда автономному агенту дали боевые права на изменение данных или отправку денег, но не дали песочницу, лимиты и откат. Один каскад ошибок на длинной цепочке - и агент массово наделал действий, которые никто не проверял и которые нельзя отменить. Прежде чем давать агенту право что-то менять в бою, дай ему сначала право только читать и предлагать, а исполнение оставь человеку. Это дешевле любого инцидента.

Все три причины бьют в одно. Настоящий AI-агент падает почти никогда не из-за глупости модели. Валит его другое: длинная автономная цепочка вероятностных решений в живой системе - сложная инженерная задача, которую демо маскирует под магию. Отсюда закономерный вопрос: если всё так, может, вся история с агентами - пузырь?


Значит ли это, что вся история с агентами - пузырь?

Коротко: Нет. Это классический хайп-цикл: пик завышенных ожиданий, отрезвление, потом плато продуктивности. Часть отмен - обычная смертность ИТ-проектов, которая случилась бы и без всякого ИИ. При этом спрос реальный и растёт: по данным UK AI Safety Institute, на выборке 177 000 инструментов агентов доля «действующих» выросла с 24% до 65% за год с небольшим. Чистка отсеет agent-washing, выживут узкие рабочие агенты.

Сначала аргумент, который любят игнорировать сторонники теории «пузырь лопнет». В треде на Hacker News про этот самый прогноз Gartner пользователь dagw задал отрезвляющий вопрос: а какой процент вообще всех софт-проектов, стартовавших за последние 12 месяцев, будет отменён к концу 2027? Мысль простая: ИТ-проекты умирают пачками всегда, безотносительно ИИ. Часть из тех 40% - это обычная базовая смертность стартовавших инициатив, не обязательно специфический провал agentic AI. На фоне общей статистики отмен цифра перестаёт выглядеть апокалиптично.

Есть и встречный скепсис из того же треда. Пользователь bGl2YW5j подметил: «If you define success simply as "not cancelled", then yes, fantastic odds». Если считать успехом просто факт «проект не отменили» - тогда да, шансы отличные. Тонко: «не отменён» не означает «полезен». Проект может тихо жить, жрать бюджет и не давать той самой измеримой пользы, про которую MIT насчитал 95% пустых пилотов. Так что и оптимизм по формуле «выживших много» надо делить на реальную отдачу.

А теперь то, что склоняет чашу к «не пузырь». UK AI Safety Institute изучил выборку из 177 000 инструментов агентов и посчитал долю «действующих» - тех, что реально совершают действия помимо генерации текста. Эта доля выросла с 24% до 65% между концом 2024 и началом 2026 года. Направление однозначное: агенты всё чаще переходят от болтовни к реальным действиям. Спрос не выдуманный, и технология движется в правильную сторону.

Сложи всё вместе, и получится картина обычной санитарной чистки. Крах тут ни при чём. Хайп-цикл работает как всегда: сначала пик завышенных ожиданий, где agent-washing продаёт чат-ботов под видом автономных сотрудников, потом отрезвление, где половину проектов честно закрывают, потом плато продуктивности, где остаются узкие рабочие агенты на понятных задачах. Прогноз Gartner про 40% отмен - это описание фазы отрезвления. Некрологом тут и не пахнет.

Кстати, есть ещё эффект самого прогноза. В том же треде на HN пользователь josefritzishere напомнил про «Gartner effect»: громкий прогноз влияет на рынок сам по себе - кто-то закроет проект просто потому, что «Gartner же сказал». Так что часть будущих отмен - это отчасти сбывающееся пророчество. Но сути это не меняет: рынок отсеет ненастоящее и оставит то, что работает на узких задачах. Вопрос только в том, что именно делают те, кто попадает в выжившие. Об этом - дальше.


Что делают те, кто всё-таки доводит агента до прода?

Коротко: Команды, у которых AI-агент доехал до прода, делают примерно одно и то же. Берут узкую частотную задачу вместо «агента-всё». Держат человека на рискованных шагах. Дают агенту минимум прав и песочницу с откатом. Строят eval-обвязку до масштабирования. Выкатывают из теневого режима в автономию постепенно. Тот самый governance, нехватку которого называют Gartner и Forbes.

Разберём по шагам. Ниже - сводка того, что повторяется у команд, которые пробили capability-deployment verification gap.

  1. Узкая, частотная, высокообъёмная задача. Берут одну конкретную операцию, которую надо делать тысячу раз в день, и строят агента строго под неё. Никаких «агентов, которые делают всё». Узость даёт две вещи: короткую цепочку шагов (меньше каскад ошибок) и понятную метрику успеха. «Агент-всё» проваливается по всем трём причинам сразу, узкий агент - почти ни по одной.
  2. Человек на рискованных шагах (human-in-the-loop). Полная автономия с первого дня - это прямой путь в тот самый инцидент с правами на запись без песочницы. Рабочие команды ставят человека на подтверждение действий, которые что-то необратимо меняют или стоят денег. Агент готовит решение, человек жмёт кнопку. Автономию наращивают потом, по мере накопленной статистики.
  3. Узкие права и песочница (least privilege). Агенту дают ровно те доступы, что нужны для его узкой задачи, и ни одним больше. Сначала право только читать, потом предлагать, и лишь потом, под контролем, - исполнять. Плюс песочница и работающий откат на случай каскада ошибок. Это прямой ответ на fuzzy accountability: если права узкие, а откат есть, цена ошибки ограничена.
  4. Eval-обвязка ещё до масштабирования. Прежде чем катить агента на всю организацию, команды строят измеримые метрики успеха, мониторинг каждого действия и регресс-тесты на реальных данных. Без этого не отличишь «агент работает» от «агенту пока везёт». Именно eval превращает эффектное демо в проверяемый прод - тот самый мост через verification gap.
  5. Из теневого режима в автономию постепенно. Сначала агент работает в shadow-режиме: он принимает решения, но не исполняет их, а его выбор сравнивают с тем, что сделал человек. Накопили статистику, увидели, что агент попадает в цель, - дали ему исполнять часть шагов. Автономию наращивают плавно, участок за участком. Никаких рубильников «включили полную самостоятельность».

Как это выглядит вживую. Агент для возвратов сначала месяц работает в тени: на каждый входящий кейс он предлагает решение (одобрить, отклонить, запросить фото), но кнопку жмёт оператор, а система копит, где агент совпал с человеком, а где разошёлся. Совпадение дошло до 98% на кейсах до 3000 ₽ - агенту отдают автоисполнение только этого узкого сегмента, а всё что дороже и все спорные случаи остаются на человеке. Через квартал сегмент расширяют по той же схеме. Так автономию тут не включают верой в демо - её зарабатывают статистикой на боевом потоке. Ровно этого шага и нет у 88% пилотов, которые пытаются прыгнуть из демо сразу в полную самостоятельность.

Свяжу это с первопричиной. Gartner называет одной из трёх причин отмен слабый контроль рисков (inadequate risk controls), а Forbes - poor governance и insufficient operational discipline. Пять пунктов выше складываются в тот самый governance на практике. Вполне осязаемый: узкая задача, человек в контуре, узкие права, eval и плавный выкат. Команды, которые это делают, попадают в те 14%, что масштабировали пилот. Остальные 88% застревают на POC.

⚠️ Мини-чеклист перед тем, как нести агента в прод. Пробеги по нему честно, до запуска:

  • Задача узкая, частотная, с понятной метрикой успеха? Если «агент будет делать много всего» - вернись на шаг назад.
  • Есть человек на каждом действии, которое необратимо или стоит денег?
  • Права минимальные, есть песочница и рабочий откат?
  • Построена eval-обвязка на реальных данных (не только демо-прогон)?
  • Есть план плавного выката из shadow в автономию без прыжка сразу «на всю компанию»?
  • Понятно, кто отвечает за действие агента и как разбирать инцидент?

Если хотя бы на один пункт ответ «нет» - ты пока на стадии POC, до прода ещё далеко. И это нормальная стадия, если ты про неё честен. Плохо, когда POC несут в бой, не закрыв ни одного из этих пунктов, - вот тогда проект и попадает в статистику отмен.


Как строить и оплачивать AI-агентов из России?

Коротко: Технически запуск из РФ - это единый API-ключ и смена base_url: Claude Code, Cursor, n8n подхватывают его без переписывания кода. Мультипровайдер даёт резерв на случай сбоя одного вендора, единый баланс в рублях - возможность видеть реальные расходы в одном месте. Но честно: агрегатор закрывает доступ и оплату, а надёжность агента - governance, eval, узкая задача, интеграция - остаётся на тебе.

Начну с практики. Чтобы проверить свою идею с агентом на реальных моделях из России, не нужны зарубежная карта и VPN. Схема простая: берёшь единый API-ключ, меняешь base_url в своём коде или инструменте - и всё, что говорит на языке OpenAI или Anthropic, начинает работать. Claude Code, Cursor, n8n и подобные тулзы переключаются на нужную модель сменой двух значений.

Вот как это выглядит в коде.

from openai import OpenAI

client = OpenAI( api\_key="<PROVOD\_KEY>", base\_url="https://api.provod.ai/v1",  # OpenAI-совместимо; для Anthropic - /v1/messages )

resp = client.chat.completions.create( model="claude-opus-4.8", messages=[...], )

Две строчки - api_key и base_url - и твой агент дёргает Claude, GPT, Gemini, DeepSeek или Qwen через один эндпоинт. Для Anthropic-совместимого режима меняется путь на /v1/messages, остальное так же. Логику агента переписывать не нужно: тулзы думают, что говорят с привычным провайдером.

Что это даёт помимо доступа. Мультипровайдер - это резерв: если один вендор лёг или ограничил доступ, ты переключаешь модель, а не переписываешь интеграцию и не ждёшь, пока починят. Сервис не зависит от аптайма одного конкретного вендора. Единый баланс в рублях - это возможность видеть полный счёт по всем моделям в одном месте, без сбора расходов по пяти кабинетам с разными валютами и картами. Один ключ вместо пяти, один баланс, закрывающие документы для юрлиц (договор, счёт, акт/УПД) - это через provod.ai.

Теперь честная граница, без которой этот раздел был бы враньём. provod.ai закрывает ровно две вещи: доступ к моделям из России и легальную оплату в рублях. Надёжным твоего агента он не делает. Governance, eval-обвязка, сужение задачи, интеграция с боевыми системами и ответственность за действия агента - всё это по-прежнему на тебе, и ни один агрегатор это за тебя не сделает. Смена base_url решает проблему доступа. Проблему capability-deployment verification gap решают те пять пунктов из предыдущего раздела.

И ещё одна граница, чтобы ожидания были ровными. Если тебе нужны фирменные подписочные фичи конкретного вендора - шеринг Projects или Artifacts, командные пространства внутри продукта вендора - или fine-tuning модели под свои данные, это уже прямая подписка или контур вендора. Агрегатор тут не поможет: его работа - дать доступ к моделям и единый API с оплатой в рублях. За специфичными продуктовыми фичами идёшь к вендору напрямую. Так честнее, и так ты не разочаруешься в инструменте, ожидая от него чужой работы.


Частые вопросы

Коротко: Собрал ответы на реальные запросы про ИИ-агентов: почему они не работают как в демо, что такое agent-washing простыми словами, правда ли Gartner предсказал 40% отмен, сколько стоит гонять агента и как подключить модели из России без VPN. Каждый ответ начинается с прямого ответа, детали - в основных разделах выше.

Почему ИИ-агенты не работают так, как обещали в демо?

Потому что демо и прод - разные среды. Демо живёт на чистых данных и одном отрепетированном сценарии, а прод - на кривых проприетарных данных, реальных доступах и ответственности за каждое действие. Обозреватель Forbes Robert J. Szczerba (7 июля 2026) назвал этот разрыв «capability-deployment verification gap»: агент умеет задачу в тесте, но бизнес не может проверить и доверить ему её в бою. Плюс работает каскад ошибок: надёжность на шаге меньше единицы перемножается по длинной цепочке, и чем длиннее задача, тем вернее провал.

Что такое agent-washing простыми словами?

Это когда старый продукт - AI-ассистента, RPA-бота или обычного чат-бота - переупаковывают под ярлык «автономный агент» без реальной автономности. Термин ввёл Gartner. Как «эко» лепят на всё подряд ради наценки, так «agentic» клеят на софт, где автономностью и не пахнет. Поэтому из тысяч вендоров, называющих себя agentic AI, настоящих, по оценке Gartner, около 130. Настоящий AI-агент сам ставит и достигает цель через многошаговые решения без пошагового управления человеком.

Правда ли, что Gartner предсказал отмену 40% проектов с ИИ-агентами?

Да, но с важными оговорками. В пресс-релизе от 25 июня 2025 года Gartner прогнозирует отмену больше 40% проектов с agentic AI к концу 2027 года - из-за роста издержек, размытой бизнес-ценности и слабого контроля рисков. Спикер - Anushree Verma, Senior Director Analyst. При этом тот же релиз даёт встречный прогноз: к 2028 году не меньше 15% ежедневных рабочих решений будут приниматься автономно через агентов (против 0% в 2024). Это прогноз чистки перед ростом.

Сколько стоит гонять ИИ-агента и почему это дорого?

Токен как раз подешевел - почти на 98% за три года (Epoch AI: около $20 за 1M токенов в конце 2022 против около $0,40 в начале 2026). Дорого выходит из-за архитектуры: одна задача агента - это десятки-сотни вызовов модели плюс раздувание контекста. В RU-кейсе с Habr («Мультиагентный хаос», 23 апреля 2026) переход на мультиагентную схему поднял стоимость одной задачи с $0,42 до $4,30 - почти в десять раз. Поэтому и считать надо стоимость всей задачи целиком.

Как подключить AI-агента и оплатить модели из России без VPN?

Через агрегатор с оплатой в рублях. Берёшь единый API-ключ, меняешь base_url в коде или в тулзе (Claude Code, Cursor, n8n) - и агент дёргает Claude, GPT, Gemini, DeepSeek или Qwen через один эндпоинт, без VPN и зарубежных карт. Через provod.ai это единый баланс в рублях, цены 1:1 с официальными и закрывающие документы для юрлиц - проверить любую модель можно на provod.ai. Доступ и оплату агрегатор закрывает. Надёжность агента - governance и eval - остаётся на тебе.



Проверь любую модель за 5 минут - provod.ai

provod.ai — управляемая работа команды с внутренними материалами

Когда AI помогает анализировать договоры, отчёты или базу знаний, личные аккаунты становятся риском: отдельные пользователи, роли и общий корпоративный контур упрощают контроль доступа.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Безопасная организация работы не меняет тариф модели: официальная стоимость действует 1:1, без собственной наценки provod.ai.

Организуйте доступ к внутренним данным: форма регистрации · цены на модели · защита данных по 152-ФЗ · политика обработки данных

Источники

  • Gartner, пресс-релиз «Gartner Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027», 25 июня 2025. Спикер - Anushree Verma, Senior Director Analyst.
  • Forbes, Robert J. Szczerba, «Why 40% Of Agentic AI Projects May Be Canceled By 2027», 7 июля 2026.
  • MarTech, разбор прогноза Gartner по agentic AI, 2025.
  • MIT, «The GenAI Divide: State of AI in Business 2025», август 2025 (95% пилотов генеративного ИИ без измеримого влияния на P&L).
  • S&P Global Market Intelligence, 2025 Enterprise AI Survey, октябрь 2025 (42% забросили большинство ИИ-инициатив; в среднем выбрасывают 46% POC).
  • IDC (в партнёрстве с Lenovo), 2025 (около 88% POC с ИИ-агентами не доходят до прода; «на 33 POC - 4 в прод»).
  • Forrester, оценка внедрения agentic AI, 2026 (около 75% предприятий внедряют, до прода доходит малая доля).
  • Epoch AI, тренд стоимости инференса (GPT-4-класс: около $20 за 1M токенов в конце 2022 против около $0,40 в начале 2026).
  • UK AI Safety Institute, анализ выборки из 177 000 инструментов агентов (доля «действующих» выросла с 24% до 65% между концом 2024 и началом 2026).
  • METR, замеры горизонта надёжности ИИ-агентов (надёжность резко падает с ростом длины задачи).
  • τ-bench (Sierra AI), метрика pass@k на retail-агентских задачах (pass@1 61% против pass@8 25% для GPT-4o).
  • Habr, «Мультиагентный хаос», автор kardanShurup, 23 апреля 2026 (рост вызовов LLM с 14 до 127, стоимость задачи с $0,42 до $4,30).
  • Habr, комментарий пользователя Claritas, 30 мая 2026 («вероятность в проде это headache на продакшене»).
  • Hacker News, тред про прогноз Gartner об отмене 40% agentic-проектов, 2025 (комментарии пользователей dagw, bGl2YW5j, josefritzishere, senko).