Сотрудник, который поручает чат-боту выгрузку, должен знать не что ChatGPT умеет, а где именно он врёт правдоподобно.
Платите в рублях за GPT API без наценки на токены через provod.ai
Два числа, которые не сходятся
OpenAI утверждает, что на внутреннем бенчмарке построения финансовой модели точность ChatGPT выросла с 43,7% до 87,3% за одно поколение моделей — это цифра из обзора ChatGPT for Excel, пересказывающего заявление вендора. Через два месяца независимая финансовая школа Wall Street Prep дала тому же инструменту на реальной задаче — построении трёхстраничной модели Apple по данным SEC — 2,5 балла из 10, худший результат среди четырёх протестированных инструментов. В рейтинге Wall Street Prep указано: ChatGPT вписывал итоговые числа напрямую в ячейки вместо формул со ссылками и ошибся в прогнозе количества акций — базовой цифре для любого расчёта на акцию.
Это не «модель устарела за два месяца». Это разные методологии измерения одного и того же навыка. Вендорский бенчмарк меряет то, что удобно измерить и показать в презентации. Независимый тест меряет то, с чем реально столкнётся финансист: полную модель, а не изолированную подзадачу. Если вы принимаете решение — доверять ли числу от ChatGPT в отчёте, — вторая цифра ближе к вашей реальности, чем первая.
Где формулы действительно держатся
Прежде чем ставить крест на инструменте, стоит зафиксировать, где GPT таблицы обрабатывает уверенно, а где — нет. В тесте Talkory на 30 задачах по восьми категориям ChatGPT-4o набрал 69 из 90 баллов — не лидер выборки, но крепкий средний результат. Стандартные ВПР и ПРОСМОТРX на одном чистом листе, СУММЕСЛИМН, сортировка, базовая сводная таблица — здесь ошибка редкость, а не система. Академический бенчмарк SpreadsheetBench на 912 реальных задачах с форумов Excel подтверждает: на первой, более простой версии датасета лучший результат моделей — 70,48%.
А дальше начинается обрыв. На второй версии SpreadsheetBench, где задачи требуют многошаговых workflow и работы с несколькими листами, лучший результат любой модели падает до 34,89%. В том же тесте Talkory многокритериальный ИНДЕКС/ПОИСКПОЗ — задача чуть сложнее одиночного ВПР — дал ChatGPT правильный ответ лишь в 4 случаях из 10, а сгенерированный код Power Query M выглядел синтаксически корректным, но не выполнялся примерно в половине случаев. Граница проходит не между «простыми» и «сложными» задачами в бытовом смысле, а между одним критерием поиска на одном листе и несколькими критериями или несколькими листами. Это ровно та граница, за которой начинается большинство реальных корпоративных выгрузок.
Три теста, один проигравший

Формализованная методология Wall Street Prep — не единственное независимое подтверждение. Старший финансовый руководитель Mike Dion протестировал ChatGPT for Excel против Claude и Copilot на трёх финансовых задачах для F9Finance и занял ChatGPT последнее место во всех трёх: пропущена себестоимость в прогнозной модели, а в сценарном анализе операционная маржа превысила 100% — результат, который любой финансист опознает как бессмысленный с первого взгляда. Дион формулирует жёстко: «The output was missing a core line item and has structural problems that take longer to fix than starting over» — вывод был настолько сломан, что исправлять его дольше, чем построить модель заново.
Это ключевой практический момент: ошибка ChatGPT не всегда выглядит как ошибка. Маржа выше 100% хотя бы бросается в глаза. Число, вписанное напрямую вместо формулы-ссылки, — нет: оно выглядит как обычная цифра в ячейке, пока кто-то не попробует изменить исходные данные и не увидит, что итог не пересчитался.
Аргумент за прогресс — и почему он не отменяет проверку
Здесь стоит признать сильную сторону противоположной позиции. Финансовый аналитик Гленн Хоппер в сравнительном тесте отмечает: за квартал ChatGPT и Claude научились принимать целиком PDF отчёта 10-K вместе с многолистовой книгой в одном комплексном промпте — полгода назад это было невозможно технически, а не просто плохо получалось. Прогресс реален, и отрицать его — заниматься тем же самообманом, в котором обвиняют вендора.
Но прогресс в приёме входных данных — не то же самое, что прогресс в точности вычислений. Причина системная, а не версионная. Препринт о токенизации чисел показывает: GPT-модели разбивают числа на токены непоследовательными блоками по 1-3 цифры, а не посимвольно, как некоторые альтернативные архитектуры. Это порождает воспроизводимые арифметические ошибки именно на крупных и нестандартных числах — ровно тех, что встречаются в финансовых моделях с их шестизначными выручками и дробными долями акций. Пока эта механика токенизации не изменится на архитектурном уровне, каждая новая версия модели будет улучшать понимание контекста и не обязана улучшать саму арифметику. Оптимизм Хоппера и скепсис Диона не противоречат друг другу — они описывают два разных слоя одной системы.
Тест на галлюцинацию

Отдельная опасность — не арифметическая ошибка, а придуманный ответ там, где данных попросту нет. Excel MVP Лейла Гарани показала это на конкретном примере: при загрузке «сырой» выгрузки с кодами вместо названий и без явных формул ChatGPT может домыслить недостающее вместо честного «в файле нет данных для этого расчёта» — разбор её демонстрации приведён в обзоре на Hubsite365. Её формулировка: «Do not treat AI as a black box, and do not upload raw workbooks without checks» — не относиться к ИИ как к чёрному ящику и не загружать сырые книги без проверок. Это иллюстрация механизма на одном подготовленном файле, а не статистика по частоте, но механизм узнаваем: модель обучена отвечать, а не молчать.
Технически расчёты в режиме анализа данных выполняются не «на словах», а через защищённую Python-песочницу — это описано в справке OpenAI о режиме анализа данных, там же указаны практические лимиты: файлы CSV и таблиц ограничены примерно 50 МБ, платным пользователям доступно до 80 загрузок за 3 часа. Знание про песочницу — не гарантия правильного ответа, но объясняет, почему просьба «покажи код, а не готовое число» вообще работает: код можно прочитать и проверить логику, число — нет.
Что делать с выгрузкой сегодня
Сотруднику, которому поручили работу с таблицей, нужен не общий совет «проверяйте ИИ», а конкретный протокол перед тем, как число уходит в отчёт.
Чек-лист «5 проверок перед тем как доверять таблице от ChatGPT»:
| № | Проверка | Что ловит |
|---|---|---|
| 1 | Сверить итоговую сумму вручную (калькулятор или отдельная формула) | Ошибки токенизации на крупных числах |
| 2 | Попросить показать формулы или код, а не готовые числа | Значения, вписанные напрямую вместо ссылок (кейс Wall Street Prep) |
| 3 | Задать вопрос, ответа на который в данных нет | Галлюцинацию вместо признания нехватки данных (кейс Гарани) |
| 4 | Сравнить результат с ручной сводной таблицей на том же диапазоне | Скрытые ошибки группировки и фильтрации |
| 5 | Построчно проверить кросс-листовые ссылки | Многокритериальные и многошаговые ошибки (провал на SpreadsheetBench v2) |
Три из пяти пунктов — это не паранойя, а прямой ответ на конкретную задокументированную ошибку из реальных тестов, а не абстрактная предосторожность.
Отдельно стоит вопрос выбора инструмента для этой задачи. GigaChat заявляет похожие функции — генерацию формул, объяснение логики, поиск аномалий, сокращение рутины на 40-60% — но сам вендор честно предупреждает пользователя проверять ответы, а независимого теста точности на табличных задачах, сопоставимого по строгости с Wall Street Prep, для него пока нет, судя по странице ГигаЧата для таблиц. Разброс результатов между моделями в тестах Talkory и Wall Street Prep — это и есть аргумент за то, чтобы спорную формулу или выгрузку прогонять через несколько моделей и сравнивать выводы, а не менять подписки под каждую проверку: provod.ai даёт единый OpenAI-совместимый доступ к моделям своего каталога — базовый URL и ключ меняются, клиент остаётся прежним, — так что сверка двух-трёх ответов на одной и той же задаче становится рутинной операцией, а не отдельным проектом.
Главное решение не меняется от версии к версии модели: где бы GPT таблицы ни обрабатывал — простую сводную или финмодель, — число проверяется по формуле-источнику, а не по тому, звучит ли оно правдоподобно.
provod.ai — маршрутизация моделей внутри агентного сценария
Не поручайте одной модели весь процесс: для планирования, кода, поиска, проверки и финального ответа можно выбрать разные модели, сохранив один API и единый контроль расходов.
В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.
Экономика каждого шага остаётся видимой: все модели тарифицируются 1:1 по официальным ценам, без дополнительной комиссии provod.ai за маршрутизацию.
Соберите эффективного AI-агента: форма регистрации · цены на модели · защита данных по 152-ФЗ · API и интеграции
Источники
- OpenAI, анонс ChatGPT for Excel
- Справка OpenAI о режиме анализа данных
- Wall Street Prep, рейтинг AI-инструментов для финмоделирования
- F9Finance, тест ChatGPT против Claude и Copilot
- SpreadsheetBench, проект и результаты
- Talkory, тест лучших AI для формул Excel 2026
- Hubsite365, разбор демонстрации Лейлы Гарани
- Pasquale Pillitteri, обзор ChatGPT for Excel и Google Sheets
- Гленн Хоппер, сравнительный тест AI-копилотов
- arXiv, препринт о токенизации чисел в языковых моделях
- Sber Developers, страница ГигаЧата для таблиц
