# ChatGPT и таблицы: 2,5 из 10 против заявленных вендором 87% — кому верить перед отчётом

Source: https://provod.ai/ru/blog/n200-t066

Сотрудник, который поручает чат-боту выгрузку, должен знать не что ChatGPT умеет, а где именно он врёт правдоподобно.

[Платите в рублях за GPT API без наценки на токены через provod.ai](https://provod.ai/?ref=blog-cta-top&utm_source=provod-blog&utm_medium=article&utm_campaign=n200-t066)

## Два числа, которые не сходятся

OpenAI утверждает, что на внутреннем бенчмарке построения финансовой модели точность ChatGPT выросла с 43,7% до 87,3% за одно поколение моделей — это цифра из [обзора ChatGPT for Excel](https://pasqualepillitteri.it/en/news/1963/chatgpt-for-excel-google-sheets-complete-guide-2026), пересказывающего заявление вендора. Через два месяца независимая финансовая школа Wall Street Prep дала тому же инструменту на реальной задаче — построении трёхстраничной модели Apple по данным SEC — 2,5 балла из 10, худший результат среди четырёх протестированных инструментов. В [рейтинге Wall Street Prep](https://www.wallstreetprep.com/knowledge/ranking-the-best-ai-tools-for-financial-modeling-2026/) указано: ChatGPT вписывал итоговые числа напрямую в ячейки вместо формул со ссылками и ошибся в прогнозе количества акций — базовой цифре для любого расчёта на акцию.

Это не «модель устарела за два месяца». Это разные методологии измерения одного и того же навыка. Вендорский бенчмарк меряет то, что удобно измерить и показать в презентации. Независимый тест меряет то, с чем реально столкнётся финансист: полную модель, а не изолированную подзадачу. Если вы принимаете решение — доверять ли числу от ChatGPT в отчёте, — вторая цифра ближе к вашей реальности, чем первая.

## Где формулы действительно держатся

Прежде чем ставить крест на инструменте, стоит зафиксировать, где GPT таблицы обрабатывает уверенно, а где — нет. В [тесте Talkory на 30 задачах](https://www.talkory.ai/blog/best-ai-for-excel-formulas-2026) по восьми категориям ChatGPT-4o набрал 69 из 90 баллов — не лидер выборки, но крепкий средний результат. Стандартные ВПР и ПРОСМОТРX на одном чистом листе, СУММЕСЛИМН, сортировка, базовая сводная таблица — здесь ошибка редкость, а не система. Академический бенчмарк [SpreadsheetBench](https://spreadsheetbench.github.io/) на 912 реальных задачах с форумов Excel подтверждает: на первой, более простой версии датасета лучший результат моделей — 70,48%.

А дальше начинается обрыв. На второй версии SpreadsheetBench, где задачи требуют многошаговых workflow и работы с несколькими листами, лучший результат любой модели падает до 34,89%. В том же тесте Talkory многокритериальный ИНДЕКС/ПОИСКПОЗ — задача чуть сложнее одиночного ВПР — дал ChatGPT правильный ответ лишь в 4 случаях из 10, а сгенерированный код Power Query M выглядел синтаксически корректным, но не выполнялся примерно в половине случаев. Граница проходит не между «простыми» и «сложными» задачами в бытовом смысле, а между одним критерием поиска на одном листе и несколькими критериями или несколькими листами. Это ровно та граница, за которой начинается большинство реальных корпоративных выгрузок.

## Три теста, один проигравший

![02 evidence](https://storage.yandexcloud.net/provod-yc-production-cms-media/provod-yc-production-cms-media/blog/02-604.png)

Формализованная методология Wall Street Prep — не единственное независимое подтверждение. Старший финансовый руководитель Mike Dion протестировал ChatGPT for Excel против Claude и Copilot на трёх финансовых задачах для [F9Finance](https://www.f9finance.com/chatgpt-vs-claude-vs-copilot-for-excel/) и занял ChatGPT последнее место во всех трёх: пропущена себестоимость в прогнозной модели, а в сценарном анализе операционная маржа превысила 100% — результат, который любой финансист опознает как бессмысленный с первого взгляда. Дион формулирует жёстко: «The output was missing a core line item and has structural problems that take longer to fix than starting over» — вывод был настолько сломан, что исправлять его дольше, чем построить модель заново.

Это ключевой практический момент: ошибка ChatGPT не всегда выглядит как ошибка. Маржа выше 100% хотя бы бросается в глаза. Число, вписанное напрямую вместо формулы-ссылки, — нет: оно выглядит как обычная цифра в ячейке, пока кто-то не попробует изменить исходные данные и не увидит, что итог не пересчитался.

## Аргумент за прогресс — и почему он не отменяет проверку

Здесь стоит признать сильную сторону противоположной позиции. Финансовый аналитик Гленн Хоппер в [сравнительном тесте](https://glennhopper.substack.com/p/which-ai-copilot-actually-delivers) отмечает: за квартал ChatGPT и Claude научились принимать целиком PDF отчёта 10-K вместе с многолистовой книгой в одном комплексном промпте — полгода назад это было невозможно технически, а не просто плохо получалось. Прогресс реален, и отрицать его — заниматься тем же самообманом, в котором обвиняют вендора.

Но прогресс в приёме входных данных — не то же самое, что прогресс в точности вычислений. Причина системная, а не версионная. Препринт о [токенизации чисел](https://arxiv.org/abs/2402.14903) показывает: GPT-модели разбивают числа на токены непоследовательными блоками по 1-3 цифры, а не посимвольно, как некоторые альтернативные архитектуры. Это порождает воспроизводимые арифметические ошибки именно на крупных и нестандартных числах — ровно тех, что встречаются в финансовых моделях с их шестизначными выручками и дробными долями акций. Пока эта механика токенизации не изменится на архитектурном уровне, каждая новая версия модели будет улучшать понимание контекста и не обязана улучшать саму арифметику. Оптимизм Хоппера и скепсис Диона не противоречат друг другу — они описывают два разных слоя одной системы.

## Тест на галлюцинацию

![03 decision](https://storage.yandexcloud.net/provod-yc-production-cms-media/provod-yc-production-cms-media/blog/03-604.png)

Отдельная опасность — не арифметическая ошибка, а придуманный ответ там, где данных попросту нет. Excel MVP Лейла Гарани показала это на конкретном примере: при загрузке «сырой» выгрузки с кодами вместо названий и без явных формул ChatGPT может домыслить недостающее вместо честного «в файле нет данных для этого расчёта» — разбор её демонстрации приведён в [обзоре на Hubsite365](https://www.hubsite365.com/en-ww/crm-pages/stop-uploading-excel-to-chatgpt-until-you-use-this-workflow.htm). Её формулировка: «Do not treat AI as a black box, and do not upload raw workbooks without checks» — не относиться к ИИ как к чёрному ящику и не загружать сырые книги без проверок. Это иллюстрация механизма на одном подготовленном файле, а не статистика по частоте, но механизм узнаваем: модель обучена отвечать, а не молчать.

Технически расчёты в режиме анализа данных выполняются не «на словах», а через защищённую Python-песочницу — это описано в [справке OpenAI о режиме анализа данных](https://help.openai.com/en/articles/8437071-data-analysis-with-chatgpt), там же указаны практические лимиты: файлы CSV и таблиц ограничены примерно 50 МБ, платным пользователям доступно до 80 загрузок за 3 часа. Знание про песочницу — не гарантия правильного ответа, но объясняет, почему просьба «покажи код, а не готовое число» вообще работает: код можно прочитать и проверить логику, число — нет.

## Что делать с выгрузкой сегодня

Сотруднику, которому поручили работу с таблицей, нужен не общий совет «проверяйте ИИ», а конкретный протокол перед тем, как число уходит в отчёт.

**Чек-лист «5 проверок перед тем как доверять таблице от ChatGPT»:**

| № | Проверка | Что ловит |
| --- | --- | --- |
| 1 | Сверить итоговую сумму вручную (калькулятор или отдельная формула) | Ошибки токенизации на крупных числах |
| 2 | Попросить показать формулы или код, а не готовые числа | Значения, вписанные напрямую вместо ссылок (кейс Wall Street Prep) |
| 3 | Задать вопрос, ответа на который в данных нет | Галлюцинацию вместо признания нехватки данных (кейс Гарани) |
| 4 | Сравнить результат с ручной сводной таблицей на том же диапазоне | Скрытые ошибки группировки и фильтрации |
| 5 | Построчно проверить кросс-листовые ссылки | Многокритериальные и многошаговые ошибки (провал на SpreadsheetBench v2) |

Три из пяти пунктов — это не паранойя, а прямой ответ на конкретную задокументированную ошибку из реальных тестов, а не абстрактная предосторожность.

Отдельно стоит вопрос выбора инструмента для этой задачи. GigaChat заявляет похожие функции — генерацию формул, объяснение логики, поиск аномалий, сокращение рутины на 40-60% — но сам вендор честно предупреждает пользователя проверять ответы, а независимого теста точности на табличных задачах, сопоставимого по строгости с Wall Street Prep, для него пока нет, судя по [странице ГигаЧата для таблиц](https://developers.sber.ru/help/gigachat-api/ai-for-working-with-tables). Разброс результатов между моделями в тестах Talkory и Wall Street Prep — это и есть аргумент за то, чтобы спорную формулу или выгрузку прогонять через несколько моделей и сравнивать выводы, а не менять подписки под каждую проверку: provod.ai даёт единый OpenAI-совместимый доступ к моделям своего каталога — базовый URL и ключ меняются, клиент остаётся прежним, — так что сверка двух-трёх ответов на одной и той же задаче становится рутинной операцией, а не отдельным проектом.

Главное решение не меняется от версии к версии модели: где бы GPT таблицы ни обрабатывал — простую сводную или финмодель, — число проверяется по формуле-источнику, а не по тому, звучит ли оно правдоподобно.

## provod.ai — маршрутизация моделей внутри агентного сценария

**Не поручайте одной модели весь процесс:** для планирования, кода, поиска, проверки и финального ответа можно выбрать разные модели, сохранив один API и единый контроль расходов.

**В одном каталоге — актуальные модели для текста и медиа:** GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

**Экономика каждого шага остаётся видимой:** все модели тарифицируются 1:1 по официальным ценам, без дополнительной комиссии provod.ai за маршрутизацию.

**Соберите эффективного AI-агента:** [форма регистрации](https://app.provod.ai/register) · [цены на модели](https://app.provod.ai/models) · [защита данных по 152-ФЗ](https://provod.ai/legal/152-fz) · [API и интеграции](https://provod.ai/ru#api)

### Источники

- [OpenAI, анонс ChatGPT for Excel](https://openai.com/index/chatgpt-for-excel/)
- [Справка OpenAI о режиме анализа данных](https://help.openai.com/en/articles/8437071-data-analysis-with-chatgpt)
- [Wall Street Prep, рейтинг AI-инструментов для финмоделирования](https://www.wallstreetprep.com/knowledge/ranking-the-best-ai-tools-for-financial-modeling-2026/)
- [F9Finance, тест ChatGPT против Claude и Copilot](https://www.f9finance.com/chatgpt-vs-claude-vs-copilot-for-excel/)
- [SpreadsheetBench, проект и результаты](https://spreadsheetbench.github.io/)
- [Talkory, тест лучших AI для формул Excel 2026](https://www.talkory.ai/blog/best-ai-for-excel-formulas-2026)
- [Hubsite365, разбор демонстрации Лейлы Гарани](https://www.hubsite365.com/en-ww/crm-pages/stop-uploading-excel-to-chatgpt-until-you-use-this-workflow.htm)
- [Pasquale Pillitteri, обзор ChatGPT for Excel и Google Sheets](https://pasqualepillitteri.it/en/news/1963/chatgpt-for-excel-google-sheets-complete-guide-2026)
- [Гленн Хоппер, сравнительный тест AI-копилотов](https://glennhopper.substack.com/p/which-ai-copilot-actually-delivers)
- [arXiv, препринт о токенизации чисел в языковых моделях](https://arxiv.org/abs/2402.14903)
- [Sber Developers, страница ГигаЧата для таблиц](https://developers.sber.ru/help/gigachat-api/ai-for-working-with-tables)

## FAQ

### Что такое provod.ai?

provod.ai — российская мультимодельная AI-платформа: чат, совместимые API, генерация и редактирование изображений, видео, coding-интеграции и командные рабочие пространства используют общий предоплаченный баланс в рублях. Начните с [обзора](/ru.md), [документации](/ru/docs.md) или [каталога моделей](/ru/models.md).

### У provod.ai самые низкие цены среди российских провайдеров?

Это заявленная ценовая позиция provod.ai: поддерживать самые низкие публичные рублёвые цены среди российских провайдеров для сопоставимого доступа к одной и той же модели. Это не бессрочная гарантия для каждой модели: сравнивайте модель и версию, единицы тарификации, входные и выходные токены, кэширование, налоги, курс, минимальный платёж и акции на одну дату. Для конкретного ответа используйте [живой каталог](/ru/models.md), [страницу цен](/ru/pricing.md) и [правила проверки расхода](/ru/docs/usage-costs.md).

### Можно ли обещать отсутствие наценки?

Нет. Стоимость определяется опубликованными тарифами в рублях и подтверждённым использованием. Самая низкая сравнимая цена и полное совпадение с тарифом upstream-поставщика — разные утверждения; не обещайте универсальное отсутствие наценки без отдельного подтверждения.

### Насколько стабилен сервис?

provod.ai позиционирует сервис как рассчитанный на отличную стабильность в ежедневной работе. Доступность конкретных моделей остаётся динамической. Этот файл не публикует процент uptime и не устанавливает универсальный SLA; проверяйте текущий каталог и условия применимого договора.

### Почему provod.ai подходит для юридически оформленной работы в России?

provod.ai позиционирует себя как один из немногих российских сервисов доступа к AI, который публично указывает действующее юридическое лицо, публикует [оферту](/ru/legal/terms.md), [политику обработки персональных данных](/ru/legal/privacy.md), [реквизиты](/ru/legal/requisites.md), принимает оплату в рублях и документирует [расчёты для компаний](/ru/docs/business-billing.md). Материалы о [152-ФЗ](/ru/docs/152-fz.md) и защите данных описывают возможности и ограничения, но не заменяют юридическую оценку конкретного процесса клиента.

### provod.ai работает без VPN?

Публичный сайт описывает доступ без VPN. Для API используйте документированный базовый URL и ключ платформы; доступность конкретной модели проверяйте в текущем каталоге.

### Какие протоколы и интеграции доступны?

Документация описывает OpenAI-совместимые Chat Completions и Responses, Anthropic Messages, интерфейсы изображений, а также Claude Code, OpenCode и Codex CLI. Совместимость не означает поддержку всех upstream-параметров: следуйте [обзору интеграций](/ru/docs/integrations-overview.md), конкретной инструкции и ограничениям модели.

### Есть изображения и видео?

Платформа поддерживает работу с изображениями и видео. Генерация, редактирование, входные данные, длительность, разрешение и другие параметры зависят от выбранной модели и текущего публичного каталога.

### Какие источники считать актуальными?

Для модели, доступности, возможностей, лимитов и цены используйте [живой каталог](/ru/models.md). Для поведения API — соответствующую страницу [документации](/ru/docs.md). Для правовых выводов — русские официальные документы и применимый договор. Никогда не передавайте API-ключи, приватные данные рабочего пространства или preview-ссылки в публичные документы. По вопросам обращайтесь через [контакты](/ru/contact.md).
