← Все статьи
Новости9 мин чтения

DeepSeek научился читать чеки и рукописи. Вопрос — что ему нельзя показывать

Разбираемся, какие фото безопасно и точно превращать в текст через DeepSeek, GigaChat и специализированные OCR-сервисы, а что нельзя грузить в облако ни при каких обстоятельствах

Обложка статьи: DeepSeek научился читать чеки и рукописи. Вопрос — что ему нельзя показывать

Разбираемся, какие фото безопасно и точно превращать в текст через DeepSeek, GigaChat и специализированные OCR-сервисы, а что нельзя грузить в облако ни при каких обстоятельствах

18–19 июня 2026 года DeepSeek добавил в чат функцию распознавания изображений на базе архитектуры DeepSeek-VL2 — теперь туда можно скинуть фото чека, тетрадный конспект или таблицу и получить текст обратно прямо в диалоге. Формально запрос «распознавание фото дипсик» решается за десять секунд: открыл чат, прикрепил снимок, получил Markdown. Проблема начинается на следующем шаге — когда в кадре оказывается не чек из «Пятёрочки», а паспорт или договор с персональными данными.

Официальная политика конфиденциальности DeepSeek прямо говорит, что загруженные файлы обрабатываются и хранятся в КНР и могут передаваться государственным органам по запросу — это формулировка из самого документа компании, а не домысел журналистов. И это не абстрактный юридический риск: CEO Feroot Security Иван Царынный нашёл в коде входной страницы DeepSeek скрытые обращения к cmpassport.com — инфраструктуре, связанной с China Mobile, и дал по этому поводу показания перед Конгрессом США. Точность распознавания в этой картине — вторичный вопрос. Первичный: что вообще можно скармливать этому чату.

Платите в рублях за DeepSeek API без наценки на токены через provod.ai

Как DeepSeek читает фото и почему это не то же самое, что DeepSeek-OCR

Vision-функция в приложении и открытая модель DeepSeek-OCR — разные продукты, и путать их вредно. DeepSeek-OCR — отдельная модель с MIT-лицензией, вышедшая 20 октября 2025 года и обновлённая до DeepSeek-OCR2 27 января 2026-го; она конвертирует документы в Markdown с сохранением структуры, но требует локальный GPU с CUDA 11.8+ и PyTorch 2.6.0. Это инструмент для тех, кто готов возиться с окружением, а не для человека, который просто хочет расшифровать почерк лектора. У обычного пользователя нет выбора между «локально» и «в облаке» — только облако, а значит и вопрос про хранение данных в КНР снят с повестки не будет.

При этом сама функция распознавания уже не идеальна даже в безобидных задачах. Журналисты IT Home загрузили в DeepSeek Vision известные фото основателя компании Лян Вэньфэна — модель перепутала его с тремя другими публичными людьми из-за нехватки обучающих данных о закрытом основателе. Тест касался распознавания лиц; к качеству OCR текста он относится лишь косвенно, зато показывает общий уровень зрелости функции спустя месяц после запуска: от первого же чека не стоит ждать безупречной точности.

Чеки, рукописи, таблицы: где чат-бот справляется

Для основной массы бытовых задач DeepSeek и GigaChat работают достаточно похоже друг на друга. GigaChat Pro бесплатно распознаёт печатный и рукописный текст, формулы, графики и таблицы через веб, Telegram и «ВКонтакте», а контекст доведён до 32 000 токенов — это заявленный набор функций Сбера, но там же честно отмечено, что размытые фото и мелкий почерк распознаются нестабильно. Ничего специфичного к «Сберу» в этом ограничении нет — это общая слабость всех вендоров.

Агрегаторский обзор MashaGPT заявляет точность топовых мультимодальных моделей на сложных документах в 91–94% по бенчмарку DocVQA 2026 против 67% у классического Tesseract и 79% у ABBYY FineReader — но на смятых чеках с термобумаги та же метрика падает до 88–92% против 98–99% на чистых сканах. Это вендорский маркетинговый блог, методология бенчмарка не раскрыта, и относиться к цифрам стоит как к ориентиру, а не к аудиту. Но направление совпадает со здравым смыслом: угол съёмки и качество бумаги решают больше, чем выбор конкретного чат-бота.

Отдельно стоит рукописный русский текст. Компания Content AI на датасете ШИФТ ЦФТ получила 78% пословного и 95,1% посимвольного распознавания своим специализированным движком — с типичными ошибками на слитных строках и почерке с сильным наклоном. Цифры 2023 года и не про массовые чат-боты 2026-го, но они хорошо объясняют, почему пословная точность конспекта студента почти никогда не будет стопроцентной: даже специализированный движок теряет каждое пятое слово при плохом почерке.

Если задача — не выбрать один инструмент раз и навсегда, а быстро сверить, как одно и то же фото прочитают разные модели, разумнее не открывать по очереди пять сайтов с разными аккаунтами. provod.ai собирает доступ к текущему каталогу мультимодальных моделей платформы в одном чате, и один и тот же скан можно прогнать через несколько движков подряд, не пересаживаясь между вкладками. Полезная роль такого сценария — быстро увидеть расхождения между распознаваниями до того, как текст попадёт в Word или отчёт.

Царынный против Алиханова: риск не отменяет доступность

02 evidence

Здесь и рождается развилка мнений. Царынный настаивает: «We see direct links to servers and companies in China that are under control of the Chinese government» — и на этом строит вывод о небезопасности загрузки в DeepSeek чего угодно чувствительного. По состоянию на начало 2026 года DeepSeek уже ограничен или запрещён на уровне госструктур в Италии, США, Южной Корее, Австралии, Тайване и Индии — список из шести с лишним юрисдикций.

Российский регулятор занял другую позицию. Министр промышленности и торговли Антон Алиханов, комментируя итоговую редакцию закона об ИИ, отказавшуюся от прямого запрета DeepSeek и ChatGPT для частных пользователей, сказал прямо: «Своих готовых, по-настоящему обкатанных решений не хватает» — ограничения оставили только для госорганов и критической инфраструктуры, с переходным периодом до 2032 года. То есть частному человеку формально ничего не запрещено — но это решение о доступе оставляет открытым вопрос приватности данных и не отменяет ни политику конфиденциальности DeepSeek, ни находку Feroot.

Практическая доступность тоже не гарантирована: 25 мая 2026 года DeepSeek на несколько часов пропал для российских пользователей из-за обрыва на этапе проверки TLS-сертификата, и Роскомнадзор в тот же день заявил, что сам никаких ограничений не вводил — сервис восстановился без объяснения причины сбоя. Для сравнения, ChatGPT недоступен из России не по решению РКН, а из-за собственной блокировки трафика со стороны OpenAI и отказа Stripe принимать российские карты — поэтому DeepSeek и GigaChat остаются практичнее для читателя без VPN, несмотря на майский инцидент.

Формулы — отдельная лига

С формулами универсальные чат-боты работают заметно хуже, чем со связным текстом, и здесь в игру входят специализированные сервисы. Разработчик Handium Никита Карбовский заявляет на сайте своего продукта около 90% точности на рукописных формулах и 95% на печатных, с выводом сразу в LaTeX, DOCX и PDF, против 70–80% у конкурента Mathpix, который к тому же слабее работает с русским текстом. Это вендорские цифры без независимого аудита методологии, но логика применима: если формула рукописная и на русском — стоит попробовать специализированный сервис, а не сразу тянуть чат-бота общего назначения. Простую печатную формулу на латинице DeepSeek или GigaChat, скорее всего, прочитают достаточно точно, чтобы не тратить время на второй инструмент.

Что нельзя грузить в облако ни при каких условиях

03 decision
Тип документаРекомендованный инструментКомментарий
Чек, квитанцияDeepSeek Vision, GigaChat ProКачество съёмки важнее выбора чат-бота
Рукописный конспект (рус.)GigaChat Pro, DeepSeek VisionСлитный почерк и сильный наклон — источник ошибок у любого инструмента
ТаблицаDeepSeek Vision, GigaChat ProПросите вывод в Markdown или CSV — проще проверить объединённые ячейки
Печатная формула (лат.)Чат-бот общего назначенияСпециализированный сервис обычно избыточен
Рукописная формула (рус.)Handium, при необходимости MathpixЗаявленная точность специализированных сервисов выше
Текст под углом, бликиПереснять или использовать GigaChatНестабильность распознавания растёт при плохом кадре
Паспорт, скан договора, документ с ПДнНе грузить в облачные чат-боты вовсеДля DeepSeek — хранение данных в КНР по официальной политике конфиденциальности

Последняя строка — не перестраховка. Это прямое следствие политики конфиденциальности DeepSeek: если в кадре паспортные данные, номер счёта или условия договора, вопрос уже не только в точности OCR, а в том, что файл по правилам сервиса может храниться и обрабатываться в КНР и передаваться госорганам по запросу. Находка Feroot усиливает этот вывод как отдельный сигнал риска инфраструктуры и авторизации, но не доказывает передачу содержимого загруженных фото.

Из фото в Word без потерь

Хорошее фото решает половину проблемы: снимайте сверху, без наклона и бликов, при дневном свете. В запросе к чат-боту явно просите формат вывода — «выведи как таблицу в Markdown» или «сохрани абзацы как в оригинале» — иначе модель сама решит, как оформить текст, и решение не всегда совпадёт с вашим. Результат вставляется в Word как обычный текст, но таблицы стоит перепроверять вручную: объединённые ячейки и «дорисованные» моделью цифры — частая причина ошибок, которую не видно с первого взгляда.

Если распознавание чеков превращается из разового хака в регулярную бухгалтерскую задачу — например, команда каждый месяц разбирает пачку авансовых отчётов, — личный бесплатный чат перестаёт быть удобным форматом: нет общего баланса, нет закрывающих документов для бухгалтерии. В такой регулярной работе provod.ai закрывает инфраструктурную часть: рублёвая оплата и закрывающие документы от юрлица решают административную проблему, а качество распознавания всё равно нужно проверять на выбранной модели и конкретных снимках.

provod.ai — единый контур для растущего числа команд и сценариев

Добавляйте сотрудников, продукты и новые модели без отдельной закупки для каждого направления: общий API и рабочее пространство снижают операционный хаос по мере роста.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Рост использования не включает процент агрегатора поверх модели: провайдерская цена сохраняется 1:1, без собственной маржи provod.ai.

Подготовьте AI-контур к росту: форма регистрации · цены на модели · защита данных по 152-ФЗ · API и интеграции

Источники