Разбираемся, какие фото безопасно и точно превращать в текст через DeepSeek, GigaChat и специализированные OCR-сервисы, а что нельзя грузить в облако ни при каких обстоятельствах
18–19 июня 2026 года DeepSeek добавил в чат функцию распознавания изображений на базе архитектуры DeepSeek-VL2 — теперь туда можно скинуть фото чека, тетрадный конспект или таблицу и получить текст обратно прямо в диалоге. Формально запрос «распознавание фото дипсик» решается за десять секунд: открыл чат, прикрепил снимок, получил Markdown. Проблема начинается на следующем шаге — когда в кадре оказывается не чек из «Пятёрочки», а паспорт или договор с персональными данными.
Официальная политика конфиденциальности DeepSeek прямо говорит, что загруженные файлы обрабатываются и хранятся в КНР и могут передаваться государственным органам по запросу — это формулировка из самого документа компании, а не домысел журналистов. И это не абстрактный юридический риск: CEO Feroot Security Иван Царынный нашёл в коде входной страницы DeepSeek скрытые обращения к cmpassport.com — инфраструктуре, связанной с China Mobile, и дал по этому поводу показания перед Конгрессом США. Точность распознавания в этой картине — вторичный вопрос. Первичный: что вообще можно скармливать этому чату.
Платите в рублях за DeepSeek API без наценки на токены через provod.ai
Как DeepSeek читает фото и почему это не то же самое, что DeepSeek-OCR
Vision-функция в приложении и открытая модель DeepSeek-OCR — разные продукты, и путать их вредно. DeepSeek-OCR — отдельная модель с MIT-лицензией, вышедшая 20 октября 2025 года и обновлённая до DeepSeek-OCR2 27 января 2026-го; она конвертирует документы в Markdown с сохранением структуры, но требует локальный GPU с CUDA 11.8+ и PyTorch 2.6.0. Это инструмент для тех, кто готов возиться с окружением, а не для человека, который просто хочет расшифровать почерк лектора. У обычного пользователя нет выбора между «локально» и «в облаке» — только облако, а значит и вопрос про хранение данных в КНР снят с повестки не будет.
При этом сама функция распознавания уже не идеальна даже в безобидных задачах. Журналисты IT Home загрузили в DeepSeek Vision известные фото основателя компании Лян Вэньфэна — модель перепутала его с тремя другими публичными людьми из-за нехватки обучающих данных о закрытом основателе. Тест касался распознавания лиц; к качеству OCR текста он относится лишь косвенно, зато показывает общий уровень зрелости функции спустя месяц после запуска: от первого же чека не стоит ждать безупречной точности.
Чеки, рукописи, таблицы: где чат-бот справляется
Для основной массы бытовых задач DeepSeek и GigaChat работают достаточно похоже друг на друга. GigaChat Pro бесплатно распознаёт печатный и рукописный текст, формулы, графики и таблицы через веб, Telegram и «ВКонтакте», а контекст доведён до 32 000 токенов — это заявленный набор функций Сбера, но там же честно отмечено, что размытые фото и мелкий почерк распознаются нестабильно. Ничего специфичного к «Сберу» в этом ограничении нет — это общая слабость всех вендоров.
Агрегаторский обзор MashaGPT заявляет точность топовых мультимодальных моделей на сложных документах в 91–94% по бенчмарку DocVQA 2026 против 67% у классического Tesseract и 79% у ABBYY FineReader — но на смятых чеках с термобумаги та же метрика падает до 88–92% против 98–99% на чистых сканах. Это вендорский маркетинговый блог, методология бенчмарка не раскрыта, и относиться к цифрам стоит как к ориентиру, а не к аудиту. Но направление совпадает со здравым смыслом: угол съёмки и качество бумаги решают больше, чем выбор конкретного чат-бота.
Отдельно стоит рукописный русский текст. Компания Content AI на датасете ШИФТ ЦФТ получила 78% пословного и 95,1% посимвольного распознавания своим специализированным движком — с типичными ошибками на слитных строках и почерке с сильным наклоном. Цифры 2023 года и не про массовые чат-боты 2026-го, но они хорошо объясняют, почему пословная точность конспекта студента почти никогда не будет стопроцентной: даже специализированный движок теряет каждое пятое слово при плохом почерке.
Если задача — не выбрать один инструмент раз и навсегда, а быстро сверить, как одно и то же фото прочитают разные модели, разумнее не открывать по очереди пять сайтов с разными аккаунтами. provod.ai собирает доступ к текущему каталогу мультимодальных моделей платформы в одном чате, и один и тот же скан можно прогнать через несколько движков подряд, не пересаживаясь между вкладками. Полезная роль такого сценария — быстро увидеть расхождения между распознаваниями до того, как текст попадёт в Word или отчёт.
Царынный против Алиханова: риск не отменяет доступность

Здесь и рождается развилка мнений. Царынный настаивает: «We see direct links to servers and companies in China that are under control of the Chinese government» — и на этом строит вывод о небезопасности загрузки в DeepSeek чего угодно чувствительного. По состоянию на начало 2026 года DeepSeek уже ограничен или запрещён на уровне госструктур в Италии, США, Южной Корее, Австралии, Тайване и Индии — список из шести с лишним юрисдикций.
Российский регулятор занял другую позицию. Министр промышленности и торговли Антон Алиханов, комментируя итоговую редакцию закона об ИИ, отказавшуюся от прямого запрета DeepSeek и ChatGPT для частных пользователей, сказал прямо: «Своих готовых, по-настоящему обкатанных решений не хватает» — ограничения оставили только для госорганов и критической инфраструктуры, с переходным периодом до 2032 года. То есть частному человеку формально ничего не запрещено — но это решение о доступе оставляет открытым вопрос приватности данных и не отменяет ни политику конфиденциальности DeepSeek, ни находку Feroot.
Практическая доступность тоже не гарантирована: 25 мая 2026 года DeepSeek на несколько часов пропал для российских пользователей из-за обрыва на этапе проверки TLS-сертификата, и Роскомнадзор в тот же день заявил, что сам никаких ограничений не вводил — сервис восстановился без объяснения причины сбоя. Для сравнения, ChatGPT недоступен из России не по решению РКН, а из-за собственной блокировки трафика со стороны OpenAI и отказа Stripe принимать российские карты — поэтому DeepSeek и GigaChat остаются практичнее для читателя без VPN, несмотря на майский инцидент.
Формулы — отдельная лига
С формулами универсальные чат-боты работают заметно хуже, чем со связным текстом, и здесь в игру входят специализированные сервисы. Разработчик Handium Никита Карбовский заявляет на сайте своего продукта около 90% точности на рукописных формулах и 95% на печатных, с выводом сразу в LaTeX, DOCX и PDF, против 70–80% у конкурента Mathpix, который к тому же слабее работает с русским текстом. Это вендорские цифры без независимого аудита методологии, но логика применима: если формула рукописная и на русском — стоит попробовать специализированный сервис, а не сразу тянуть чат-бота общего назначения. Простую печатную формулу на латинице DeepSeek или GigaChat, скорее всего, прочитают достаточно точно, чтобы не тратить время на второй инструмент.
Что нельзя грузить в облако ни при каких условиях

| Тип документа | Рекомендованный инструмент | Комментарий |
|---|---|---|
| Чек, квитанция | DeepSeek Vision, GigaChat Pro | Качество съёмки важнее выбора чат-бота |
| Рукописный конспект (рус.) | GigaChat Pro, DeepSeek Vision | Слитный почерк и сильный наклон — источник ошибок у любого инструмента |
| Таблица | DeepSeek Vision, GigaChat Pro | Просите вывод в Markdown или CSV — проще проверить объединённые ячейки |
| Печатная формула (лат.) | Чат-бот общего назначения | Специализированный сервис обычно избыточен |
| Рукописная формула (рус.) | Handium, при необходимости Mathpix | Заявленная точность специализированных сервисов выше |
| Текст под углом, блики | Переснять или использовать GigaChat | Нестабильность распознавания растёт при плохом кадре |
| Паспорт, скан договора, документ с ПДн | Не грузить в облачные чат-боты вовсе | Для DeepSeek — хранение данных в КНР по официальной политике конфиденциальности |
Последняя строка — не перестраховка. Это прямое следствие политики конфиденциальности DeepSeek: если в кадре паспортные данные, номер счёта или условия договора, вопрос уже не только в точности OCR, а в том, что файл по правилам сервиса может храниться и обрабатываться в КНР и передаваться госорганам по запросу. Находка Feroot усиливает этот вывод как отдельный сигнал риска инфраструктуры и авторизации, но не доказывает передачу содержимого загруженных фото.
Из фото в Word без потерь
Хорошее фото решает половину проблемы: снимайте сверху, без наклона и бликов, при дневном свете. В запросе к чат-боту явно просите формат вывода — «выведи как таблицу в Markdown» или «сохрани абзацы как в оригинале» — иначе модель сама решит, как оформить текст, и решение не всегда совпадёт с вашим. Результат вставляется в Word как обычный текст, но таблицы стоит перепроверять вручную: объединённые ячейки и «дорисованные» моделью цифры — частая причина ошибок, которую не видно с первого взгляда.
Если распознавание чеков превращается из разового хака в регулярную бухгалтерскую задачу — например, команда каждый месяц разбирает пачку авансовых отчётов, — личный бесплатный чат перестаёт быть удобным форматом: нет общего баланса, нет закрывающих документов для бухгалтерии. В такой регулярной работе provod.ai закрывает инфраструктурную часть: рублёвая оплата и закрывающие документы от юрлица решают административную проблему, а качество распознавания всё равно нужно проверять на выбранной модели и конкретных снимках.
provod.ai — единый контур для растущего числа команд и сценариев
Добавляйте сотрудников, продукты и новые модели без отдельной закупки для каждого направления: общий API и рабочее пространство снижают операционный хаос по мере роста.
В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.
Рост использования не включает процент агрегатора поверх модели: провайдерская цена сохраняется 1:1, без собственной маржи provod.ai.
Подготовьте AI-контур к росту: форма регистрации · цены на модели · защита данных по 152-ФЗ · API и интеграции
Источники
- vc.ru — Макс Полевой, «DeepSeek обзавелся зрением: нейросеть анализирует изображения в чате»
- Lifehacker.ru — «В DeepSeek появилось распознавание изображений — нейросеть не узнала своего создателя»
- GitHub deepseek-ai — репозиторий DeepSeek-OCR
- vc.ru — «GigaChat от Сбера научили распознавать изображения и рукописный текст»
- Handium — страница «Распознавание формул»
- DeepSeek Privacy Policy — официальный документ компании
- Feroot Security — «Ivan Tsarynny on CNBC: DeepSeek's Security Risks and Data Exposure to China Mobile»
- DemandSage — «DeepSeek Banned Countries 2026 [Worldwide List]»
- Anti-Malware.ru — «DeepSeek почти на день пропал в России и вернулся после заявления РКН»
- Деловой Петербург — «Запрет на ChatGPT и DeepSeek убрали из законопроекта об ИИ в РФ»
- vc.ru — «ChatGPT из России в 2026: как пользоваться и оплатить без VPN»
- MashaGPT — «Нейросеть для распознавания текста с фото»
- Habr / Content AI — «Поймет даже почерк врача: технология распознавания русского рукописного текста»
