Блог профессия

Нейросеть для документов: OCR, извлечение, анализ и генерация

Работа с документами — Word, Excel, PDF, скан-копии, договоры, счета, отчёты, протоколы встреч — закрывается связкой двух классов инструментов: OCR (распознавание текста) и LLM (понимание смысла). Ниже — восемь задач, инструменты под каждую, типовой пайплайн от файла до результата, сравнительная таблица сервисов, российские решения и правила работы с персональными данными по 152-ФЗ.

Как устроена работа ИИ с документами

Между файлом и LLM почти всегда стоит пайплайн: загрузка (PDF, скан, фото, Word, Excel) → OCR (если документ не текстовый) → структурирование (выделение полей, таблиц, заголовков) → анализ через LLM (понимание смысла, извлечение данных, ответ) → результат (JSON, конспект, новый документ, ответ на вопрос).

Современные мультимодальные модели (Claude, GigaChat MAX, GPT, Gemini, Qwen-VL) умеют выполнять шаги 2–4 одной операцией: подать PDF — получить структурированный ответ. Для производственной обработки большого корпуса, где важна точность и предсказуемость, по-прежнему используется явный пайплайн с отдельным OCR-движком и валидацией на каждом шаге.

Граница простая. Десятки документов в месяц, человек смотрит результат, задача разовая — хватит чата с мультимодальной моделью. Сотни документов в день, результат уходит в учёт без человека, нужен аудит — собирается пайплайн из отдельных компонентов.

Восемь задач ИИ с документами

1. Распознавание текста (OCR)

Базовая задача: превратить картинку, скан или PDF без текстового слоя в редактируемый текст. ИИ распознаёт печатный текст на десятках языков, рукописный (с понижением точности), сохраняет структуру (колонки, таблицы, заголовки), читает паспорта и удостоверения, выравнивает кривые фото со смартфона.

Инструменты:

  • ABBYY FineReader — корпоративный стандарт OCR в РФ, экспорт в Word, Excel, редактируемый PDF, поддержка 200+ языков, сохранение макета.
  • Yandex Vision OCR — облачный REST API, оплата по символам, отдельные модели под паспорта, водительские удостоверения и счета.
  • Tesseract — open-source движок от Google, разворачивается локально, точность ниже коммерческих, но хватает для несложных документов.
  • EasyOCR и PaddleOCR — open-source библиотеки с поддержкой русского; PaddleOCR в 2026 году дополнен мультимодальной моделью PaddleOCR-VL, которая совмещает распознавание и понимание макета в одном проходе.
  • GPT-5 Vision, Gemini, Claude, Qwen-VL — мультимодальные LLM «видят» страницу целиком и сразу отвечают по содержанию. На печатных документах среднего качества это часто заменяет отдельный OCR.

Для массовой обработки сканов — отдельный движок. Для разовой задачи «получи ответ по фото квитанции» — мультимодальная модель.

2. Чтение PDF и вопросы по содержимому

Самый частый сценарий за пределами OCR — открыть длинный PDF и задавать вопросы по нему: где про неустойку, что в пункте 4.3, сколько всего страниц про логистику, какие даты упомянуты. Раньше — Ctrl+F и пролистывание, сейчас — чат с документом.

Базовая связка:

  • ChatPDF — узкоспециализированный сервис, загружаешь PDF и спрашиваешь, ответ со ссылками на конкретные страницы. На бесплатном тарифе ограничен по размеру файла и числу вопросов.
  • NotebookLM от Google — позволяет загрузить до 50 источников в один «блокнот» (PDF, тексты, ссылки, Google Docs), задавать вопросы сразу по корпусу, получать ответы с цитатами «откуда взято». Хорошо держит большие объёмы; есть аудиоформат «подкаст по документам» для прослушивания.
  • ChatGPT в режиме чата с прикреплённым файлом, Claude с длинным контекстом (до миллиона токенов), Gemini с интеграцией в Google Drive — все три читают PDF напрямую, без отдельного OCR-шага.
  • GigaChat и YandexGPT — российские модели, читают PDF, держат русский язык, данные не покидают РФ.

Полезные промпт-приёмы при чтении PDF:

Прочитай документ. Ответь на три вопроса:

  1. О чём этот документ в одном предложении.
  2. Самые важные цифры и даты — списком с указанием страниц.
  3. Если бы я был [юрист / бухгалтер / руководитель], на что обратил бы внимание.

Найди в документе все упоминания «[термин]». Приведи цитаты с номерами страниц.

Сравни этот документ с шаблоном [приложить вторым файлом]. Какие пункты добавлены, какие убраны, какие изменены.

3. Извлечение структурированных данных

Из договора нужны стороны, реквизиты (ИНН, КПП, ОГРН), сумма, срок. Из счёта — поставщик, номер, дата, НДС. Из паспорта — ФИО, серия, номер, дата выдачи. Из протокола встречи — участники, решения, ответственные, сроки. Раньше это делал человек, теперь — связка OCR + LLM с фиксированным JSON-шаблоном.

Пример промпта на этапе LLM:

На вход — текст счёта-фактуры. Извлеки в JSON:

  1. Поставщик: название, ИНН, КПП, адрес.
  2. Покупатель: название, ИНН, КПП, адрес.
  3. Номер и дата счёта.
  4. Список позиций: наименование, количество, цена, сумма.
  5. Итог: без НДС, НДС, всего.

Если поле не найдено — поставь null. Не придумывай значений.

В производственном пайплайне после извлечения добавляется валидация (ИНН проверяется по контрольной сумме, дата приводится к ISO-формату, контрагент сверяется по справочнику) и только потом данные передаются в учётную систему.

4. Краткий конспект (summary)

Длинный отчёт, договор на 80 страниц, методичка на 200 — задача «прочитай и расскажи главное» закрывается LLM с длинным контекстом. На выходе: главная мысль в одном-двух предложениях, ключевые факты и цифры списком, оглавление с аннотациями, акценты под конкретную роль (юрист, бухгалтер, руководитель).

Инструменты с длинным контекстом: Claude Pro (до миллиона токенов), GigaChat MAX (до 128К токенов, без VPN), ChatGPT Plus (до 128К в чате, до миллиона в API), NotebookLM (до полумиллиона слов на источник, до 50 источников).

Полезно совмещать два уровня конспекта: «коротко в трёх абзацах» — для общего понимания и «подробно по разделам» — чтобы при необходимости провалиться вглубь.

5. Перевод документа

ИИ переводит документ с сохранением структуры — таблицы остаются таблицами, заголовки — заголовками. Важно: единая терминология по всему документу, цифры и реквизиты без изменений, сохранение тона (деловой, технический, академический), адаптация юридических формулировок под целевую юрисдикцию по отдельной просьбе.

Для документов на 50+ страниц перевод по частям с общим глоссарием даёт более согласованный результат, чем перевод всего файла одним запросом. Глоссарий собирается отдельным промптом до перевода: «вычлени из документа все термины и собственные имена, предложи перевод каждого, дай мне согласовать перед основным проходом».

6. Генерация документов (договоры, КП, протоколы)

Шаблонный договор, коммерческое предложение, акт, претензия, протокол совещания, регламент — ИИ генерирует драфт по входным данным за минуту. Покрываются: типовые договоры (услуги, поставка, аренда, NDA), КП по брифу, счета и акты по реквизитам, письма (запрос, претензия, ответ), внутренние документы (приказы, регламенты, должностные).

Принцип: модель получает шаблон (или формирует его сама), затем заполняет реквизитами и условиями. Юридически значимые документы после генерации проверяет юрист — модель может пропустить важный пункт или вставить формулировку, которая не сработает в суде. Подробнее — на странице Нейросеть для юриста.

Отдельный сценарий — протоколы встреч. Запись звонка в Zoom, Telemost или Контур.Толк прогоняется через распознавание речи (Whisper, Yandex SpeechKit, SaluteSpeech), полученный транскрипт подаётся в LLM с промптом:

Это транскрипт рабочей встречи. Сделай протокол:

  1. Кто участвовал.
  2. Какие темы обсудили (тезисно).
  3. Какие решения приняли.
  4. Список задач: исполнитель, что сделать, срок.

7. Анализ контрактов и поиск рисков

Юридический анализ договора — один из самых ценных сценариев. ИИ ищет невыгодные пункты, отсутствующие защитные оговорки, дисбаланс ответственности сторон, нестандартные формулировки. На выходе — список замечаний с цитатами и предложенными правками.

Базовые промпт-приёмы:

Я заказчик. Прочитай договор и выдели:

  1. Пункты, которые создают для меня риски.
  2. Отсутствующие пункты, которые типово должны быть в таком договоре.
  3. Формулировки с двойным толкованием.
  4. Сроки и санкции — таблицей.

Сравни этот договор с шаблоном [приложить]. Покажи добавленные, удалённые и изменённые пункты. Оцени, что из правок существенно для заказчика.

Для специализированной задачи юридического анализа в РФ используются Doczilla, AIXPERT, Гарант AI и встроенные ИИ-инструменты у КонсультантПлюс — это связка LLM с актуальной базой судебной практики и нормативных актов. Модель обучена под российское право и при анализе ссылается на конкретные статьи и постановления.

8. Excel и таблицы

Работа с числовыми данными — отдельный класс задач. Что закрывает ИИ:

  • Формулы. Описываешь словами что нужно — модель возвращает формулу. «Посчитай долю каждой строки в общей сумме столбца C» — =C2/SUM($C$2:$C$100).
  • Очистка данных. Привести даты к одному формату, убрать лишние пробелы, нормализовать названия компаний, склеить ФИО из трёх столбцов в один.
  • Сводные и графики. Описание задачи — модель рисует pivot-схему и подсказывает, какой тип графика подходит под распределение.
  • Анализ. «Какие позиции продаются хуже всего», «есть ли сезонность», «какие клиенты приносят 80% выручки» — модель возвращает выводы и формулы для проверки.
  • Dashboards. ChatGPT с Code Interpreter (Advanced Data Analysis) и Claude с Analysis tool читают xlsx, считают на Python, рисуют графики прямо в чате и возвращают готовый xlsx обратно.

Для разовой задачи — чат с прикреплённым файлом. Для регулярного отчёта — Python-скрипт, написанный той же моделью, который потом запускается без неё.

9. Word и редактура

Word-документы ИИ обрабатывает как любой длинный текст. Сценарии:

  • Редактура. Убрать канцелярит, исправить опечатки, сделать текст короче на 30% без потери смысла, привести к единому тону.
  • Форматирование. Расставить заголовки разных уровней, выделить тезисы, превратить простыни в маркированные списки.
  • Генерация шаблонов. Должностные инструкции, регламенты, политики, презентации по брифу — за минуту, дальше человек дорабатывает.
  • Сравнение версий. «Что изменилось между этими двумя версиями документа и почему это важно».

Встроенные ИИ-помощники в редакторах: Microsoft Copilot в Word (по подписке Microsoft 365), Gemini в Google Docs (часть Workspace), МойОфис AI и Р7-Офис AI в российских аналогах. Они работают без копирования текста в отдельный чат — прямо в документе через боковую панель.

10. Поиск по корпусу документов

У компании накопилось 5000 договоров за десять лет. Найти все договоры с конкретным контрагентом, или с условием «отсрочка платежа более 30 дней», или с упоминанием конкретного объекта — задача семантического поиска.

Схема называется RAG (Retrieval-Augmented Generation): документы разбиваются на куски и превращаются в векторы через embedding-модель, складываются в векторную базу (Pinecone, Weaviate, Qdrant или встроенные решения у Контура и Сбера). Запрос пользователя тоже превращается в вектор, система находит ближайшие по смыслу куски, LLM формулирует ответ со ссылками на источники. На корпусе в десятки тысяч документов работает за секунды.

NotebookLM — упрощённый RAG из коробки: загрузил до 50 источников, спрашиваешь — получаешь ответ с цитатами. Для большего корпуса собирается своя инфраструктура.

Типовой пайплайн обработки документа

Для производственной обработки используется примерно такая последовательность:

  1. Приём — email, чат, форма на сайте, интеграция с 1С или СЭД.
  2. OCR — ABBYY FineReader, Yandex Vision или Tesseract. На выходе текстовый слой плюс координаты блоков.
  3. Структурирование — выделение таблиц, полей, заголовков; часто работает специализированная модель Document Understanding.
  4. Анализ через LLM — Claude, GPT, GigaChat или YandexGPT с промптом под задачу.
  5. Постобработка — валидация (ИНН — 10 или 12 цифр, дата в корректном формате), сверка по справочникам.
  6. Передача дальше — учётная система, согласование, архив, финальная проверка человеком.

Для несложных задач (PDF на 20 страниц, нужен конспект) шаги 2–4 закрывает одна мультимодальная модель. Для тысяч документов в день пайплайн собирается из отдельных компонентов, где каждый шаг можно мониторить и улучшать.

Сравнительная таблица сервисов

СервисЯзыкиФорматыЛимит файла / контекстаЦена152-ФЗ
ChatGPT50+, включая русскийPDF, DOCX, XLSX, CSV, изображениядо 512 МБ файл, 128К контекст$20/мес Plusданные за границей
Claude30+, русский хорошоPDF, DOCX, изображениядо 32 МБ файл, до 1 млн токенов$20/мес Proданные за границей
Gemini40+, русскийGoogle Docs, PDF, изображениядо 2 млн токенов в API$20/мес AI Proданные за границей
GigaChatрусский, английскийPDF, DOCX, TXTдо 128К токенов (MAX)бесплатный тариф естьсерверы в РФ
YandexGPTрусский, английскийтекст, PDF через Yandex Visionдо 32К токеновоплата по токенамсерверы в РФ
NotebookLMрусский поддерживаетсяPDF, тексты, ссылки, Google Docsдо 500К слов на источник, 50 источниковбесплатноданные у Google
ChatPDFмногоязычныйPDFдо 120 страниц free, больше Plus$19.99/мес Plusданные за границей
MashaGPTрусскийPDF, DOCX, XLSX, изображения200К токенов Pro990–19990 ₽/месагрегатор
Cotype (МТС)русскийтекст, APIконтекст среднийпо запросусерверы в РФ
SaluteSpeech / SberDocuments AIрусскийсканы, PDF, аудиопо тарифукорпоративныйсерверы в РФ
ABBYY FineReader200+сканы → Word, Excel, PDFпо объёму страницлицензиялокально / в РФ
Doczillaрусскийдоговорыв рамках сервисаподпискасерверы в РФ

Цифры цен и лимитов меняются — перед выбором стоит сверить с официальным сайтом сервиса.

Российские сервисы для работы с документами

  • Контур.Документы — работа с входящими счетами, актами, накладными: распознавание, извлечение полей, сверка с контрагентами в Контур.Фокусе, передача в учёт. Для малого и среднего бизнеса.
  • 1С:Распознавание первичных документов (1С:РПД) — модуль для 1С, распознаёт сканы счетов, актов, накладных и автоматически создаёт документы в учётной системе.
  • СберДокументы AI — корпоративный сервис: распознавание, извлечение полей, классификация, генерация ответов. Данные не покидают РФ.
  • ABBYY — российский разработчик OCR: настольный FineReader и корпоративная Vantage для потоковой обработки.
  • Yandex Vision OCR — облачный API как компонент собственного пайплайна, оплата по символам.
  • GigaChat и YandexGPT — российские LLM для шага анализа: без VPN, держат русский язык, серверы в РФ. Подробнее — на странице Сравнение российских нейросетей.
  • Cotype от МТС, SaluteJazz от Сбера, MashaGPT — российские LLM-агрегаторы и сервисы с поддержкой работы с файлами и поддержкой 152-ФЗ.
  • Yandex Browser AI — встроенный в браузер ассистент, читает страницы и PDF, делает выжимку, переводит, отвечает на вопросы по содержимому. Удобен для быстрого «что в этом документе» без загрузки в отдельный сервис.
  • Doczilla, AIXPERT, Гарант AI — специализированные ИИ-юристы под российское право, анализируют договоры, делают сравнение версий, ссылаются на статьи и судебную практику.

Локальные модели для конфиденциальных документов

Когда документы содержат гостайну, банковскую тайну, врачебную тайну или коммерчески критичную информацию, передавать их во внешний облачный сервис нельзя. Решение — запустить модель на собственном железе:

  • LM Studio и Ollama — десктоп-приложения, в которых одной кнопкой запускается Llama 3, Qwen, Mistral или другая открытая модель. PDF подаётся локально, наружу ничего не уходит. На ноутбуке с 16 ГБ RAM запускается модель на 7–13 миллиардов параметров — хватает для конспектов и Q&A по документу.
  • vLLM, Text Generation Inference — серверные движки для разворачивания на корпоративном железе с GPU. Используются для пайплайнов на потоке.
  • GigaChat on-premise и YandexGPT on-premise — российские LLM, поставляемые для установки в контур заказчика. Подходят для госсектора и регулируемых отраслей.

Для OCR в закрытом контуре — Tesseract, PaddleOCR, ABBYY FineReader Server. Для эмбеддингов и RAG — open-source модели (bge, multilingual-e5) и open-source векторные базы (Qdrant, Weaviate).

Безопасность и 152-ФЗ при работе с документами клиентов

Документы клиентов почти всегда содержат персональные данные: ФИО, паспортные данные, телефоны, адреса, ИНН физических лиц. Обработка попадает под Федеральный закон №152-ФЗ.

Зарубежные сервисы (ChatGPT, Claude, Gemini, NotebookLM, ChatPDF) обрабатывают данные на иностранных серверах. Передача персональных данных граждан РФ за границу без согласия субъекта и без выполнения требований 152-ФЗ — нарушение. Для документов клиентов зарубежные модели по умолчанию не подходят.

Российские сервисы (GigaChat, YandexGPT, Cotype, Контур.Документы, СберДокументы AI, ABBYY) размещают данные на серверах в РФ и могут заключить договор обработки персональных данных с заказчиком. Это базовый сценарий для работы с документами клиентов.

Анонимизация — рабочий способ использовать любые ИИ для документов с персональными данными. Перед загрузкой из текста убираются ФИО, паспортные данные, телефоны, адреса (вручную или через скрипт-маску). Модель работает с обезличенным текстом, результат потом сводится обратно.

Локальные модели — для документов с банковской, врачебной или гостайной данные не передаются никуда: используются модели на собственных серверах (Qwen, Llama, GigaChat on-premise). Подробнее про требования закона — на странице 152-ФЗ и персональные данные.

Письменное согласие субъекта нужно, если без зарубежного сервиса не обойтись — с указанием конкретного оператора и страны.

Что ИИ не заменит при работе с документами

Несмотря на широкие возможности, есть зоны, где модель не закрывает работу:

  • Юридическая ответственность. Подпись под договором ставит человек или компания, ответственность за ошибку несёт тоже человек. Модель может пропустить пункт, и в суде ссылка на «ИИ так сказал» не сработает.
  • Согласования. Подпись руководителя, согласование юриста, утверждение бухгалтером — это процессы внутри организации, которые невозможно автоматизировать одной моделью.
  • Мокрая подпись и нотариус. Многие документы требуют рукописной подписи, печати или нотариального заверения — это физические действия, которые ИИ не выполняет.
  • Решения с неопределённостью. «Подписывать ли этот договор» — это бизнес-решение с учётом отношений, репутации, стратегии. Модель даёт вход для решения, но не принимает его.
  • Документы со сложным макетом и плохими сканами. Многоколоночные таблицы, объединённые ячейки, рукописные пометки, фото под углом и в плохом свете — точность падает, ручная корректура остаётся обязательной.
  • Конфиденциальные документы без права на облако. Без локальной модели или анонимизации — нельзя.

Правильная рамка: ИИ ускоряет рутинную часть в десятки раз, человек принимает решения и несёт ответственность.

Когда нужен полный пайплайн, а когда хватит чата

Хватит чата с моделью, если документов мало (десятки в месяц), результат смотрит человек, задача разовая, персональных данных нет или документ можно обезличить.

Нужен полный пайплайн OCR + структурирование + LLM + постобработка, если документов много (сотни в день), результат уходит в учёт без человека, нужна предсказуемая точность извлечения полей, есть требования по аудиту (каждый шаг логируется) и требования 152-ФЗ (российские компоненты, журналирование).

FAQ

На каком языке работает ИИ с документами? Все ведущие модели понимают русский, английский и десятки других языков. У зарубежных сервисов качество на русском чуть ниже, чем на английском, но для типовых задач разница незаметна. Российские модели (GigaChat, YandexGPT, Cotype) под русский язык настроены лучше всего и держат сложные синтаксические конструкции и терминологию.

Какой максимальный размер PDF можно подать? У ChatPDF — порядка 120 страниц бесплатно, больше на платном тарифе. У ChatGPT и Claude в чате — файлы до 32–512 МБ, но при больших документах модель работает по частям. NotebookLM держит до полумиллиона слов на источник (примерно 1000–1500 страниц). Для очень больших корпусов — RAG-пайплайн или разбиение на части.

Безопасно ли загружать конфиденциальные документы? В публичный сервис — нет. Для коммерческой тайны, персональных данных, врачебной и банковской информации используют российские сервисы с подписанным DPA (договором обработки персональных данных), анонимизацию или локальные модели на своём железе. Условия хранения и использования прописаны в пользовательском соглашении — перед загрузкой стоит читать.

Что лучше — OCR или мультимодальная LLM? Для несложных документов (печатный текст, читаемый скан) мультимодальная LLM справляется одной операцией. Для производственного потока с требованием по точности — отдельный OCR-движок (ABBYY, Yandex Vision) и LLM на этапе анализа: гибридный пайплайн предсказуемее и дешевле на больших объёмах.

Какой OCR самый точный для русских документов? ABBYY FineReader держит лидерство, особенно на сложных макетах (таблицы, многоколоночная вёрстка, рукописный текст). Yandex Vision сопоставим на типовых документах. Tesseract и EasyOCR подходят для простых задач или для прототипа. На разборчивых печатных документах разница между топ-движками минимальна.

Можно ли извлекать данные из паспорта или СНИЛС? Технически — да, ABBYY, Yandex Vision и Контур.Документы это умеют. Юридически это персональные данные специальной категории, обработка требует согласия субъекта и соответствия 152-ФЗ. Зарубежные сервисы для паспортов граждан РФ использовать не нужно.

Сколько стоит обработка одного документа? У облачных OCR (Yandex Vision, ABBYY Cloud) — порядка нескольких копеек за страницу. У LLM-этапа — в зависимости от длины: счёт через GigaChat в копейках, длинный договор через Claude в десятках копеек. Полный пайплайн на тысячи документов в месяц укладывается в несколько тысяч рублей.

Чем NotebookLM отличается от ChatPDF? NotebookLM держит до 50 источников в одном «блокноте», цитирует с указанием конкретного документа, делает аудиоформат «подкаст по корпусу», бесплатен. ChatPDF — одна PDF за сессию, ответы со ссылками на страницы, есть платный тариф. Для одной длинной PDF подходят оба, для исследовательской работы с пачкой источников — NotebookLM удобнее.

Сравнивает ли ИИ Word-документы с показом правок? Для механического сравнения двух версий с показом diff — встроенный режим «Сравнение документов» в Word или Litera, Workshare. ИИ полезен для смыслового сравнения — какие изменения существенны для конкретной стороны.

Можно ли подключить ИИ к 1С для работы с документами? Да. У 1С есть собственный модуль 1С:РПД, плюс интеграции через REST API с GigaChat, YandexGPT и Yandex Vision. Подробнее — на странице Нейросеть для бухгалтера.

Что делать с рукописными документами? Рукописный текст распознаётся хуже печатного. ABBYY FineReader и Yandex Vision дают приемлемое качество на разборчивом почерке, на неразборчивом нужна ручная корректура. Для массовой обработки рукописных архивов — специализированные модели (Transkribus, hand-OCR от ABBYY).

Как ИИ работает с таблицами в PDF? Качественные OCR восстанавливают структуру таблицы — ячейки, строки, объединённые ячейки. LLM дальше работает с таблицей как с данными — суммирует столбцы, ищет аномалии, переводит в Excel. На таблицах со сложным слиянием ячеек качество падает, нужна ручная проверка.

Безопасно ли загружать договоры в ИИ? Договоры с физическими лицами содержат персональные данные — попадают под 152-ФЗ, зарубежные сервисы без согласия субъекта использовать нельзя. Договоры между юридическими лицами без персональных данных можно обрабатывать в любых ИИ; если в договоре коммерческая тайна — российские сервисы с подписанным DPA или локальные модели.

Можно ли запустить нейросеть для документов на своём ноутбуке? Да. LM Studio или Ollama + модель Llama 3 8B, Qwen 2.5 7B или Mistral 7B запустится на ноутбуке с 16 ГБ RAM. Хватает для конспектов и Q&A по документу до 32К токенов. Для более тяжёлых задач (большой контекст, точные ответы) нужен GPU и модели на 30+ миллиардов параметров.

Дальше