ИИ и автоматизация

Автоматизация обработки документов с помощью ИИ

15 февраля 2026 г.14 мин чтения

Во многих компаниях сотрудники вручную открывают письма, скачивают вложения, переписывают данные из счетов, актов, договоров и заявлений, а затем переносят их в CRM, ERP, бухгалтерскую или внутреннюю систему.

Такая работа кажется простой, но создаёт постоянные издержки:

  • сотрудники тратят часы на повторяющийся ввод;
  • документы попадают не тем ответственным;
  • даты, суммы и реквизиты переносятся с ошибками;
  • информация хранится в нескольких местах;
  • согласования задерживаются;
  • руководитель не видит, где находится документ;
  • проверка зависит от внимательности конкретного человека.

ИИ может сократить значительную часть этой работы. Но автоматизация документов — это не просто загрузить PDF в языковую модель и довериться её ответу.

Рабочая система должна уметь:

  1. получить документ;
  2. определить его тип;
  3. извлечь нужные поля;
  4. проверить данные;
  5. применить бизнес-правила;
  6. передать сомнительные случаи сотруднику;
  7. записать результат в нужную систему;
  8. сохранить историю действий.

Правильный вопрос звучит не так:

«Может ли ИИ прочитать наши документы?»

А так:

«Какую часть процесса можно автоматизировать надёжно, сколько она сейчас стоит и какие решения должны остаться под контролем человека?»

Что такое интеллектуальная обработка документов

Интеллектуальная обработка документов, или Intelligent Document Processing, объединяет несколько технологий:

  • OCR для распознавания печатного и рукописного текста;
  • анализ структуры страницы;
  • классификацию документов;
  • извлечение полей и таблиц;
  • проверку значений;
  • бизнес-правила;
  • интеграции;
  • human-in-the-loop review;
  • аналитику качества.

Современные сервисы обработки документов способны извлекать текст, таблицы, структуру, ключи и значения, а также использовать готовые или обучаемые модели для конкретных типов документов.

Например, система может определить, что загруженный файл является счётом, найти номер документа, дату, поставщика, валюту, итоговую сумму и строки товаров, а затем передать эти данные в бухгалтерскую систему.

Но распознавание текста — только первый этап. Бизнесу нужен не текст из PDF, а корректное действие на его основе.

Чем OCR отличается от полноценной автоматизации

OCR преобразует изображение или скан в машиночитаемый текст.

Он может распознать:

  • слова;
  • строки;
  • абзацы;
  • расположение элементов;
  • печатный текст;
  • в некоторых случаях рукописный текст.

Специализированные платформы также умеют извлекать формы, таблицы, подписи и отдельные запрошенные значения.

Однако обычный OCR сам по себе не знает:

  • какой это документ;
  • какие поля важны;
  • является ли сумма корректной;
  • совпадает ли поставщик со справочником;
  • был ли счёт уже обработан;
  • нужно ли отправить документ на согласование;
  • можно ли автоматически создать платёж;
  • кто отвечает за исключение.

Поэтому полноценная система строится не вокруг одного распознавания, а вокруг всего бизнес-процесса.

Как выглядит процесс обработки документа

1. Получение документа

Документ может поступить через:

  • email;
  • форму на сайте;
  • мобильное приложение;
  • Telegram-бот;
  • облачную папку;
  • сканер;
  • CRM;
  • API партнёра;
  • внутреннюю систему.

На этом этапе важно сохранить исходный файл, источник, дату получения и связь с клиентом, заказом или контрагентом.

Если документы продолжают поступать в личные переписки сотрудников, автоматизация не сможет охватить весь поток.

2. Предварительная обработка

Перед распознаванием система может:

  • разделить многостраничный файл;
  • повернуть изображение;
  • выровнять страницу;
  • улучшить контраст;
  • определить язык;
  • удалить пустые страницы;
  • проверить читаемость;
  • найти повреждённые файлы.

Качество изображения напрямую влияет на результат. Размытая фотография, обрезанный край, тень, мелкий шрифт или сложный фон повышают вероятность ошибки.

3. Классификация

Система определяет тип документа:

  • счёт;
  • акт;
  • договор;
  • накладная;
  • паспорт;
  • резюме;
  • заявление;
  • доверенность;
  • транспортный документ;
  • внутренний отчёт.

Классификация нужна, потому что для разных документов используются разные схемы извлечения и проверки.

Некоторые платформы умеют автоматически разделять один PDF, содержащий несколько документов, а затем классифицировать каждую часть отдельно.

4. Извлечение данных

После определения типа система извлекает нужные значения.

Для счёта это могут быть:

  • номер;
  • дата;
  • поставщик;
  • ИНН;
  • банковские реквизиты;
  • валюта;
  • позиции;
  • количество;
  • цена;
  • налог;
  • итоговая сумма.

Для договора:

  • стороны;
  • предмет;
  • срок;
  • сумма;
  • ответственность;
  • условия расторжения;
  • дата окончания;
  • наличие подписи;
  • связанные приложения.

Готовые модели подходят для распространённых форматов. Для внутренних или отраслевых документов можно создать собственную схему извлечения и обучить модель на примерах компании.

5. Нормализация

Извлечённые данные необходимо привести к единому формату.

Например:

  • 01.07.2026, 1 July 2026 и 2026-07-01 превращаются в одну дату;
  • 12 500,00, 12,500.00 и 12500 — в одно числовое значение;
  • разные варианты названия компании сопоставляются с одной записью контрагента;
  • валюты приводятся к стандартным кодам;
  • адреса и номера телефонов очищаются.

Без нормализации система может считать одинаковые значения разными.

6. Проверка и бизнес-правила

Извлечение поля ещё не означает, что поле корректно.

Система может проверить:

  • совпадает ли сумма строк с итоговой суммой;
  • существует ли контрагент;
  • соответствует ли договор заказу;
  • не истёк ли срок;
  • не является ли документ дубликатом;
  • заполнены ли обязательные реквизиты;
  • не превышен ли лимит;
  • совпадает ли валюта;
  • есть ли подпись;
  • разрешён ли поставщик.

На этом этапе обычные правила часто важнее генеративного AI.

Если сумма должна точно совпадать с заказом, её нужно проверять детерминированным сравнением, а не просить модель «оценить, всё ли правильно».

7. Оценка уверенности

Модели обработки документов обычно возвращают confidence score для распознанных элементов.

Но универсального порога вроде «выше 90% можно доверять» не существует.

Порог должен зависеть от:

  • конкретного поля;
  • цены ошибки;
  • качества документов;
  • фактических результатов тестирования.

Например:

  • комментарий можно принять с более низкой уверенностью;
  • банковский счёт, сумма и идентификатор клиента требуют строгой проверки;
  • изменение платёжных реквизитов может всегда требовать ручного подтверждения.

AWS прямо рекомендует использовать confidence scores и настраивать чувствительность процесса в зависимости от сценария.

8. Проверка человеком

Сотруднику должны передаваться не все документы, а исключения:

  • поле не распознано;
  • значения противоречат друг другу;
  • документ плохого качества;
  • найден новый формат;
  • сумма превышает лимит;
  • не найден контрагент;
  • система подозревает дубликат;
  • операция имеет высокий риск.

Интерфейс проверки должен показывать:

  • оригинал документа;
  • извлечённое значение;
  • расположение значения на странице;
  • причину проверки;
  • предлагаемый вариант;
  • историю изменений.

Цель — превратить часы ручного ввода в минуты осмысленной проверки, а не полностью исключить человека из процесса.

9. Передача результата

После проверки данные могут автоматически попасть в:

  • CRM;
  • ERP;
  • бухгалтерию;
  • систему документооборота;
  • хранилище;
  • таблицу;
  • очередь согласования;
  • внутренний кабинет;
  • систему аналитики.

Затем система может:

  • создать запись;
  • прикрепить оригинал;
  • назначить ответственного;
  • запустить согласование;
  • отправить уведомление;
  • обновить статус;
  • поставить задачу;
  • вернуть результат отправителю.

Где автоматизация наиболее полезна

Счета и первичные документы

Система может извлекать реквизиты, суммы и строки, проверять поставщика, искать дубликаты и создавать черновик операции.

Microsoft, например, предоставляет специализированную модель для извлечения полей и товарных строк из счетов, включая сканы, фотографии и цифровые PDF.

Финальное проведение платежа при этом не должно автоматически зависеть только от результата модели.

Акты и накладные

Можно проверять:

  • номер заказа;
  • стороны;
  • даты;
  • количество;
  • стоимость;
  • наличие подписи;
  • расхождение с договором или заказом.

Договоры

AI может помочь:

  • классифицировать договор;
  • извлечь ключевые условия;
  • найти даты и суммы;
  • определить отсутствующие разделы;
  • сравнить документ с шаблоном;
  • поставить напоминание об окончании срока;
  • направить документ нужному юристу.

Но юридическую оценку спорного условия нельзя полностью делегировать модели.

Логистика

Автоматизация применима к:

  • транспортным накладным;
  • упаковочным листам;
  • таможенным документам;
  • подтверждениям доставки;
  • актам приёма;
  • маршрутным документам.

Она особенно полезна, когда одни и те же сведения приходится переносить между несколькими системами.

HR и кадровые процессы

Система может обрабатывать:

  • резюме;
  • заявления;
  • анкеты;
  • удостоверения;
  • договоры;
  • табели;
  • справки;
  • заявки на отпуск.

Для решений, влияющих на найм или положение сотрудника, необходимы отдельные правила контроля, объяснимости и доступа.

Заявки клиентов

Из свободного текста и приложений можно извлечь:

  • контактные данные;
  • тип запроса;
  • продукт;
  • сумму;
  • регион;
  • срок;
  • приложенные документы;
  • недостающую информацию.

После этого заявка классифицируется и направляется ответственному отделу.

Архивы

OCR и классификация позволяют превратить старый архив в searchable-базу.

Но перед масштабной обработкой нужно определить:

  • какие документы действительно нужны;
  • какие данные следует извлекать;
  • сколько лет хранить оригиналы;
  • кому разрешён доступ;
  • требуется ли юридически значимый оригинал.

Когда автоматизация окупается

Проект наиболее обоснован, если:

  • документов достаточно много;
  • они повторяются по типу и структуре;
  • сотрудники вводят одни и те же поля;
  • ручная обработка задерживает следующий этап;
  • ошибки создают финансовые или операционные потери;
  • данные уже должны попадать в цифровую систему;
  • можно определить правила проверки;
  • существует владелец процесса;
  • качество можно измерить.

Особенно важно считать не количество страниц, а количество ручных действий.

Сто коротких однотипных счетов могут быть лучшим кандидатом для автоматизации, чем тысяча редких и совершенно разных договоров.

Когда проект преждевременен

Документов мало

Если сотрудник обрабатывает несколько документов в неделю, стоимость разработки и поддержки может превысить экономию.

Каждый документ уникален

Чем меньше повторяемости, тем сложнее определить стабильную схему и правила проверки.

AI может помогать сотруднику искать и суммировать информацию, но полная автоматизация будет ограниченной.

Процесс постоянно меняется

Автоматизировать процесс, который ещё не определён, опасно.

Сначала нужно зафиксировать:

  • этапы;
  • ответственных;
  • обязательные данные;
  • исключения;
  • итоговый результат.

Исходные документы слишком плохие

Если большая часть файлов является нечитаемыми фотографиями, сначала нужно улучшить канал получения документов и требования к качеству.

Нет системы назначения результата

Извлечение данных бессмысленно, если после него сотрудник всё равно копирует результат вручную в несколько программ.

Нет ответственного за исключения

Любая система будет ошибаться или встречать новые форматы.

Должно быть понятно:

  • кто проверяет сомнительный документ;
  • за какое время;
  • как исправление попадает обратно;
  • кто обновляет правила.

Как рассчитать экономический эффект

Стоимость текущего процесса

Посчитайте:

  • документов в месяц;
  • среднее время обработки;
  • стоимость часа сотрудника;
  • время повторной проверки;
  • количество исправлений;
  • стоимость задержки;
  • стоимость ошибок;
  • количество возвратов;
  • время согласования.

Стоимость новой системы

В расчёт входят:

  • анализ процесса;
  • подготовка выборки документов;
  • разработка схем;
  • интеграции;
  • интерфейс проверки;
  • тестирование;
  • инфраструктура;
  • стоимость обработки страниц;
  • хранение;
  • мониторинг;
  • поддержка;
  • обновление моделей и правил.

Упрощённая формула

Месячный эффект = экономия рабочего времени + предотвращённые потери + дополнительная пропускная способность − ежемесячные расходы системы.

Срок окупаемости = первоначальные затраты / месячный чистый эффект.

Пример

Допустим:

  • компания обрабатывает 6 000 документов в месяц;
  • ручная обработка занимает в среднем 3 минуты;
  • полная стоимость часа сотрудника — 9 долларов;
  • система автоматически обрабатывает 70% документов;
  • остальные требуют проверки в среднем по одной минуте;
  • ежемесячная инфраструктура и поддержка стоят 1 200 долларов;
  • внедрение стоит 24 000 долларов.

Текущая нагрузка:

6 000 × 3 минуты = 18 000 минут, или 300 часов.

После автоматизации:

  • 4 200 документов проходят автоматически;
  • 1 800 документов требуют по одной минуте проверки;
  • ручная нагрузка составляет около 30 часов.

Потенциальная экономия времени:

270 часов × 9 долларов = 2 430 долларов в месяц.

После ежемесячных расходов чистая экономия составит примерно 1 230 долларов без учёта предотвращённых ошибок и ускорения процесса.

При таких вводных простой срок окупаемости превышает год. Если же ошибки и задержки обходятся дорого, реальный эффект может быть выше.

Именно поэтому обещание «окупится за несколько месяцев» без исходных данных не имеет смысла.

Какие показатели отслеживать

Straight-through processing rate

Доля документов, прошедших процесс без ручного вмешательства.

Этот показатель нельзя повышать ценой скрытых ошибок.

Field accuracy

Точность отдельных полей.

Необходимо отдельно измерять:

  • даты;
  • суммы;
  • реквизиты;
  • идентификаторы;
  • строки таблиц;
  • свободный текст.

Средняя точность по документу может скрыть плохой результат по критичному полю.

Exception rate

Доля документов, направленных на проверку.

Важно понимать не только число исключений, но и причины:

  • плохое изображение;
  • новый шаблон;
  • отсутствующее поле;
  • конфликт данных;
  • ошибка интеграции.

Время обработки

Измеряйте полный цикл от получения документа до записи в целевой системе, а не только скорость OCR.

Стоимость одного документа

Включайте:

  • API;
  • инфраструктуру;
  • ручную проверку;
  • поддержку;
  • исправление ошибок.

Доля исправлений после автоматического принятия

Если сотрудники позже постоянно исправляют уже обработанные документы, straight-through rate создаёт ложное ощущение успеха.

Безопасность и контроль данных

Документы могут содержать:

  • персональные данные;
  • финансовую информацию;
  • договорные условия;
  • коммерческие секреты;
  • удостоверения личности;
  • банковские реквизиты.

Поэтому до выбора платформы нужно определить:

  • где хранятся файлы;
  • в каком регионе обрабатываются данные;
  • передаются ли они внешней модели;
  • используются ли они для обучения;
  • как шифруются;
  • кто имеет доступ;
  • как ведётся аудит;
  • когда удаляются оригиналы;
  • как закрываются доступы сотрудников и подрядчиков.

Для финансовых, медицинских и других чувствительных документов официальная документация платформ также рекомендует учитывать региональные и отраслевые требования.

Если используются генеративные модели, нужно отдельно учитывать риск недостоверного результата, конфиденциальности и информационной безопасности на всём жизненном цикле системы.

Готовый сервис или индивидуальная система

Готовый сервис подходит, если

  • используются распространённые документы;
  • достаточно стандартного извлечения;
  • интеграции простые;
  • объём пока небольшой;
  • нужно быстро проверить гипотезу;
  • допустим интерфейс поставщика.

Индивидуальная система оправдана, если

  • процесс критичен для бизнеса;
  • документов несколько типов;
  • нужны сложные проверки;
  • требуется интеграция с несколькими внутренними системами;
  • необходим собственный интерфейс review;
  • действуют особые правила доступа;
  • требуется полный audit trail;
  • автоматизация становится частью основного продукта.

Часто оптимальна гибридная архитектура: готовый OCR или document AI используется как инфраструктурный компонент, а бизнес-правила, проверки, review и интеграции разрабатываются под компанию.

Как внедрять систему поэтапно

1. Выберите один тип документа

Не начинайте сразу со всех договоров, счетов, заявлений и архивов.

Лучший первый кандидат:

  • часто встречается;
  • имеет понятную структуру;
  • содержит повторяющиеся поля;
  • требует много ручного труда;
  • имеет измеримый результат.

2. Соберите репрезентативную выборку

Нужны не только идеальные документы.

Включите:

  • разные поставщики;
  • сканы;
  • фотографии;
  • цифровые PDF;
  • плохое качество;
  • несколько языков;
  • длинные таблицы;
  • отсутствующие поля;
  • ошибочные документы.

3. Зафиксируйте эталон

Для тестовой выборки нужно вручную определить правильные значения.

Без ground truth невозможно объективно измерить качество.

4. Разделите поля по риску

Например:

  • низкий риск — комментарий;
  • средний — дата;
  • высокий — сумма, счёт, идентификатор и реквизиты.

Для каждой группы устанавливаются собственные правила автоматического принятия.

5. Запустите пилот

Пилот должен проверять весь процесс:

  • получение;
  • распознавание;
  • извлечение;
  • проверку;
  • review;
  • интеграцию;
  • журналирование.

Демонстрация на десяти идеальных PDF не подтверждает готовность системы.

6. Работайте в shadow mode

На первом этапе система может обрабатывать реальные документы параллельно с сотрудниками, не выполняя необратимых действий.

Это позволяет сравнить результаты и безопасно настроить пороги.

7. Автоматизируйте только подтверждённые случаи

Сначала автоматически пропускаются только простые и надёжные документы.

Остальные продолжают поступать сотруднику.

Границы расширяются после накопления данных, а не на основании обещаний поставщика.

Что спросить у подрядчика

Перед началом проекта уточните:

  1. Какой конкретный документ автоматизируется первым?
  2. Какие поля необходимо извлекать?
  3. Какие поля считаются критичными?
  4. Как будет измеряться точность?
  5. Какая выборка используется для тестирования?
  6. Что происходит при низкой уверенности?
  7. Как устроена ручная проверка?
  8. Как определяется дубликат?
  9. Какие бизнес-правила применяются?
  10. Куда передаются результаты?
  11. Как защищаются документы и персональные данные?
  12. Где находятся журналы операций?
  13. Какие расходы возникают на каждой странице?
  14. Кто обновляет модель и правила?
  15. Что произойдёт при недоступности AI-сервиса?

Итог

ИИ может существенно сократить ручную обработку документов, но ценность создаёт не само распознавание текста.

Рабочая автоматизация объединяет:

  • качественный канал получения документов;
  • классификацию;
  • извлечение данных;
  • детерминированные проверки;
  • confidence thresholds;
  • human review;
  • интеграции;
  • аудит;
  • регулярное измерение качества.

Полностью исключать человека нужно не как самоцель. Цель — автоматически проводить понятные и низкорисковые случаи, а сотрудникам оставлять исключения и решения, где действительно требуется ответственность.

Оцените потенциал автоматизации документов

Опишите типы документов, месячный объём, текущий процесс и системы, куда сотрудники переносят данные.

Команда Prodexa поможет:

  • выбрать лучший первый сценарий;
  • оценить текущие затраты;
  • определить поля и правила проверки;
  • спроектировать human review и интеграции;
  • запустить пилот до масштабной разработки.
Обсудим проект

Нужен совет по вашему проекту?

Расскажите о задаче — ответим в течение дня.

Написать нам