Какие поля нужны и откуда они берутся?
Начните с того, что сузьте задачу: какие типы документов обрабатывает процесс и какие поля из них действительно нужны. С такого ограничения начинается любой проект ИИ-обработки документов. Велик соблазн извлекать всё подряд, но каждое лишнее поле требует собственных проверок и добавляет работы при сверке. Для каждого поля, которое вы оставляете, опишите ожидаемый формат, обязательно ли оно и где в документе его обычно искать. Начните с полей, без которых процесс не работает, а остальные добавляйте позже, когда первые будут обрабатываться надёжно.
Предусмотрите в процессе отдельное состояние для отсутствующих или неоднозначных сведений. Если в документе нет даты или указаны две разные итоговые суммы, система должна прямо об этом сообщить, а не подставлять значение, которое просто выглядит правдоподобно. Пустое поле с пометкой «нет данных» легко обработать, а уверенно подставленное неверное значение может дойти до самой бухгалтерии.
Подготовьте обезличенные примеры тех макетов документов, которые вы получаете. Включите и неудобные: сканы разного качества, многостраничные документы и исправленные версии, если такие встречаются в вашей работе. Система, проверенная только на аккуратных электронных файлах, споткнётся на первом же сфотографированном счёте.
Почему извлечь данные ещё не значит их проверить?
Значение может быть правильно прочитано из документа и всё равно не подходить для вашей системы. Номер счёта распознан точно, но такой счёт уже внесён; итоговая сумма совпадает с напечатанной, но не совпадает с суммой строк. Извлечение отвечает на вопрос «что написано в документе?», а проверка — на вопрос «можно ли это использовать?». Именно на этом разрыве чаще всего и возникают дорогие ошибки.
Где только возможно, проверяйте номера, суммы, даты и обязательные связи между полями чёткими правилами: есть ли такой поставщик в системе, сходятся ли строки с итогом, попадает ли дата в разумный диапазон. Сомнительные случаи отправляйте сотруднику и показывайте ему нужный фрагмент исходного документа рядом с извлечённым значением, чтобы не приходилось искать его по всему файлу. Чем быстрее сотрудник видит источник, тем быстрее и надёжнее проверка.
Прежде чем что-либо обновится в рабочей системе, решите, как будут распознаваться повторные и исправленные документы. А там, где есть ясное правило — арифметика или сверка со списком поставщиков, — оставьте этот шаг строго алгоритмическим. Нет смысла просить модель прикинуть то, что обычный код посчитает точно и одинаково каждый раз.
Как сделать обновления прослеживаемыми и исправимыми?
Для каждого документа сохраняйте обработанную версию, извлечённые значения-кандидаты, результат проверки, кто их утвердил и что в итоге записано в систему. Когда через месяц возникнет вопрос, эта запись покажет, откуда взялось значение и на каком шаге оно изменилось. Эта же запись выручает при проверках со стороны бухгалтерии или аудиторов: видно не только итог, но и путь к нему.
До запуска проверьте сценарии сбоев. Что произойдёт, если ИИ-сервис не ответит вовремя? А если принимающая система получит один и тот же запрос дважды? Решите, кто исправляет неверное поле, если оно уже внесено, и как возобновить передачу данных, прервавшуюся на полпути, так, чтобы не появились дубли и не потерялись документы. Проверьте и обратную ситуацию: что происходит с документом, который сотрудник отклонил, и где это видно.
Разбирая результаты, оценивайте не только скорость извлечения, но и качество по каждому полю и общие затраты на обработку. Быстрое извлечение, после которого выстраивается длинная очередь на ручную проверку, может обойтись дороже, чем ручной процесс, который оно заменило. Важна та цифра, которая показывает, сколько времени и усилий нужно, чтобы в системе появилась правильная запись. Та же мерка подходит для любой ИИ-автоматизации процессов — от писем до обращений в поддержку.
Чек-лист: проверка документов
- Определите поля, их форматы и то, как помечаются отсутствующие или неоднозначные данные.
- Показывайте рядом с каждым значением фрагмент исходного документа и используйте чёткие правила везде, где это возможно.
- Проверьте повторные и исправленные документы, а также обновления, которые прерываются на полпути.
- Измеряйте точность по каждому полю и общие затраты на проверку, а не только скорость извлечения.
Пример: данные счёта на пути в бухгалтерию
Из входящего счёта система извлекает в черновик номер счёта, поставщика и итоговую сумму. Правила проверяют, что все обязательные поля заполнены и что арифметика сходится, а сотрудник видит рядом с каждым значением соответствующий фрагмент исходного документа.
В бухгалтерию передаются только утверждённые данные. Если тот же счёт придёт ещё раз, он будет привязан к уже существующей записи, и второй счёт в системе не появится. Так данные в учёте остаются чистыми, даже если поставщик отправил документ повторно.


