Центр программных разработок и цифровых сервисов

Центр призван решить проблемы роста числа и уровня сложности цифровых сервисов посредством роботизации и автоматизации операционной деятельности

 

Система распознавания входящего документопотока (OCR + GPT)

О проекте

Система распознавания входящего документопотока — это интеллектуальное решение на основе технологий компьютерного зрения и искусственного интеллекта, предназначенное для автоматического извлечения данных из финансовых и юридических документов.

Решение обрабатывает как цифровые документы с текстовым слоем, так и скан-копии различного качества (PDF), извлекая ключевые данные и передавая их в корпоративные информационные системы.

Контекст

Современные организации сталкиваются с большим объемом входящих документов: счета, акты, УПД, счет-фактуры. Обработка таких документов традиционно требует значительного участия человека, что приводит к:

  • высокой трудоемкости

  • рискам ошибок

  • задержкам в бизнес-процессах

Возникает необходимость в интеллектуальном подходе, объединяющем методы распознавания текста и понимания его структуры, чтобы обеспечить не только извлечение данных, но и возможность их дальнейшей автоматической обработки.

Решение

В основе проекта лежит комплексный подход, объединяющий технологии OCR (оптическое распознавание символов) и GPT-модели (LLM) для семантического анализа

Система обеспечивает:

  • распознавание текстов из PDF и сканов
  • извлечение ключевых реквизитов (контрагенты, суммы, даты)
  • распознавание номенклатуры в табличном виде
  • автоматическое структурирование данных
  • автозаполнение данных в учетных системах
  • обработку документов из различных источников (например, ЭДО)

Дополнительно реализовано автоматическое обновление и обработка документов по расписанию (например, несколько запусков в день)

Применение специального разработанного валидатора позволило получить точность близкую

Особенность решения — комбинация классического computer vision и языковых моделей, что позволяет значительно повысить точность на сложных документах.

Данные

Система работает с различными типами документов:

  • счета на оплату
  • акты
  • универсальные передаточные документы (УПД)
  • счет-фактуры

Источниками данных могут выступать системы электронного документооборота (например, Контур.Диадок), файловые хранилища и внутренние базы данных

Ценность

Внедрение системы дает значимый эффект:

  • ускорение обработки документов
  • снижение влияния человеческого фактора
  • уменьшение рутинной нагрузки на сотрудников
  • повышение качества данных

В результате эксплуатации получена точность распознавания реквизитов — около 98%, точность распознавания номенклатуры — около 97,8%

Интеграция и внедрение

Решение интегрировано в инфраструктуру НИУ ВШЭ и используется финансовой дирекцией университета.

Демонстрация

Команда

Сергеев Антон Валерьевич

Центр программных разработок и цифровых сервисов: Директор центра

Севостьянов Никита Александрович

Отдел разработки программных систем: Аналитик

Сахаров Кирилл Евгеньевич

Отдел разработки программных систем: Программист

Немна Валерия Александровна

Отдел разработки программных систем: Аналитик

Просвирнин Роман Олегович

Отдел прикладного искусственного интеллекта: Стажер-исследователь