Скорочення помилок обробки документів на 93% у масштабі підприємства
Іпотечний сервісер рівня Tier-2 у США (старт у III кварталі 2024) щомісяця обробляв близько 47 000 заявок на підтвердження доходу й активів, відхиляючи 11–13% із них, а середній час від завантаження до готового пакета для кредитного відділу становив 2,7 дня. Два попередні підрядники вже провалили цю задачу. На третьому тижні Перевірки концепції ми виявили клас документів «скан зі скана», які зламали б модель, і додали перед класифікацією шар OCR, що враховує розмітку сторінки. Результат: 0,8% переробок, обробка за чотири години, приблизно втричі більший обсяг при тому самому штаті бек-офісу.
Керівник відділу операцій клієнта, наприкінці третього тижня Перевірки концепції: «Досить вибачатися, скажіть чесно, які 8% вхідних даних ви не можете обробити. Ми спрямуємо їх вручну».
93%
Скорочення помилок
4hr
Проти 2,7 дня раніше
3×
Оброблюваний обсяг
Виклик
Команда бек-офісу клієнта вручну обробляла близько 47 000 фінансових документів на місяць: заявки на кредит, підтвердження активів і доходу, комплаєнс-форми, договори. Рівень переробок 11–13% спричиняв провали під час аудиту й ризики регуляторної відповідності. Середній час обробки 2,7 дня блокував кредитні рішення, які конкуренти ухвалювали за години.
Два попередні підрядники вже намагалися впровадити ШІ-рішення. Обидва не пройшли далі прототипу: моделі працювали ізольовано, але не витримували різноманіття документів (12 типів документів, 6 мов, змінне форматування) на рівні продакшн-якості.
Наш підхід
Ми почали з Дзвінка з оцінки доцільності, а далі провели Аудит готовності до ШІ. Аудит показав справжню проблему: не в моделі, а в розмітці даних. Близько 40% тренувальних даних було непослідовно розмічено різними командами анотаторів.
Discovery & Blueprint дав трикомпонентну архітектуру: (1) шар класифікації документів, що спрямовує їх до спеціалізованих екстракторів за типом; (2) чергу валідації з людиною в контурі для складних випадків; (3) систему оцінки впевненості, яка позначає малодостовірні вилучення до того, як вони потраплять у продакшн-пайплайн.
Перевірка концепції тривала 7 тижнів на 3 типах документів. Ключовий поворот стався на третьому тижні: ми виявили, що близько 8% заявок були «сканами зі сканів» (факсові копії факсів), і запланований файн-тюн LayoutLMv3 галюцинував поля саме на них. Ми додали шар OCR, що враховує розмітку сторінки, і окрему лінію ручної обробки для документів нижче порогу якості зображення: рішення архітектора полягало в тому, щоб не намагатися виправити ці 8% моделлю. Ми досягли точності 98,4% на тестовому наборі документів у межах специфікації, перш ніж переходити в продакшн.
Результат
Продакшн-система обробляє всі 12 типів документів чотирма мовами. Рівень помилок: 0,8%. Час обробки: 4 години. Система тепер обробляє приблизно втричі більший обсяг тим самим складом команди, вивільняючи персонал бек-офісу для роботи з винятками та навмисних випадків ручної обробки.
Клієнт володіє повною архітектурою. Усі моделі та пайплайни задокументовані і придатні до передачі.
Чого ми навчились
01
Якість даних майже завжди є першопричиною. Виправляйте дані, перш ніж торкатися моделі.
02
Маршрутизація за типом документа дає кращий результат, ніж одна велика модель, яка намагається впоратися з усім.
03
Коли клас вхідних даних дійсно виходить за межі розподілу, правильна відповідь іноді звучить так: «не намагайтеся вирішити це моделлю», а спроєктуйте ручну лінію обробки.
Залучені етапи
Discovery & Blueprint
Перевірка концепції
Продакшн-розробка
Загальна тривалість
5 місяців загалом
Передані артефакти
PRD
Технічний блюпринт
WBS
Гайд з розмітки даних
SOW
Почніть із дзвінка з оцінки доцільності
2 години, безкоштовно. Чесно скажемо, чи має сенс ШІ саме для вашого випадку.