Побудова приватної бази знань для бібліотеки з 40 000 регуляторних документів
Фінансовий регулятор національного рівня (проєкт 2024 року) з бібліотекою приблизно на 40 000 документів: законодавство, методичні рекомендації, рішення щодо примусового виконання, консультаційні документи, що охоплюють 20 років і кілька юрисдикцій. Аналітики витрачали 3+ години на один запит лише щоб знайти релевантні фрагменти. Наш гібридний пошук (щільний семантичний через локально розгорнуту багатомовну модель E5 і розріджений BM25 для точності регуляторних цитувань) у поєднанні з чанкінгом, що зберігає структуру та не порушує зв'язки розділів, підрозділів і перехресних посилань. Локально розгорнута LLM синтезує знайдені фрагменти із джерельними цитуваннями. 94% точності відповідей на бенчмарку з 500 запитань, оціненому senior-аналітиками; середній час дослідження скоротився з 3 годин до 8 хвилин. Кожна відповідь простежується до конкретного документа, розділу й сторінки. Вся інфраструктура працює всередині периметра регулятора.
94%
Точність відповідей
3hr→8min
Середній час дослідження
0
Документів виходить за периметр
Виклик
Регуляторна бібліотека містила 40 000 документів: законодавство, методичні рекомендації, рішення щодо примусового виконання, консультаційні документи, що охоплюють 20 років і кілька юрисдикцій. Пошук за ключовими словами давав забагато результатів. Аналітики витрачали 3+ години на один регуляторний дослідницький запит лише щоб знайти релевантні фрагменти.
Наш підхід
Ми побудували систему RAG (генерація, доповнена пошуком) поверх бібліотеки документів. Архітектура мала три ключові компоненти: (1) пайплайн чанкінгу й ембединга документів, що зберігає регуляторну структуру (розділ, підрозділ, перехресні посилання); (2) шар гібридного пошуку, що поєднує щільний семантичний пошук із розрідженим BM25 для точності регуляторних цитувань; (3) локально розгорнуту LLM, яка синтезує знайдені фрагменти із джерельними цитуваннями.
Усі компоненти працюють на внутрішній інфраструктурі організації: жодні дані не виходять за периметр.
Результат
94% точності відповідей на бенчмарку з 500 репрезентативних дослідницьких запитань, оціненому senior-аналітиками. Середній час дослідження скоротився з 3 годин до 8 хвилин. Система обробляє понад 1 200 запитів на день. Шар цитувань означає, що кожна відповідь простежується до конкретного документа, розділу й сторінки.
Чого ми навчились
01
Гібридний пошук (щільний і розріджений) працює краще за будь-який з них окремо для пошуку регуляторних документів.
02
Збереження структури документа під час чанкінгу настільки ж важливе, як і сама модель ембедингів.
03
Цитування не є опційними для інтелектуальної праці: вони і є всім сенсом.
Залучені етапи
Discovery & Blueprint
Перевірка концепції
Продакшн-розробка
Загальна тривалість
4 місяці загалом
Передані артефакти
PRD
Блюпринт архітектури RAG
Специфікація пайплайну обробки документів
WBS
Інструкція для ІТ
Почніть із дзвінка з оцінки доцільності
2 години, безкоштовно. Чесно скажемо, чи має сенс ШІ саме для вашого випадку.