Точність 99,7% в узагальненні клінічних записів для регуляторної відповідності
SaaS для клінічної документації у США (проєкт 2023–2024, розгорнуто в I кварталі 2024), чий попередній постачальник зупинився на рівні ~96% попри місяці ітерацій. Поріг регулятора становив 99,5%, а розрив між 96% і 99,5%+ є архітектурним, а не питанням тюнінгу: на такому рівні питання полягає в тому, у яких випадках модель невпевнена, а не в тому, чи модель хороша. Наша багатоетапна система валідації пропускає кожне узагальнення через перевірки фактичної відповідності (проти вихідного запису), медичних сутностей (проти зрізу SNOMED), повноти й оцінки впевненості; нижні ~0,3% оцінок впевненості спрямовуються до черги перевірки людиною. 99,7% точності в продакшні за 6 місяців і 1,4 млн узагальнень, ~8,4 тис. на день. Подання регулятору прийняли з першого разу.
Розбір від архітектора: «При 96% проблема в моделі. При 99,5%+ модель у порядку, проблема у вашій квантифікації невпевненості».
99.7%
Точність у продакшні
8K+
Записів на день
100%
Покриття аудиторським слідом
Виклик
Узагальнення клінічних записів із точністю 99,5%+ є справді складною задачею. Розрив між 96% і 99,5% не є питанням тюнінгу моделі: на такому рівні він є архітектурним. Потрібно знати, у яких випадках модель невпевнена, і обробляти їх інакше.
Наш підхід
Наша архітектура запровадила багатоетапну систему валідації. Кожне узагальнення проходить через чотири послідовні перевірки: фактичну відповідність (зіставлення на рівні токенів із вихідним записом), валідацію медичних сутностей (згадані сутності мають існувати у вихідному тексті й розпізнаватися у зрізі SNOMED), повноту (жоден обов'язковий розділ не пропущено) і оцінку впевненості. Випадки з низькою впевненістю спрямовуються до черги перевірки людиною.
Болючий момент: перша версія шлюзу медичних сутностей хибно позначала абревіатури, якими насправді користуються клініцисти («LBP» для болю в попереку, «SOB» для задишки). На четвертому тижні перевірки ми перебудували його на доменно-налаштований NER із каноналізацією, який знає абревіатурні конвенції відповідної спеціальності.
Модель дотренували на ~15 000 анотованих клінічних записах. Ми також анотували самі помилки, як виглядає неправильне узагальнення, що дало шлюзу впевненості достатньо сигналу для виявлення складних випадків.
Результат
99,7% точності в продакшні за 6 місяців на 1,4 млн узагальнень. Черга перевірки людиною обробляє ~0,3% випадків. Повний аудиторський слід для кожного узагальнення. Подання регулятору прийняли з першого разу.
Чого ми навчились
01
На дуже високих порогах точності проблема зміщується в бік квантифікації невпевненості.
02
Добре спроєктований резервний варіант із людиною є тим, що дозволяє пройти шлях від 99% до 99,7%.
03
Анотація помилок доменними експертами настільки ж цінна, як і анотація успішних випадків.
Залучені етапи
Discovery & Blueprint
Перевірка концепції
Продакшн-розробка
Загальна тривалість
6 місяців загалом
Передані артефакти
PRD
Специфікація багатоетапної архітектури
Протокол клінічної валідації
WBS
Дизайн аудиторського сліду
Почніть із дзвінка з оцінки доцільності
2 години, безкоштовно. Чесно скажемо, чи має сенс ШІ саме для вашого випадку.