Перебудова релевантності рекомендацій, починаючи з рівня даних
Британський рітейлер одягу середнього сегмента (проєкт 2024 року, приблизно 520 тис. активних користувачів на місяць, каталог із ~2 млн SKU) мав рекомендаційний двигун, що помилявся не через ранжувальник, а тому що поведінка клієнтів зберігалася у семи роз'єднаних системах без спільного ключа. Шість тижнів роботи з даними: розпізнавання ідентичності за детерміністично-ймовірнісною драбиною, чистий потік подій, єдиний 360-градусний профіль, і лише після цього перенавчили модель ранжування. Двоетапний пошук (Qdrant ANN серед 2 млн товарів → перерангувальник LightGBM на понад 80 контекстних ознаках) утримує p95 на рівні 34 мс при понад 10 млн прогнозів на день. Клікабельність зросла з 1,2% до 4,8%; дохід із сесії +28%.
Архітектор на розборі проєкту: «Проблему з ML було видно одразу. Справжньою проблемою були дані: розпізнавання ідентичності є тією роботою, яку ніхто не фотографує».
4×
Релевантність рекомендацій
+28%
Дохід із сесії
10M+
Прогнозів на день
Виклик
Рекомендаційний двигун показував товари з категорій, які користувачі ніколи не переглядали. Внутрішня аналітика фіксувала клікабельність від пошуку до покупки на рівні 1,2% проти галузевого орієнтира 4–6%. Дві попередні спроби впровадити ML зупинилися, так і не дійшовши до продакшну.
Наш Аудит готовності до ШІ виявив справжню проблему: поведінкові дані користувачів існували в 7 окремих системах, платформа e-commerce, CRM, застосунок лояльності, email-кампанії, тікети підтримки, дані повернень і застарілий каталог. Жодна з них не мала спільного ідентифікатора користувача; «анонімні» сесії становили близько 63% усього трафіку і щоразу непомітно трактувалися як різні користувачі.
Наш підхід
Шість тижнів роботи з даними передували навчанню будь-якої моделі. Ми об'єднали граф ідентичності користувача (спершу детерміністичне зіставлення за email/телефоном, потім ймовірнісне зіставлення за пристроєм, IP і поведінковим набором ознак), побудували чистий потік подій і створили 360-градусні поведінкові профілі.
Болючий момент: перша версія рекомендаційної архітектури використовувала єдиний прохід щільного пошуку. Вона досягала цільової точності на відкладеній вибірці, але затримка p95 становила 180 мс, утричі більше за контрактну межу. Ми розділили процес на двоетапний пошук і ранжування: швидкий ANN звужує ~2 млн товарів до 200 кандидатів, а ранжувальник LightGBM переоцінює ці 200 за повним набором контекстних ознак. Це утримало p95 нижче 50 мс.
Перевірка концепції підтвердила підхід на 3 товарних категоріях, перш ніж масштабувати на весь каталог.
Результат
Клікабельність рекомендацій: 4,8% (проти 1,2% раніше). Дохід із сесії: +28%. Система обробляє понад 10 млн прогнозів на день із затримкою p95 34 мс. Уніфікований граф ідентичності користувача став активом усієї компанії, яким користуються команди email-маркетингу та CRM: пайплайн даних пережив сам проєкт рекомендацій.
Чого ми навчились
01
ШІ залежить від даних. Якщо дані неправильні, ваш ШІ помилятиметься впевнено.
02
Розпізнавання ідентичності є непомітною інженерною роботою, яка відкриває всі можливості персоналізації.
03
Двоетапний пошук і ранжування вирішує компроміс між затримкою і точністю в масштабі; лише щільний пошук цього не вирішує.
Залучені етапи
Аудит готовності до ШІ
Discovery & Blueprint
Перевірка концепції
Продакшн-розробка
Загальна тривалість
7 місяців загалом
Передані артефакти
PRD
Блюпринт архітектури даних
WBS
Дизайн графа ідентичності
SOW
Комерційна пропозиція
Почніть із дзвінка з оцінки доцільності
2 години, безкоштовно. Чесно скажемо, чи має сенс ШІ саме для вашого випадку.