Автогенерація 10 000 практичних запитань з навчальних матеріалів на рівні якості іспиту
Компанія з підготовки до K-12 іспитів (проєкт кінця 2023 року, ~$800 тис. на рік попередніх витрат на ручне складання запитань) уже пробувала обгортати GPT-4 напряму. Предметні експерти відхиляли близько 60% запитань, згенерованих ШІ, як занадто прості або неоднозначні: вони перевіряли запам'ятовування, а не розуміння. Наш пайплайн примушує генерацію з урахуванням таксономії Блума (розбір навчальної програми → побудова промпту з міткою когнітивного рівня → автоматичний фільтр якості, натренований на власних прикладах клієнта «прийнято/відхилено»). Прийняття експертами досягло 91% до кінця Перевірки концепції; вартість прийнятого запитання −74% проти ручного складання. Пайплайн тепер використовують як інструмент для першої чернетки, експерти допрацьовують верхні 9%, замість того щоб писати з нуля.
10K
Запитань на місяць
91%
Прийнято експертами
−74%
Вартість проти ручного складання
Виклик
Клієнт уже пробував GPT-4 напряму. Запитання були граматично правильними, але педагогічно поверхневими: вони перевіряли запам'ятовування, а не розуміння. Предметні експерти відхиляли 60% запитань, згенерованих ШІ, як занадто прості або неоднозначні.
Корінна проблема: LLM без педагогічної структури створюють поверхневі запитання. Модель мала розуміти таксономію Блума й генерувати запитання на правильному когнітивному рівні для кожної навчальної цілі.
Наш підхід
Discovery & Blueprint дав пайплайн генерації з трьома етапами: (1) розбір навчальної програми для вилучення навчальних цілей і рівня за Блумом; (2) структурована побудова промпту, яка примушує LLM генерувати на заданому когнітивному рівні; (3) автоматичний фільтр якості, натренований на власному банку запитань клієнта (прийняті проти відхилених прикладів).
Перевірка концепції пройшла на 3 предметних областях. Рівень прийняття експертами зріс із 40% до 91% до кінця перевірки.
Результат
10 000 запитань генерується щомісяця з рівнем прийняття експертами 91%. Вартість прийнятого запитання скоротилася на 74% проти ручного складання. Пайплайн тепер використовують як інструмент для першої чернетки: предметні експерти допрацьовують верхні 9% відхилених варіантів, замість того щоб писати з нуля.
Чого ми навчились
01
LLM потребують педагогічного каркасу, а не лише промпту: таксономія Блума і є цією структурою.
02
Тренування фільтра якості на власних даних прийняття ефективніше за ручні рубрики.
03
Правильна мета звучить як «експерт у контурі», а не «експерт замінений».
Залучені етапи
Дзвінок з оцінки доцільності
Discovery & Blueprint
Перевірка концепції
Загальна тривалість
3 місяці загалом
Передані артефакти
PRD
Специфікація пайплайну генерації
Гайд з інтеграції таксономії Блума
WBS
Тренувальний набір даних для фільтра якості
Почніть із дзвінка з оцінки доцільності
2 години, безкоштовно. Чесно скажемо, чи має сенс ШІ саме для вашого випадку.