Skip to content
EdTechАналіз контентуCASE_07

Автогенерація 10 000 практичних запитань з навчальних матеріалів на рівні якості іспиту

Компанія з підготовки до K-12 іспитів (проєкт кінця 2023 року, ~$800 тис. на рік попередніх витрат на ручне складання запитань) уже пробувала обгортати GPT-4 напряму. Предметні експерти відхиляли близько 60% запитань, згенерованих ШІ, як занадто прості або неоднозначні: вони перевіряли запам'ятовування, а не розуміння. Наш пайплайн примушує генерацію з урахуванням таксономії Блума (розбір навчальної програми → побудова промпту з міткою когнітивного рівня → автоматичний фільтр якості, натренований на власних прикладах клієнта «прийнято/відхилено»). Прийняття експертами досягло 91% до кінця Перевірки концепції; вартість прийнятого запитання −74% проти ручного складання. Пайплайн тепер використовують як інструмент для першої чернетки, експерти допрацьовують верхні 9%, замість того щоб писати з нуля.

10K
Запитань на місяць
91%
Прийнято експертами
−74%
Вартість проти ручного складання

Виклик

Клієнт уже пробував GPT-4 напряму. Запитання були граматично правильними, але педагогічно поверхневими: вони перевіряли запам'ятовування, а не розуміння. Предметні експерти відхиляли 60% запитань, згенерованих ШІ, як занадто прості або неоднозначні. Корінна проблема: LLM без педагогічної структури створюють поверхневі запитання. Модель мала розуміти таксономію Блума й генерувати запитання на правильному когнітивному рівні для кожної навчальної цілі.

Наш підхід

Discovery & Blueprint дав пайплайн генерації з трьома етапами: (1) розбір навчальної програми для вилучення навчальних цілей і рівня за Блумом; (2) структурована побудова промпту, яка примушує LLM генерувати на заданому когнітивному рівні; (3) автоматичний фільтр якості, натренований на власному банку запитань клієнта (прийняті проти відхилених прикладів). Перевірка концепції пройшла на 3 предметних областях. Рівень прийняття експертами зріс із 40% до 91% до кінця перевірки.

Результат

10 000 запитань генерується щомісяця з рівнем прийняття експертами 91%. Вартість прийнятого запитання скоротилася на 74% проти ручного складання. Пайплайн тепер використовують як інструмент для першої чернетки: предметні експерти допрацьовують верхні 9% відхилених варіантів, замість того щоб писати з нуля.

Чого ми навчились

01

LLM потребують педагогічного каркасу, а не лише промпту: таксономія Блума і є цією структурою.

02

Тренування фільтра якості на власних даних прийняття ефективніше за ручні рубрики.

03

Правильна мета звучить як «експерт у контурі», а не «експерт замінений».

Залучені етапи
Дзвінок з оцінки доцільності
Discovery & Blueprint
Перевірка концепції
Загальна тривалість
3 місяці загалом
Передані артефакти
PRD
Специфікація пайплайну генерації
Гайд з інтеграції таксономії Блума
WBS
Тренувальний набір даних для фільтра якості
Почніть із дзвінка з оцінки доцільності

2 години, безкоштовно. Чесно скажемо, чи має сенс ШІ саме для вашого випадку.

Забронювати дзвінок