ИИ предсказывает отклонение тестовых заданий: точность 75%, но проблемы с предвзятостью
Научная группа опубликовала на arXiv исследование, посвящённое автоматической оценке качества тестовых заданий. Учёные построили модель, которая по тексту задания предсказывает, будет ли оно принято или отклонено после экспертизы. Работа основана на данных крупной программы стандартизированного тестирования.
В датасет вошли 52 759 заданий по английскому языку и математике. Из них 34% были окончательно отклонены от использования. Причины отклонения включали слабые психометрические свойства, проблемы с содержанием, предвзятость и чувствительность, а также непрофильные проблемы.
Для прогнозирования использовались три модели: DeBERTaV3-large на сыром тексте заданий, DeBERTa на критике, сгенерированной Qwen3, и объединённая модель. Лучший результат показала именно гибридная версия: точность 75%, F1-мера 0,64, AUC 0,80, чувствительность 0,64 и специфичность 0,81.
Интересно, что для заданий по математике прогноз оказался заметно точнее, чем по языку: F1 0,73 против 0,51, AUC 0,86 против 0,72. Авторы связывают это с более формальной структурой математических заданий.
Также исследователи проверили влияние порога принятия решения. При снижении порога с 0,5 до 0,25 чувствительность для языковых и математических заданий выросла до 0,88 и 0,91 соответственно, но специфичность упала до 0,31 и 0,56. Такой подход может быть полезен в контексте автоматической генерации заданий, когда создание нового элемента дешевле, чем его экспертная оценка.
Включение критики от LLM в модель улучшило предсказания для большинства причин отклонения. Кроме того, модель присваивала более высокую вероятность отклонения более сложным заданиям.
Слабым местом осталась оценка заданий, связанных с предвзятостью, чувствительностью, справедливостью и доступностью, особенно для языковых предметов. Авторы подчёркивают, что полностью заменить ручную проверку такими системами пока нельзя, и для заданий с потенциальными проблемами равенства нужен человеческий контроль.
В целом исследование показывает, что текстовая автоматическая оценка возможна в ряде областей и может сократить нагрузку на экспертов и этапы пилотного тестирования. Однако выводы требуют осторожности — модель не улавливает тонкие случаи, связанные с инклюзивностью.







