Новый метод сокращает затраты на ИИ-проверку эссе на 78%

Крупные языковые модели успешно справляются с автоматической проверкой эссе, однако стандартный подход предполагает фиксированный выбор промптов. Из-за этого системы не могут адаптироваться к меняющимся условиям и тратят лишние ресурсы. Исследователи предложили новый способ решения этой задачи.
Разработанный фреймворк использует контроллер на основе многорукого бандита, где каждый тип промпта рассматривается как отдельное «плечо». Это позволяет системе в реальном времени подбирать наиболее эффективную стратегию запроса для оценки конкретного эссе.
Эксперименты проводились на эссе IELTS Writing Task 2. Авторы реализовали четыре варианта оценивания: многошаговый и одношаговый анализ, с калибровочными примерами и без них. Лучшую точность показал многошаговый подход с примерами.
Главный результат — новая схема достигает точности, сопоставимой с исчерпывающим перебором, но при этом сокращает количество вызовов LLM на 78,4%. Помимо этого, исследователи отслеживали использование токенов и задержку, построив первые кривые зависимости надёжности от стоимости для проверки эссе.
По словам авторов, это первое применение онлайн-управления для адаптивного выбора промптов в автоматической оценке эссе. Задача выбора промпта превращается из офлайн-оптимизации гиперпараметров в эффективную онлайн-задачу обучения.
Разработка может быть полезна образовательным платформам, которые вынуждены искать баланс между операционными расходами и валидностью оценивания. Снижение числа запросов к LLM делает массовую проверку эссе заметно дешевле.







