Учёные: активный учитель повышает эффективность обучения ИИ на основе предпочтений

Исследователи представили статью, в которой пересматривают подход к обучению искусственного интеллекта на основе предпочтений. Вместо традиционной схемы, где человек выступает пассивным экспертом, отвечающим на запросы ИИ, авторы предлагают модель активного учителя. Такой учитель знает целевую задачу и сам формирует примеры для обучения.

В работе отмечается, что классический метод сравнительной обратной связи, когда человек выбирает между двумя вариантами поведения, уже стал стандартом для выравнивания действий роботов и агентов с намерениями человека. Однако если учитель лишь реагирует на вопросы обучаемого алгоритма, теряется его ключевое преимущество — знание цели. Учитель, которому известно, к чему нужно привести систему, может построить обучающую выборку эффективнее, чем любая стратегия, основанная на запросах самого ученика. Этот разрыв растет с увеличением размерности признаков награды.

Чтобы использовать это преимущество, необходима точная модель текущих знаний обучаемого. Поэтому авторы переформулировали задачу как проблему взаимодействия человека и автономии. В предложенной схеме обе стороны используют модель друг друга: учитель планирует учебную программу на основе представления о том, что уже знает ученик, а ученик ведет модель модели учителя второго порядка. Такой подход позволяет ученику выдавать структурированные ограничения предпочтений — так называемые утверждения о понимании, которые поддерживают актуальность модели учителя.

В ходе симуляций оказалось, что информированный учитель показывает результаты лучше, чем выбор примеров, управляемый учеником. Если учителя чередуются, их модель ученика постепенно устаревает, и преимущество снижается. Применение утверждений о понимании восстанавливает эффективность. Особенно эффективны утверждения теории сознания второго порядка (ToM-2), которые превосходят усредненные утверждения о убеждениях в тех случаях, когда ошибка учителя о состоянии ученика сосредоточена в конкретном направлении, а не распределена равномерно.

Исследование опубликовано в расширенной версии на arXiv. Авторы подчеркивают, что предложенная рамка может изменить практику обучения роботов и ассистентов, сделав их взаимодействие с людьми более эффективным и менее затратным по времени. В перспективе такие механизмы позволят быстрее адаптировать ИИ к индивидуальным предпочтениям пользователя.