KnowSim: как оценить, насколько ИИ-ассистенты подстраиваются под уровень пользователя
Научная работа с описанием KnowSim опубликована в репозитории arXiv. Авторы предлагают оценивать ИИ-ассистентов не по однотипным тестам, а по тому, насколько хорошо они адаптируют объяснения к конкретному пользователю.
Существующие симуляторы пользователей не отражают, как человек постепенно усваивает материал. Из-за этого невозможно достоверно измерить, справляется ли модель с задачей объяснения сложных тем новичку или эксперту.
KnowSim решает эту проблему с помощью графа знаний, где каждая единица информации связана с другими отношением предшествования. Симулятор обновляет состояние этих единиц по правилам, основанным на теориях обучения, и отслеживает прогресс пользователя в диалоге.
Для оценки фреймворк использует три показателя: прирост знаний, калибровку подачи и когнитивную перегрузку. Эти метрики вычисляются непосредственно из траектории состояния знаний.
Исследователи проверили KnowSim на 705 реальных диалогах человека с ИИ в двух предметных областях. Совпадение с оценками людей составило около 73–74% по знаку согласия — это лучше, чем у трёх базовых симуляторов. В тестах на девяти больших языковых моделях выяснилось, что лучшая модель меняется в зависимости от уровня знаний собеседника.
Такой подход позволяет выявлять особенности моделей, которые стандартные тесты не показывают. По мнению авторов, KnowSim может стать полезным инструментом для разработчиков, стремящихся сделать ассистентов эффективнее для разных категорий пользователей.


