Новый метод ИИ объясняет человеческие предпочтения на естественном языке

Ученые из команды, представившей препринт на arXiv, предложили метод «weights to words», решающий проблему непрозрачности алгоритмов, которые анализируют человеческие предпочтения. Традиционные модели, обучающиеся на данных о выборе, часто не могут объяснить, какие именно факторы повлияли на решение. Новый подход автоматически выделяет ключевые аспекты предпочтений и формулирует их на понятном языке.

Метод работает с набором данных о выборах и строит коллекцию интерпретируемых «размерностей» предпочтений, каждая из которых описывается словами и связана с вектором в пространстве модели. Это позволяет не только понять логику алгоритма, но и вносить корректировки: пользователь может изменить описание предпочтения, и модель пересчитает прогнозы.

Эффективность «weights to words» продемонстрирована на четырех разнородных областях: моральные дилеммы, выбор фильмов, вин и оценка ответов языковых моделей. В предварительно зарегистрированных экспериментах с участием людей (450 человек для моральных дилемм и 449 для фильмов) метод показал улучшение точности предсказаний на новых данных, а также возможность повысить качество за счет редактирования пользователями.

По словам авторов, подход решает проблему как неоднозначности (under-determination), так и непрозрачности (opacity) моделей. Он концентрирует внимание на небольшом наборе значимых факторов и выводит их в виде текста, с которым легко работать. Это открывает путь к более доверительным системам искусственного интеллекта, где пользователь может оспорить или скорректировать решение алгоритма.

Разработка имеет потенциал для применения в рекомендательных системах, персонализированном контенте, этических ИИ-ассистентах и других областях, где важно понимать и контролировать предпочтения. Исследование опубликовано в открытом доступе на arXiv, что позволяет другим ученым и разработчикам протестировать и доработать метод.