Разработан MCF-CVA: новый подход к согласованию ИИ с человеческими ценностями

На arXiv опубликована работа, в которой представлен новый фреймворк MCF-CVA для согласования больших языковых моделей с человеческими ценностями. Авторы предлагают многослойную комбинаторную схему, которая, по их словам, позволяет лучше отражать контекстуальные ценности и этический плюрализм.
Существующие подходы, такие как RLHF и CAI, используют единый reward-сигнал и одного агента. Это ограничивает их способность адаптироваться к разнообразным моральным контекстам и учитывать многогранность человеческих ценностей. Новая работа делает шаг в сторону многоагентного взаимодействия.
В основе MCF-CVA лежит несколько моральных агентов, каждый из которых настраивается на определённую ценность. Их выходы комбинируются с помощью скоринговых и ранговых агрегаций, включая средние и взвешенные варианты. Затем комбинированные модели сводятся к исходному числу агентов, и процесс повторяется послойно.
Для этого используется алгоритм расширения и сокращения (EAR), работающий в двух пространствах: евклидовом пространстве оценок и ранговом пространстве Кемени. Такой подход позволяет задействовать когнитивное разнообразие между агентами и снижать конфликты и избыточность.
Эмпирические тесты показали, что MCF-CVA превосходит однопользовательские базовые модели, одноуровневые многоагентные результаты и предыдущие методы агрегации. Авторы утверждают, что фреймворк обеспечивает более точное соответствие ответов модели контекстуальным человеческим предпочтениям.
Развитие подобных методов важно для повышения доверия к системам искусственного интеллекта, особенно при их применении в чувствительных областях, где требуется учитывать разнообразие этических норм.






