Ученые предложили метод оценки доверия к ансамблям LLM с учетом неопределенности

Ансамбли больших языковых моделей (LLM) все чаще используются для повышения надежности за счет комбинирования предсказаний нескольких моделей. Однако существующие методы агрегации обычно предполагают, что все модели одинаково надежны, игнорируя различия в качестве их неопределенности.
Как отмечается в новой статье на arXiv (ID: 2607.20529), такое допущение плохо подходит для гетерогенных LLM, у которых надежность и способность существенно различаются. Наивная агрегация становится уязвимой к ненадежным или вредоносным экспертам.
Авторы работы формулируют мульти-LLM агрегацию как задачу оценки доверия с учетом неопределенности. Они адаптируют структурированное экспертное суждение из теории принятия решений, используя контекстно-зависимые калибровочные вопросы для оценки надежности эксперта на основе качества его вероятностных предсказаний.
В частности, применяется логарифмическое взвешивание в стиле Кука (Cooke-style log weighting), которое штрафует самоуверенные неверные предсказания и отдает предпочтение хорошо откалиброванным экспертам.
Метод был протестирован на наборах данных MMLU и MMLU-Pro в условиях однородных, гетерогенных и загрязненных экспертных панелей. Результаты показали, что, хотя в однородных условиях все методы агрегации работают похоже, при гетерогенности и загрязнении взвешивание Кука становится критически важным.
Новый подход достигает превосходного баланса точности и надежности и остается устойчивым при введении ненадежных экспертов. Исследователи подчеркивают, что многомодельная агрегация требует не просто комбинирования предсказаний, а калибровки доверия в условиях неопределенности.







