Исследование: средние оценки ИИ-моделей скрывают слабые сигналы и устаревают

На arXiv опубликована свежая научная работа, авторы которой предлагают пересмотреть подход к оценке больших языковых моделей. Исследователи утверждают, что привычное усреднение автоматических метрик, оценок LLM-судьи и результатов бенчмарков может серьезно завышать реальное качество системы.

По словам авторов, при агрегации разнокачественных сигналов уверенность в итоговой оценке становится выше, чем заслуживает самый ненадежный из них. Это явление названо инфляцией доверия (trust inflation). Оно возникает, когда сильные результаты на одной категории тестов компенсируют провалы на другой.

Вместо простого среднего арифметического авторы предлагают рассматривать оценку как эпистемическое утверждение — знание, которое имеет ограниченный срок действия и область применения. Они выделяют три ключевых свойства: формальность (человеческая оценка весомее автоматической метрики), область действия (результат теста справедлив только для проверяемого распределения данных) и окно валидности (со временем результаты устаревают из-за загрязнения данных и сдвига распределений).

В качестве более надежного метода предлагается использовать агрегацию по слабому звену — когда итоговая оценка определяется самым низким, а не средним показателем. Этот подход опирается на несколько направлений: анализ цепочек рассуждений, поссибилистическую логику и алгебраическую теорию. Слабое звено выступает консервативной оценкой, которая не позволяет скрыть слабости модели за сильными сторонами.

Авторы также предлагают, чтобы каждая оценка сопровождалась явными метаданными: уровнем формальности, описанием области применения и датой истечения срока годности результата. Это сделало бы статус любой оценки прозрачным для пользователей и исследователей.

Чтобы проиллюстрировать проблему, исследователи провели анализ публичного лидерборда HELM. Они сравнили 54 передовые модели на десяти сценариях тестирования. Оказалось, что топ-5 моделей, ранжированных по среднему баллу, полностью не совпадают с топ-5, построенным по принципу слабого звена. Это означает, что выбор модели в зависимости от метода оценки может кардинально измениться.

Работа поднимает важный вопрос о том, как следует интерпретировать результаты бенчмарков и насколько им можно доверять при выборе модели для реальных задач. Авторы настаивают: оценка — это не вечная истина, а устаревающее знание, которое требует постоянной проверки и обновления.