Рейтинги LLM оказались зависимы от настроек теста: разброс оценок достигает 58 пунктов
В свежем препринте на arXiv представлено исследование, в котором оценивается, насколько результаты лидербордов больших языковых моделей зависят от так называемого harness — окружения, в котором модель проходит тест. Авторы утверждают, что нейтрального способа проверки не существует.
В ходе эксперимента 12 открытых instruction-tuned моделей из четырёх семейств отвечали на одни и те же 3679 вопросов из бенчмарков ARC, HellaSwag, MMLU и TruthfulQA. Для каждого вопроса использовалось 26 одинаково обоснованных конфигураций: менялся порядок вариантов, формулировка промпта и способ чтения ответа — из сгенерированного текста или из вероятностей вариантов.
Оценка каждой модели превращалась не в точку, а в диапазон. Например, gemma4-31b показывала от 31 до 89 процента правильных ответов в зависимости только от конфигурации. Это означает, что выбор окружения может изменить результат сильнее, чем многие различия между моделями.
Авторы ввели понятие «сетка хрупкости» (fragility grid). Анализ показал: на вопросах, которые две соседние модели решают стабильно, пары практически не различаются. При этом на нестабильных, чувствительных к конфигурации вопросах сосредоточено в среднем 95,7 процента разрыва между парами моделей.
Четыре из двенадцати моделей могли занять первое место хотя бы в одной из конфигураций. То есть окружение самостоятельно выбирало победителя, а не только уточняло порядок мест. Авторы подчёркивают: решающей осью оказался не порядок вариантов, а способ подсчёта ответов.
Отдельно исследователи выяснили, что свойство вопросов, которое обычно максимизируют при сжатии бенчмарков, коррелирует с хрупкостью на уровне 0,28. Это значит, что сокращение тестов скорее сохраняет нестабильные вопросы, чем удаляет их.
Авторы опубликовали данные по каждому вопросу и скрипт анализа, с помощью которого все цифры можно воспроизвести за секунды на обычном CPU. Они предлагают использовать «сетку хрупкости» как проверку перед публикацией очередного рейтинга.




