Случайная выборка в LLM уступает ансамблю: одно измерение против четырёх

Новое исследование, представленное на arXiv, выявило принципиальное ограничение стохастической выборки в больших языковых моделях (LLM). Учёные провели эксперимент, в котором противопоставили два подхода: 100 запусков одной модели с температурой ?=1 и ансамбль из 24 различных LLM, каждая из которых запускалась один раз при ?=0.
Для анализа данных использовался критерий Марченко–Пастура, отделяющий сигналы от шума. Результаты показали, что в рамках одной модели лишь одно измерение поднимается выше уровня шума. Это верно для пяти семейств моделей и трёх бенчмарков: MMLU, HellaSwag и GSM8K.
В то же время ансамбль из 24 моделей продемонстрировал четыре собственных значения, явно превышающих шумовую границу. Для проверки исследователи использовали нулевую модель Бернулли с подходящей сложностью, которая дала максимум одно такое значение из 500 симуляций.
Авторы делают вывод, что метод self-consistency (самосогласованность), основанный на множественных запусках одной модели, даёт точную оценку неопределённости для отдельных вопросов, но не позволяет выявить взаимосвязи между разными вопросами. Напротив, разнородный ансамбль LLM способен извлекать скрытую структуру, отражающую то, чего модель не знает.
Это открытие имеет практическое значение для задач, где важна не только точность, но и понимание границ знаний модели. Использование одного и того же LLM с разной температурой не даёт такого же уровня разнообразия, как комбинация разных моделей.
Таким образом, исследователи предлагают пересмотреть практику оценки неопределённости в языковых моделях. Вместо того чтобы полагаться на многократные прогоны одной модели, более информативным может быть применение ансамблей различных LLM.







