Трансформеры научились выбирать правильную модель с точностью до 0.01 бита
Группа исследователей представила метод «байесовских аэродинамических труб» для оценки способности трансформеров к байесовскому выбору модели. В статье на arXiv показано, что небольшая модель с 2.8 миллиона параметров способна почти идеально воспроизводить апостериорное распределение по классам гипотез.
Ученые использовали инволюции — функции, для которых f(f(x))=x — как чистый реляционный тест. Трансформер достиг согласия с байесовским оптимумом всего в 0.01 бита энтропии, работая как с целочисленными токенами, так и с непрозрачными символами, значение которых менялось каждый эпизод.
Эксперименты включали сравнение невложенных классов: инволюции против 3-циклов. Средняя абсолютная ошибка апостериорного класса оказалась ниже 0.001, что подтверждает подлинный выбор модели, не основанный на простоте или вложенности.
Однако исследователи выявили резкое условие перцептивного доступа: если для распознавания требуются арифметические операции (сложение по модулю или умножение), модель успешно работает с целыми числами, но полностью проваливается с непрозрачными символами. Этот разрыв сохраняется при масштабировании в 112 раз — от 2.8 млн до 316 млн параметров.
Контрольный эксперимент со стационарным переименованием непрозрачных токенов показал успех, что указывает на необходимость устойчивой семантики для компиляции цепей. Диагностика подзаголовков локализовала проблему в композиции инверсии заголовков с арифметикой, а не в самом парсинге заголовков.
Дополнительно авторы проверили современные большие языковые модели на тех же задачах: они демонстрируют качественное байесовское поведение, но с большим калибровочным разрывом (примерно в 55 раз), хотя это измерение через lossy-зонды является направленным, а не точным.
Работа открывает путь к пониманию механизмов индуктивного вывода в трансформерах и может помочь в создании более интерпретируемых и эффективных моделей для задач выбора модели.


