Языковые модели теряют надёжность при 5-6 одновременных инструкциях — новое исследование

Исследователи проанализировали, насколько большие языковые модели способны одновременно выполнять несколько инструкций. Как показала работа, опубликованная на arXiv, надёжность следования требованиям резко снижается уже при пяти-шести условиях.

Авторы разработали бенчмарк Constraint Saturation Evaluation (CSE), который позволяет систематически изменять количество одновременных ограничений — от одного до двенадцати. В рамках тестирования были проверены 15 моделей, 36 типов ограничений и проведено 369 753 проверок. Каждое ограничение оценивалось детерминированным правилами проверки, без участия нейросети-судьи.

Основной результат: вероятность успешного выполнения всех ограничений падает гораздо быстрее, чем средний показатель по отдельным пунктам. Например, модель, которая успешно проходит отдельные ограничения примерно в 41% случаев при k=8, одновременно справляется со всеми восемью лишь в 5,7% случаев.

При этом ограничения деградируют неравномерно. Структурные ограничения, требующие отслеживания логики или формата вывода, теряют в среднем вдвое больше базовой производительности на каждое добавленное условие, чем лексические ограничения, которые проверяют отдельные слова или фразы.

Сбой оборудования в данном случае происходит почти независимо для разных ограничений, что приводит к мультипликативному накоплению ошибок. Остаточная связь в основном возникает из-за общих свойств сгенерированного текста: например, если модель ошибается в количестве предложений, это автоматически нарушает все ограничения, которые опираются на этот параметр.

Практический порог надёжного следования инструкциям находится на уровне пяти-шести одновременных условий. Даже у самой сильной модели вероятность успеха опускается ниже 50% при семи ограничениях, а для двенадцати из пятнадцати моделей этот порог составляет три ограничения или меньше.

Результаты важны для разработки приложений, где модели должны учитывать множество требований одновременно, — от генерации кода до соблюдения политик безопасности. Исследователи отмечают, что понимание механизмов деградации может помочь в создании более устойчивых архитектур.