ИИ-агенты не прошли проверку на физическую интуицию: бенчмарк StatMechBench-v0

Научная группа опубликовала на arXiv препринт, в котором изучается, могут ли AI-агенты на основе больших языковых моделей выполнять структурные открытия в теоретической физике. В центре внимания — умение распознавать, когда новая задача может быть преобразована в известную модель, важный навык для физика-теоретика.

Для проверки этого навыка авторы создали бенчмарк StatMechBench-v0. Он включает шесть задач типа Изинга, охватывающих методы трансфер-матрицы, беспорядок, снимаемый калибровкой, и плоские/пфаффиановы структуры. Задачи требуют от агента преобразовать сырую статистическую сумму в вычислимо удобное представление.

В эксперименте использовался простой агент с циклом «предложение-проверка-исправление». Его прогоняли на нескольких LLM и с разными формулировками задач. Оказалось, что численная обратная связь часто помогает агенту исправить код и получить правильную статистическую сумму.

Однако, несмотря на успешные числовые проверки, агенты нередко неверно определяли лежащий в основе класс разрешимости или занижали вычислительную сложность. Это означает, что текущие LLM-агенты могут «проскакивать» тесты, не обладая настоящим пониманием структуры задачи.

Авторы подчёркивают, что для надёжного использования AI в физике нужна система верификации, выходящая за рамки численного совпадения. Предлагается включать символьные проверки и инварианты структуры, которые могут подтвердить корректность найденного отображения.

Исследование даёт раннюю оценку возможностей AI-агентов в области структурных открытий и намечает направления для дальнейших разработок. По мнению авторов, это шаг к созданию инструментов, способных помогать физикам в открытии новых связей между моделями.