LSR-Synth не подтверждает решающую роль языковых моделей в поиске научных законов
Существующие бенчмарки для научного поиска уравнений часто используют известные формулы из открытых источников. Это мешает понять, действительно ли модель открывает закономерности из данных или просто вспоминает ответы из обучающей выборки. Новый набор задач LSR-Synth пытается решить эту проблему, добавляя в известные научные механизмы нестандартные синтетические термины и фильтруя их по критериям новизны, разрешимости и научной правдоподобности.
В новой работе на arXiv авторы сосредоточились на более узком вопросе: позволяют ли такие задачи различать научные предпосылки, заложенные в языковых моделях, и обычный перебор операторов, который не использует семантику задачи. Для этого они создали эталон без обращения к смыслу — фиксированный словарь с публично подтвержденным происхождением.
Затем исследователи провели серию экспериментов: семантическое ослепление, ослабление словаря и точечное исключение целых семейств операторов. Оказалось, что при текущем наборе задач, бюджете поиска и протоколе оценки фиксированный словарь покрывает большинство примеров. Генерация кандидатов языковой моделью лишь изредка добавляет решаемые случаи, а заметный эффект появляется только когда покрытие словаря намеренно нарушают.
Строгая проверка на данных вне исходного распределения снизила абсолютные показатели успеха всех методов, однако соотношение между подходами сохранилось. Это означает, что контроль LSR-Synth против запоминания готовых формул работает, но вклад языковых моделей в решение задач остается ограниченным на текущем срезе.
Авторы подчеркивают, что полученные результаты не опровергают полезность языковых моделей в символьных открытиях в принципе. Вывод более сдержанный: большинство задач LSR-Synth подходят для оценки способности модели компоновать и адаптировать ранее не встречавшиеся выражения, но сами по себе они недостаточны, чтобы выявить вклад предпосылок, выходящих за рамки фиксированного пространства поиска.
Таким образом, работа уточняет границы применимости нового бенчмарка и предлагает методику для более честного сравнения генеративных моделей с классическими алгоритмами символьной регрессии.







