Новый метод обучения нейросетей устранил слепое пятно при проверке чисел и единиц
Исследователи из международной группы ученых обнаружили неожиданную слабость нейросетей при проверке научных фактов. Оказалось, что даже современные модели могут путать эквивалентные физические величины, например, температуру в градусах Цельсия и Кельвина. Эта ошибка способна незаметно исказить смысл научного утверждения.
В новом исследовании, опубликованном на arXiv, авторы создали систему для выявления подобных ошибок. Они разработали пятиклассовую таксономию ошибок, связанных с числами и единицами измерения, и собрали набор данных из 1500 примеров, взятых из научных статей PMC и arXiv. Разметку выполняли два независимых LLM-аннотатора с последующим арбитражем.
На этом наборе данных исследователи обучили модель ModernBERT, которая достигла макро-F1 = 0.899 — значительно выше, чем у готовых систем проверки фактов. Однако специальные тесты выявили структурное слепое пятно: на канонически эквивалентных записях одной и той же физической величины (например, 95°C и 368.15 K) точность модели падала до 36.5%.
Чтобы решить эту проблему, авторы предложили метод «символического дополнения» (Symbolic Augmentation). Суть подхода в том, чтобы на этапе обучения генерировать дополнительные данные с сохранением правильных меток, используя обратный запуск модулей символьного верификатора. Это позволило модели научиться распознавать эквивалентные записи.
После применения метода устойчивость к канонической эквивалентности выросла до 98.2%, а качество на исходных данных даже немного улучшилось (макро-F1 с 0.899 до 0.902). При этом обученная модель не требовала дополнительных вычислительных затрат при инференсе и показала хорошую переносимость на внешний бенчмарк SciFact-Open (бинарный макро-F1 вырос с 0.791 до 0.828).
Авторы также проверили альтернативные подходы: добавление символьных признаков в качестве дополнительных входов для энкодера не дало улучшений, а использование символьных «серебряных» меток привело к снижению качества из-за шума в учителе. Таким образом, именно дополнение данных на этапе обучения оказалось оптимальной точкой интеграции символьных и обучаемых компонентов.


