TeXFix-Bench: новый бенчмарк для ИИ-починки LaTeX, Typst и Markdown

Исследователи разработали TeXFix-Bench — новый бенчмарк для оценки того, насколько хорошо большие языковые модели умеют восстанавливать повреждённые исходные коды документов. Тест охватывает три популярных формата разметки: LaTeX, Typst и Markdown, которые широко используются в научной и технической публицистике.

В основе бенчмарка лежит эмпирическая классификация ошибок. Авторы проанализировали 168 реальных сбоёв компиляции из TeX Stack Exchange, коммитов на GitHub и официальной документации пакетов. Это позволило выделить таксономию из 18 категорий ошибок и создать инструмент DocMut с 48 операторами мутации, учитывающими структуру документа.

Сравнение на трёх моделях показало, что сбои, сгенерированные DocMut, восстанавливать на 5,6–9,2 процентных пункта сложнее, чем при использовании простых шаблонных мутаций на тех же исходных данных. Отдельное тестирование на 88 реальных ошибках пользователей дало успешный результат в 67% случаев.

Для массовой оценки авторы собрали набор из 10 437 примеров на основе 743 открытых документов. Семь языковых моделей протестировали в режиме zero-shot с фиксированным протоколом, совершив 48 651 попытку. Все затраты на инференс составили около 200 долларов США. Полная сбалансированная матрица включала 6 613 примеров для каждой модели.

Ключевой результат: при работе через зафиксированный движок разброс успешной компиляции между моделями достигал 27,5 процентных пункта (от 56,7% до 84,2%). При этом Typst оказался заметно сложнее для всех моделей, чем LaTeX и Markdown.

Самое важное наблюдение касается качества ремонта. Анализ 28 129 успешно скомпилированных результатов показал, что в 13,6–18,5% случаев модель изменяла смысл текста документа. При этом ранг по восстановлению содержимого не совпадает с рангом по компиляции: модель с самым низким процентом сборки лучше всего сохраняла контент среди своих успешных результатов. Авторы подчёркивают, что одна лишь успешная компиляция завышает качество починки.

Бенчмарк, инструмент DocMut и все артефакты кампании выпущены в открытый доступ для дальнейших исследований в области автоматического ремонта документов.