ReliableTableQA: нейросеть научилась проверять надёжность ответов из таблиц с помощью всего 200 примеров

ReliableTableQA: нейросеть научилась проверять надёжность ответов из таблиц с помощью всего 200 примеров

Исследователи из неопределённой группы (arXiv:2607.20537) разработали фреймворк ReliableTableQA, который позволяет нейросети (LLM) определять не просто, можно ли ответить на запрос к таблице, а является ли сам computed answer статистически осмысленным. В реальной аналитике синтаксически корректный SQL-запрос может вернуть значение, основанное на слишком малой выборке, с чрезмерно широким доверительным интервалом или с искажениями, что ведёт к ложным уверенным ответам — этот сбой авторы количественно оценили как Unreliable Confident Answer Rate (UCAR).

В рамках работы создана десятиуровневая таксономия ненадёжности (R1–R10), охватывающая такие риски, как агрегаты по малым выборкам, множественная проверка гипотез и несоответствие хвостов распределения. Далее разработан конвейер генерации данных на основе контекстно-свободной грамматики по публичным схемам розничной торговли, который создал 50 000 размеченных примеров. Эти примеры использованы для supervised fine-tuning (SFT) с разделением по схемам и reinforcement learning (GRPO).

Ключевой результат: для высококачественной разметки надёжности требуется относительно мало контролируемых данных. Всего 200 примеров SFT поднимают F-меру выявления ненадёжности (reliability-flag F1) с 0,61 до 0,98, а коэффициент успешного разбора (parse rate) — с 0,52 до 1,00. При этом UCAR снижается до нуля. Модель также хорошо обобщается на невидимую ранее розничную сеть H&M (Rel-F1 0,997).

Неожиданным оказалось место метода GRPO (из семейства reinforcement learning), который часто считается необходимым для тонкой настройки. Сравнение показало, что GRPO даёт заметный прирост только в условиях недостаточного SFT: при 100 примерах точность совпадения набора флагов увеличивается на 0,06–0,16 как на исходных, так и на новых данных. Однако после того, как SFT достигает адекватного объёма (200+ примеров), GRPO не добавляет измеримого выигрыша — нулевой результат подтверждён на сложных составных флагах, строгой метрике точного совпадения и на внешнем домене.

Авторы подчёркивают, что их работа переосмысливает задачу аннотации надёжности как проблему эффективности данных. Они также чётко разграничивают ситуации, когда reinforcement fine-tuning оправдан, а когда нет. Это может повлиять на подходы к обучению LLM для аналитических систем, позволяя экономить ресурсы на разметке и вычислительных мощностях.

Статья опубликована в разделе arXiv cs.LG и доступна под номером 2607.20537. Результаты открывают путь к более надёжным системам вопросно-ответного анализа таблиц в бизнес-аналитике.