FinProBench: новый бенчмарк для оценки финансовых ИИ-агентов по стандартам профессионалов

Группа исследователей опубликовала в архиве arXiv описание нового бенчмарка FinProBench, предназначенного для оценки финансовых ИИ-агентов. Ключевая особенность разработки — использование рубрик (критериев оценки), основанных на реальных профессиональных результатах, а не на синтетических промптах или ответах моделей.

Авторы отмечают, что существующие методы построения рубрик обычно опираются на тексты заданий или выходные данные нейросетей, что упускает неявные стандарты, которые видны только в практических работах специалистов. Для решения этой проблемы предложена методология Role-Grounded Rubric Construction (RGRC), состоящая из четырёх этапов: сбор профессиональных результатов, извлечение компетенций, синтез рубрик и их валидация.

В рамках исследования учёные классифицировали 57 профессий финансовой отрасли по жанру создаваемых документов. Из них 30 были отнесены к традиционным ролям с обширной базой знаний в моделях, а 27 — к узкоспециализированным. Сравнение показало, что для традиционных ролей подход, основанный только на промптах, почти не уступает RGRC (89,2% против 90,7%), однако для специализированных ролей разрыв огромный: 78,0% против 99,1%.

FinProBench построен на основе 1723 тщательно отобранных профессиональных результатов, охватывающих 57 профессий, 8 финансовых суб-отраслей и 161 тип документов. Для первичной оценки выпущен набор из 20 полных задач, охватывающих 20 ролей в 7 суб-отраслях.

При тестировании с гетерогенными LLM-судьями и рубриками на уровне ролей человеческие результаты заняли первое место в среднем (73,7 балла из 100), тогда как ИИ-системы получили 70,3, 70,2 и 69,6 балла. При этом все четыре системы показали пересекающиеся 95% доверительные интервалы и взаимодополняющие сильные стороны.

Отдельно авторы подсчитали, что повторное использование рубрик на уровне ролей снижает оценку трудозатрат на создание одной задачи в 6,7 раза по сравнению с написанием рубрик с нуля. Это делает подход практичным для масштабирования оценки финансовых ИИ-агентов.

Разработка FinProBench и методологии RGRC открывает новые возможности для более точной и объективной оценки ИИ-систем в финансовой сфере, особенно в областях, где требуются глубокие профессиональные знания и специализированные навыки.