ИИ-агентам в инвестициях нужны проверенные навыки: новый бенчмарк FinSkillBench

Международная группа исследователей опубликовала на arXiv новый бенчмарк FinSkillBench, предназначенный для оценки возможностей языковых моделей в управлении инвестициями. В отличие от традиционных тестов на генерацию текста, этот набор проверяет способность агентов выполнять конкретные финансовые задачи: от построения портфеля до фундаментального анализа.

FinSkillBench охватывает три ключевые области: построение портфеля, управление рисками и фундаментальный анализ. Всего в бенчмарке 12 подзадач и 2603 игровых эпизода. Каждый эпизод включает данные на конкретный момент времени, скрытые эталонные ответы и автоматическую проверку результатов.

Авторы сравнили три режима работы агентов: без дополнительных навыков, с кураторскими наборами процедур и исполняемых компонентов, а также с самогенерируемыми навыками, когда агент сам пишет и использует собственные процедуры. В тестах участвовали девять моделей. Результаты показали, что кураторские навыки стабильно улучшают метрики: средний балл вырос с 0,366 до 0,528. Наибольший прирост зафиксирован в построении портфеля и управлении рисками.

Самогенерируемые навыки, напротив, почти не дали улучшений, несмотря на более высокие вычислительные затраты. Это указывает на то, что простой автономный поиск процедур не гарантирует качества в такой сложной области, как инвестиции.

Чтобы убедиться в достоверности выводов, авторы провели отдельную оценку с использованием другой агентной платформы — Hermes Agent, на восьми моделях и 5280 эпизодах. Направление результатов совпало во всех трех доменах, хотя величина эффекта варьировалась в зависимости от подзадачи и среды запуска.

Главный вывод исследования: в задачах управления инвестициями наличие надежных процедурных навыков может быть не менее важным, чем выбор самой модели. Наивное самостоятельное создание навыков часто неэффективно, поэтому разработка качественных экспертных инструкций остается приоритетом для практического применения ИИ в финансах.

Авторы открыли доступ к самому бенчмарку, инструментам оценки, кураторским наборам навыков и полным траекториям выполнения задач, чтобы другие исследователи могли продолжить работу в этом направлении.