Сравнение LLM для технического анализа рынка: GPT-4 Turbo и FinGPT лидируют
Ученые представили результаты сравнительного исследования пяти крупных языковых моделей (LLM) для технического анализа финансовых рынков. В работе оценивались GPT-4 Turbo, Claude 3 Opus, Gemini 1.5 Pro, Llama 3 70B и доменно-специализированная модель FinGPT. Эксперименты включали распознавание свечных паттернов, генерацию торговых сигналов (BUY/SELL/HOLD), бэктестинг и понимание финансовых отчетов.
Для оценки качества использовались метрики: коэффициент Шарпа, максимальная просадка, коэффициент Сортино, информационный коэффициент, F1-мера и BLEU. Согласно данным симулированного бэктестинга, GPT-4 Turbo показал наивысшую годовую доходность и коэффициент Шарпа среди универсальных моделей, а FinGPT продемонстрировал конкурентоспособную риск-скорректированную доходность благодаря тонкой настройке на специфические данные.
Обе модели превзошли пассивный бенчмарк S&P 500 в условиях тестов. При этом исследователи выявили типичные сбои: числовые галлюцинации, ограничения контекстного окна и нестабильные результаты на боковых рынках. Авторы пришли к выводу, что LLM обладают потенциалом для AI-трейдинга, но для надежного внедрения необходимы декомпозиция задач и тщательные протоколы бэктестинга.
Работа опубликована на arXiv (ID: 2607.15414) и представляет систематический подход к оценке моделей. Исследование подчеркивает важность доменной адаптации: универсальные модели могут уступать специализированным в финансовых задачах, особенно в управлении рисками.
Эксперты отметили, что полученные результаты полезны для разработчиков торговых систем, но предостерегли от прямого применения без дополнительной валидации. Также подчеркивается необходимость учета режимов рынка и защиты от ложных сигналов.



