arXiv cs.LG
7/20/2026

AI Trading: Evaluating Large Language Models for Technical Market Analysis
Short summary
This paper systematically evaluates five LLMs—GPT-4 Turbo, Claude 3 Opus, Gemini 1.5 Pro, Llama 3 70B, and FinGPT—on technical market analysis tasks including candlestick recognition, signal generation, backtesting, and financial report comprehension. GPT-4 Turbo achieves the highest annualized return and Sharpe ratio among general-purpose models, while FinGPT shows competitive risk-adjusted performance through domain-specific fine-tuning. All models exhibit persistent failure modes including numerical hallucination, context-window limits, and poor performance in sideways markets.
- •GPT-4 Turbo and FinGPT outperform S&P 500 benchmark in simulated backtesting
- •All evaluated LLMs suffer from numerical hallucination, context-window limits, and sideways-market failures
- •Robust AI trading deployment requires task decomposition, rigorous backtesting, and domain-aware fine-tuning
Generated with AI, which can make mistakes.
Is this a good recommendation for you?
