Back to feed
arXiv cs.LG
arXiv cs.LG
7/20/2026
AI Trading: Evaluating Large Language Models for Technical Market Analysis

AI Trading: Evaluating Large Language Models for Technical Market Analysis

Short summary

This paper systematically evaluates five LLMs—GPT-4 Turbo, Claude 3 Opus, Gemini 1.5 Pro, Llama 3 70B, and FinGPT—on technical market analysis tasks including candlestick recognition, signal generation, backtesting, and financial report comprehension. GPT-4 Turbo achieves the highest annualized return and Sharpe ratio among general-purpose models, while FinGPT shows competitive risk-adjusted performance through domain-specific fine-tuning. All models exhibit persistent failure modes including numerical hallucination, context-window limits, and poor performance in sideways markets.

  • GPT-4 Turbo and FinGPT outperform S&P 500 benchmark in simulated backtesting
  • All evaluated LLMs suffer from numerical hallucination, context-window limits, and sideways-market failures
  • Robust AI trading deployment requires task decomposition, rigorous backtesting, and domain-aware fine-tuning

Generated with AI, which can make mistakes.

Is this a good recommendation for you?

Comments

Failed to load comments. Please try again.

Explore more