arXiv cs.LG
7/9/2026

Deep Reinforcement Learning for Reliability Based Bi-Objective Portfolio Optimization
Short summary
Researchers propose MORP-DRL, a deep reinforcement learning framework for multi-objective reliability-based portfolio optimization that jointly optimizes expected return and downside risk using variance, CVaR, and EVaR. The approach models heavy-tailed returns via GARCH(1,1), Extreme Value Theory, and t-copula structures, using a PPO-based strategy benchmarked against NSGA-II across pre-COVID, COVID, and post-COVID market regimes. Results show competitive risk-return performance with reduced downside risk during market stress and scalability to high-dimensional portfolios.
- •MORP-DRL uses PPO to jointly optimize return and downside risk with variance, CVaR, and EVaR measures
- •Asset returns modeled via GARCH(1,1), Extreme Value Theory, and t-copula with quasi-Monte Carlo scenario generation
- •Benchmarked against NSGA-II across ten global equity indices in three market regimes, showing reduced downside risk during stress periods
Generated with AI, which can make mistakes.
Is this a good recommendation for you?