arXiv cs.CL
8/4/2026

SLMs as Multi-Agent Routers: A Progressive SFT and Reinforcement Learning Approach
Short summary
Researchers train a small language model via SFT and reinforcement learning to jointly select specialized retrieval agents and generate tool-call parameters, using a hierarchical reward based on retrieval relevance and topic alignment. The trained SLM achieves NDCG@10 of 0.771 overall, outperforming Amazon Nova Lite (+0.177) and Claude Haiku 4.5 (+0.219) while reducing selection latency by 82.4%. On mismatched queries it reaches 0.918 NDCG@10 versus ~0.5 for intent-only baselines.
- •SLM trained via SFT+RL routes queries to specialized retrieval agents using retrieval-quality signals, not just intent
- •Achieves 0.771 mean NDCG@10, beating Nova Lite and Claude Haiku 4.5 with 82.4% lower latency
- •On agent-query mismatches, reaches 0.918 NDCG@10 vs ~0.5 for intent-only routing
- •Hierarchical reward combines retrieval relevance with query-agent topic alignment
Generated with AI, which can make mistakes.
Is this a good recommendation for you?