Back to feed
arXiv cs.CL
arXiv cs.CL
8/4/2026
SLMs as Multi-Agent Routers: A Progressive SFT and Reinforcement Learning Approach

SLMs as Multi-Agent Routers: A Progressive SFT and Reinforcement Learning Approach

Short summary

Researchers train a small language model via SFT and reinforcement learning to jointly select specialized retrieval agents and generate tool-call parameters, using a hierarchical reward based on retrieval relevance and topic alignment. The trained SLM achieves NDCG@10 of 0.771 overall, outperforming Amazon Nova Lite (+0.177) and Claude Haiku 4.5 (+0.219) while reducing selection latency by 82.4%. On mismatched queries it reaches 0.918 NDCG@10 versus ~0.5 for intent-only baselines.

  • SLM trained via SFT+RL routes queries to specialized retrieval agents using retrieval-quality signals, not just intent
  • Achieves 0.771 mean NDCG@10, beating Nova Lite and Claude Haiku 4.5 with 82.4% lower latency
  • On agent-query mismatches, reaches 0.918 NDCG@10 vs ~0.5 for intent-only routing
  • Hierarchical reward combines retrieval relevance with query-agent topic alignment

Generated with AI, which can make mistakes.

Is this a good recommendation for you?

Comments

Failed to load comments. Please try again.

Explore more