Last released Aug 30, 2026
Training language models to perform agentic multi-hop search through reinforcement learning