arXiv.org
GrandCode: Achieving Grandmaster Level in Competitive Programming via Agentic Reinforcement Learning
GrandCode is a multi-agent reinforcement learning (RL) system for competitive programming, introduced by the DeepReinforce Team. It orchestrates modules for hypothesis proposal, solution generation, summarization, and test-case generation, jointly optimized via post-training and online test-time RL. A key innovation is Agentic GRPO, which combines…
DeepReinforce Team, Xiaoya Li, Guoyin Wang, Songqiao Su, et al.- Published
- Apr 2026
- Upvotes
- 639
- Citations
- 3