arxivcs.AI2026-07-05
Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning
Group-based reinforcement learning (RL) has become an effective paradigm for improving large language model agents on long-horizon interactive tasks. To obtain finer-grained policy updates than trajectory-level optimization, recent work has moved toward step-level group-based RL,…