الباحثون

Yinfeng Huang

المنشورات 1

نسخة أولية وصول مفتوح

ArenaFlow: From Trajectory Ranking to Hierarchical Credit Propagation for Open-Ended Agent RL

Qiang Zhang, Ruixue Ding, Fanrui Zhang وآخرون · 2026

Reinforcement learning has substantially improved large language model (LLM) agents in verifiable domains, but remains difficult to apply to open-ended agent tasks, where solutions are diverse and reliable scalar rewards are hard to obtain. Recent pairwise evaluation methods alleviate reward discrimination collapse by …

المؤلفون المشاركون