نسخة أولية وصول مفتوح
BRIDGE: Bilevel Retrieval-Credit-Aware Agentic Reinforcement Learning
Agentic reinforcement learning (ARL) with verifiable rewards improves the ability of large language models (LLMs) to tackle knowledge-intensive tasks by learning to interleave search and reasoning. However, most existing ARL methods optimize only LLM-generated tokens and treat retrieved evidence as environment observat …