الباحثون

Katsuki Fujisawa

المنشورات 1

نسخة أولية وصول مفتوح

BRIDGE: Bilevel Retrieval-Credit-Aware Agentic Reinforcement Learning

Quan Xiao, Mingda Liu, Gaowen Liu وآخرون · 2026

Agentic reinforcement learning (ARL) with verifiable rewards improves the ability of large language models (LLMs) to tackle knowledge-intensive tasks by learning to interleave search and reasoning. However, most existing ARL methods optimize only LLM-generated tokens and treat retrieved evidence as environment observat …

المؤلفون المشاركون