Abstract

With the widespread industrial deployment of Large Language Models (LLMs), DeepSearch has emerged as the dominant paradigm for resolving complex user queries. It typically operates through an iterative closed-loop workflow consisting of planning and reflection, information retrieval, and answer generation. However, existing reward models (RMs) and evaluation benchmarks are primarily designed for static single-turn tasks, failing to capture the full-pipeline complexity of DeepSearch workflows. To address this limitation, we propose F2DR, a fine-grained full-pipeline DeepSearch reward framework. F2DR evaluates DeepSearch workflows across three dimensions: Content, Trajectory, and Answer, enabling comprehensive process-level assessment. We further construct DeepSearch RM-Bench, a dedicated benchmark for evaluating RMs in DeepSearch scenarios. Extensive experiments demonstrate that F2DR achieves significantly higher evaluation consistency than self-evaluation-based baselines, while DeepSearch RM-Bench exhibits strong discriminative capability across existing open-source RMs. We will publicly release the complete DeepSearch RM-Bench dataset soon.

Keywords

Subject

Publication details

Journal
Not available
Open access
Green open access

Cite this article

APA 7

Xiong, B., Ding, W., Lu, Y., Zhang, S., Shi, L., Liao, J., Wang, Y., Zhang, Y., Xia, L., Sun, Z., Shi, D., He, J., Ren, Y., & Xiong, D. (2026). F$^{2}$DR: A Fine-Grained Full-Pipeline Reward Framework for DeepSearch Workflows. https://omanscience.com/en/articles/f-2-dr-a-fine-grained-full-pipeline-reward-framework-for-deepsearch-workflows

MLA 9

Xiong, Bojian, et al. "F$^{2}$DR: A Fine-Grained Full-Pipeline Reward Framework for DeepSearch Workflows." https://omanscience.com/en/articles/f-2-dr-a-fine-grained-full-pipeline-reward-framework-for-deepsearch-workflows.

Chicago (author–date)

Xiong, Bojian, Wentao Ding, Yujing Lu, Shaowei Zhang, Ling Shi, Jing Liao, Yan Wang, Yueyang Zhang, Long Xia, Zhiyuan Sun, Daiting Shi, Jingzhou He, Yuqi Ren, and Deyi Xiong. 2026. "F$^{2}$DR: A Fine-Grained Full-Pipeline Reward Framework for DeepSearch Workflows." https://omanscience.com/en/articles/f-2-dr-a-fine-grained-full-pipeline-reward-framework-for-deepsearch-workflows.

Harvard

Xiong, B., Ding, W., Lu, Y., Zhang, S., Shi, L., Liao, J., Wang, Y., Zhang, Y., Xia, L., Sun, Z., Shi, D., He, J., Ren, Y. and Xiong, D. (2026) 'F$^{2}$DR: A Fine-Grained Full-Pipeline Reward Framework for DeepSearch Workflows', Available at: https://omanscience.com/en/articles/f-2-dr-a-fine-grained-full-pipeline-reward-framework-for-deepsearch-workflows.

Vancouver

Xiong B, Ding W, Lu Y, Zhang S, Shi L, Liao J, et al. F$^{2}$DR: A Fine-Grained Full-Pipeline Reward Framework for DeepSearch Workflows. https://omanscience.com/en/articles/f-2-dr-a-fine-grained-full-pipeline-reward-framework-for-deepsearch-workflows

IEEE

B. Xiong, W. Ding, Y. Lu, S. Zhang, L. Shi, J. Liao, Y. Wang, Y. Zhang, L. Xia, Z. Sun, D. Shi, J. He, Y. Ren, and D. Xiong, "F$^{2}$DR: A Fine-Grained Full-Pipeline Reward Framework for DeepSearch Workflows," https://omanscience.com/en/articles/f-2-dr-a-fine-grained-full-pipeline-reward-framework-for-deepsearch-workflows.