الملخص

How well can general-purpose multimodal models turn visual understanding and reasoning into embodied manipulation via executable code? We introduce CodeActionBench, a benchmark of 25 manipulation tasks that evaluates this capability through agentic Code-as-Policy. Without task-specific fine-tuning, demonstrations, external specialist perception or grasp modules, privileged scene state, or predefined task policies, agents should select visual evidence, form task-relevant 3D estimates, construct manipulation targets, and iteratively execute and revise their policies. A shared robot API provides RGB observations, calibrated geometric operations, robot feedback, and bounded motion, leaving task-dependent decisions to the evaluated agent. Fixed task instances, resource budgets, and a hidden physical-outcome verifier support controlled comparisons across models and harness configurations. Extensive evaluations across nine configurations and 675 attempts achieve success rates ranging from 2.7% to 73.3%. The strongest configuration, GPT-6 Astra with Codex CLI, solves 22 of 25 tasks at least once in three attempts, demonstrating the best performance while still leaving substantial room for improvement. Trajectory analyses reveal difficulties in spatial alignment, object retention, and completion judgment, including task failures despite successfully completed motions. CodeActionBench provides a controlled testbed for measuring how general-purpose models translate their capabilities into manipulation behavior and for examining typical failure scenarios in that process.

الكلمات المفتاحية

الموضوع

بيانات النشر

المجلة
غير متاح
وصول مفتوح
وصول مفتوح أخضر

اقتبس هذه المقالة

APA 7

Lyu, Y., Jiang, X., Li, W., Lu, S., & Zhang, G. (2026). CodeActionBench: Evaluating Agentic Code-as-Policy for Embodied Manipulation. https://omanscience.com/ar/articles/codeactionbench-evaluating-agentic-code-as-policy-for-embodied-manipulation

MLA 9

Lyu, Yiheng, et al. "CodeActionBench: Evaluating Agentic Code-as-Policy for Embodied Manipulation." https://omanscience.com/ar/articles/codeactionbench-evaluating-agentic-code-as-policy-for-embodied-manipulation.

شيكاغو (المؤلف–التاريخ)

Lyu, Yiheng, Xueying Jiang, Wenhao Li, Shijian Lu, and Gongjie Zhang. 2026. "CodeActionBench: Evaluating Agentic Code-as-Policy for Embodied Manipulation." https://omanscience.com/ar/articles/codeactionbench-evaluating-agentic-code-as-policy-for-embodied-manipulation.

هارفارد

Lyu, Y., Jiang, X., Li, W., Lu, S. and Zhang, G. (2026) 'CodeActionBench: Evaluating Agentic Code-as-Policy for Embodied Manipulation', Available at: https://omanscience.com/ar/articles/codeactionbench-evaluating-agentic-code-as-policy-for-embodied-manipulation.

فانكوفر

Lyu Y, Jiang X, Li W, Lu S, Zhang G. CodeActionBench: Evaluating Agentic Code-as-Policy for Embodied Manipulation. https://omanscience.com/ar/articles/codeactionbench-evaluating-agentic-code-as-policy-for-embodied-manipulation

IEEE

Y. Lyu, X. Jiang, W. Li, S. Lu, and G. Zhang, "CodeActionBench: Evaluating Agentic Code-as-Policy for Embodied Manipulation," https://omanscience.com/ar/articles/codeactionbench-evaluating-agentic-code-as-policy-for-embodied-manipulation.