Abstract
Vision-Language-Action (VLA) models provide a unified framework for grounding high-level semantic information into low-level robot actions, enabling scalable robotic manipulation across diverse tasks. However, existing VLA models lack explicit mechanisms to disentangle the states and intents of the two arms, leading to unintended cross-arm interference that degrades task execution success. To address this issue, we propose a symmetric Dual-Arm Expert (DAE) architecture built upon a shared Vision-Language Model (VLM) backbone with decoupled, arm-specific expert towers. Expert selection is carried out through a two-stage dual-arm intent routing scheme, in which experts are routed either by explicit language instructions in the first stage or by implicit visual semantics in the second stage. Moreover, we introduce a lightweight task progress prediction module that leverages cross-attention between the pre-chunk temporal features and semantic representations of proprioceptive and visual observations to accurately estimate frame-wise task completion progress. This module facilitates task progress synchronization to support coordinated scheduling for collaborative multi-robot tasks. Experimental results demonstrate the effectiveness of our model in dual-arm intent routing and the disentanglement of cross-arm interference, and further provide preliminary evidence of emergent skill generalization from single- to dual-arm tasks (as well as the reverse), together with cross-arm motion-domain skill transfer.
Keywords
Subject
Publication details
- Journal
- Not available
- Open access
- Green open access
Cite this article
APA 7
Zhao, Y., Gao, H., Cheng, B., Tang, J., Zhou, D., Liang, D., Ge, J., Wen, X., Zhao, L., & Wang, Y. (2026). TAO-DA: Towards Autonomous Operation--A Dual-Arm Vision-Language-Action Model for Coordinated Manipulation. https://omanscience.com/en/articles/tao-da-towards-autonomous-operation-a-dual-arm-vision-language-action-model-for-coordinated-manipulation
MLA 9
Zhao, Yongsheng, et al. "TAO-DA: Towards Autonomous Operation--A Dual-Arm Vision-Language-Action Model for Coordinated Manipulation." https://omanscience.com/en/articles/tao-da-towards-autonomous-operation-a-dual-arm-vision-language-action-model-for-coordinated-manipulation.
Chicago (author–date)
Zhao, Yongsheng, Han Gao, Baoping Cheng, Jingyao Tang, Dian Zhou, Deng Liang, Ji Ge, Xuanzhang Wen, Lei Zhao, and Ye Wang. 2026. "TAO-DA: Towards Autonomous Operation--A Dual-Arm Vision-Language-Action Model for Coordinated Manipulation." https://omanscience.com/en/articles/tao-da-towards-autonomous-operation-a-dual-arm-vision-language-action-model-for-coordinated-manipulation.
Harvard
Zhao, Y., Gao, H., Cheng, B., Tang, J., Zhou, D., Liang, D., Ge, J., Wen, X., Zhao, L. and Wang, Y. (2026) 'TAO-DA: Towards Autonomous Operation--A Dual-Arm Vision-Language-Action Model for Coordinated Manipulation', Available at: https://omanscience.com/en/articles/tao-da-towards-autonomous-operation-a-dual-arm-vision-language-action-model-for-coordinated-manipulation.
Vancouver
Zhao Y, Gao H, Cheng B, Tang J, Zhou D, Liang D, et al. TAO-DA: Towards Autonomous Operation--A Dual-Arm Vision-Language-Action Model for Coordinated Manipulation. https://omanscience.com/en/articles/tao-da-towards-autonomous-operation-a-dual-arm-vision-language-action-model-for-coordinated-manipulation
IEEE
Y. Zhao, H. Gao, B. Cheng, J. Tang, D. Zhou, D. Liang, J. Ge, X. Wen, L. Zhao, and Y. Wang, "TAO-DA: Towards Autonomous Operation--A Dual-Arm Vision-Language-Action Model for Coordinated Manipulation," https://omanscience.com/en/articles/tao-da-towards-autonomous-operation-a-dual-arm-vision-language-action-model-for-coordinated-manipulation.