Li, H., Yan, S., Zhu, L., Tang, X., Wang, S., & Wang, X. (2026). Bridge3D: Enabling Vision-Language-Action Models to See and Act in 3D. https://omanscience.com/ar/articles/bridge3d-enabling-vision-language-action-models-to-see-and-act-in-3d