Zhang, Y., Liu, D., Li, X., Song, C., Hariri, M., Ganguly, D., Yang, W., Ye, K., Grant, B., Chaudhary, V., & Yin, Y. (2026). Correcting WHERE, Preserving HOW: Compositional Generalization for Vision-Language-Action Models via Referential Guidance. https://omanscience.com/ar/articles/correcting-where-preserving-how-compositional-generalization-for-vision-language-action-models-via-referential-guidance