الباحثون

Bryce Grant

المنشورات 1

نسخة أولية وصول مفتوح

Correcting WHERE, Preserving HOW: Compositional Generalization for Vision-Language-Action Models via Referential Guidance

Yanyan Zhang, Disheng Liu, Xinpeng Li وآخرون · 2026

While Vision-Language-Action (VLA) models enable flexible action generation, their generalization across diverse environmental elements, including manipulated objects, destinations, and backgrounds, is limited by the lack of diversity in robotic training data. Trained end-to-end on such data, VLAs tend to exploit visua …

المؤلفون المشاركون