Preprint Open access
MixVLA: Adaptive Mixing of Non-Invariant Information for Generalizable Vision-Language-Action Models
Vision-Language-Action (VLA) models have achieved remarkable advances in robotic manipulation, yet their zero-shot generalization under out-of-distribution (OOD) conditions remains limited. These models often entangle task-relevant invariant structure with environment-specific non-invariant factors, causing policies to …