نسخة أولية وصول مفتوح
Alignment-Guided Flow Transformer for Efficient Vision-Language-Action Policy Learning
Recent advances in Vision-Language-Action (VLA) models point toward general-purpose robotic intelligence by unifying perception, instruction, and control. Despite impressive progress, existing VLA models often adapt poorly due to \emph{tri-modal misalignment} among vision, language, and action, which weakens action gro …