نسخة أولية وصول مفتوح
Recompose and Refine Latent Reasoning Flows for Vision-Language-Action Models
Latent reasoning enables vision-language-action (VLA) models to transform multimodal observations into task-relevant internal states before generating continuous robot actions. While existing methods learn to generate or refine such states for each policy query, they discard successful reasoning after execution and the …