Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models
作者:Xingyu Ding, Yuzhong Zhao, Yang Wu, Chaoyang Zhao, Chunhai Zhao, Yifan Zhang, Jian Cheng · 单位:Nanjing University, Nanjing, China, Institute of Automation, Chinese Academy of Sciences, Beijing, China, University of Chinese Academy of Sciences, Beijing, China · 会议/期刊:arXiv preprint · 方向:cs.RO · 发布日期:2026-08-06