RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models
作者:Derek Ming Siang Tan, Shailesh Shailesh, Srikrishna Iyer, William Wei Jie Teo, Yuanliang Ju, Qiao Gu, Guillaume Sartoretti · 单位:National University of Singapore, University of Toronto · 会议/期刊:arXiv preprint · 方向:cs.RO · 发布日期:2026-07-30