Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models
作者:Hunter Schofield, Mohammed Elmahgiubi, Mohammad Mahdavian, Richard Shi, Jinjun Shan, Amir Rasouli, Dongfeng Bai · 会议/期刊:arXiv preprint · 方向:cs.CV · 发布日期:2026-08-12