GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models
作者:Mengjie Zhang, Qihui Zhu, Tao Zhang, Shuangwu Chen, Huihuang Qin, Yu Guo, Shenghao Ye, Zijian Wen, Yunpeng Hou, Dong Jin, Xiaobin Tan, Huasen He, Jian Yang · 单位:University of Science and Technology of China, Institute of Artificial Intelligence, Hefei Comprehensive National Science Center, University of Science and Technology of China He Fei China, Institute of Artificial Intelligence, Hefei Comprehensive National Science Center He Fei China · 会议/期刊:arXiv preprint · 方向:cs.CV · 发布日期:2026-08-05