When Vision Becomes Text: Visual Token Pruning via Cross-Modal Residual Guidance in VLMs figure
AlphaXiv 中文概览(可滚动查看)