Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework
作者:Dongxu Ge, Shansong Liu, Cheng Gong, Xiao-Lei Zhang, Chi Zhang, Xuelong Li · 单位:University of Science and Technology of China, Institute of Artificial Intelligence, China Telecom (TeleAI), Northwest Polytechnical University, University of Science and Technology of China Hefei China, Institute of Artificial Intelligence, China Telecom (TeleAI) Beijing China, Northwest Polytechnical University Xi’an China · 会议/期刊:arXiv preprint · 方向:cs.CV · 发布日期:2026-08-11