Publications

* indicates equal contribution. Ye Tao is highlighted.

Audio-Visual Generation

  • First author arXiv preprint, 2026
    Foley-Omni: A Unified Multimodal Generation Model from Task-Level Audio Synthesis to Complete Video Soundtrack Generation
    Ye Tao, Lupeng Liu, Xuenan Xu, Jiasun Feng, Jiarui Wang, Ying Qin, Shuiyang Mao, Wei Liu, Shuai Wang

    A unified multimodal model that jointly generates speech, sound effects, and music for complete video soundtrack generation, with V2ST-Bench for reproducible evaluation.

Audio Editing

  • First author ICME 2026 (accepted), 2026
    MMEdit: A Unified Framework for Multi-Type Audio Editing via Audio Language Model
    Ye Tao, Wen Wu, Chao Zhang, Shuai Wang, Mengyue Wu, Xuenan Xu

    A unified audio editing framework covering addition, replacement, removal, reordering, and attribute modification with strong instruction following and content preservation.

Audio Generation

  • arXiv preprint, 2025
    UniFlow-Audio: Unified Flow Matching for Audio Generation from Omni-Modalities
    Xuenan Xu, Jiahao Mei, Zihao Zheng, Ye Tao, Zeyu Xie, Yaoyun Zhang, Haohe Liu, Yuning Wu, Ming Yan, Wen Wu, Chao Zhang, Mengyue Wu

    A unified flow-matching framework for omni-modal audio generation across time-aligned and non-time-aligned tasks with strong parameter efficiency.