Publications
* indicates equal contribution. Ye Tao is highlighted.
Audio-Visual Generation
-
First author arXiv preprint, 2026Foley-Omni: A Unified Multimodal Generation Model from Task-Level Audio Synthesis to Complete Video Soundtrack Generation
A unified multimodal model that jointly generates speech, sound effects, and music for complete video soundtrack generation, with V2ST-Bench for reproducible evaluation.
Audio Editing
-
First author ICME 2026 (accepted), 2026MMEdit: A Unified Framework for Multi-Type Audio Editing via Audio Language Model
A unified audio editing framework covering addition, replacement, removal, reordering, and attribute modification with strong instruction following and content preservation.
Audio Generation
-
arXiv preprint, 2025UniFlow-Audio: Unified Flow Matching for Audio Generation from Omni-Modalities
A unified flow-matching framework for omni-modal audio generation across time-aligned and non-time-aligned tasks with strong parameter efficiency.