P
PaperPicks
Conferences
Xize Cheng
32 papers at tracked venues · 29 at CORE A* · active 2024–2026
DBLP profile ↗
ORCID search ↗
Venues
ACL
×11
ACM MM
×5
ICLR
×4
NeurIPS
×4
EMNLP
×2
ICML
×2
AAAI
×1
CVPR
×1
InterSpeech
×1
SIGKDD
×1
Frequent coauthors
Zehan Wang
DBLP profile ↗
ORCID search ↗
×4
Rongjie Huang
DBLP profile ↗
ORCID search ↗
×3
Xiaoda Yang
DBLP profile ↗
ORCID search ↗
×3
Minghui Fang
DBLP profile ↗
ORCID search ↗
×2
Shengpeng Ji
DBLP profile ↗
ORCID search ↗
×2
Dongjie Fu
DBLP profile ↗
ORCID search ↗
×2
Huadai Liu
DBLP profile ↗
ORCID search ↗
×2
Jingyu Lu
DBLP profile ↗
ORCID search ↗
×1
Zirun Guo
DBLP profile ↗
ORCID search ↗
×1
Jialong Zuo
DBLP profile ↗
ORCID search ↗
×1
Haifeng Huang
DBLP profile ↗
ORCID search ↗
×1
Ziang Zhang
DBLP profile ↗
ORCID search ↗
×1
Papers
Masked Text-to-Audio Flow-Matching and Reward Feedback Optimization
ACL 2026
·
Rongjie Huang
DBLP profile ↗
ORCID search ↗
SDiaReward: Modeling and Benchmarking Spoken Dialogue Rewards with Modality and Colloquialness
ACL 2026
·
Jingyu Lu
DBLP profile ↗
ORCID search ↗
A Wander Through the Multimodal Landscape: Efficient Transfer Learning via Low-rank Sequence Multimodal Adapter
AAAI 2025
·
Zirun Guo
DBLP profile ↗
ORCID search ↗
AHa-Bench: Benchmarking Audio Hallucinations in Large Audio-Language Models
NeurIPS 2025
·
Xize Cheng
CART: A Generative Cross-Modal Retrieval Framework With Coarse-To-Fine Semantic Modeling
ACL 2025
·
Minghui Fang
DBLP profile ↗
ORCID search ↗
ControlSpeech: Towards Simultaneous and Independent Zero-shot Speaker Cloning and Zero-shot Language Style Control
ACL 2025
·
Shengpeng Ji
DBLP profile ↗
ORCID search ↗
GTA: Towards Generative Text-To-Audio Retrieval via Multi-Scale Tokenizer
InterSpeech 2025
·
Minghui Fang
DBLP profile ↗
ORCID search ↗
Multimodal Conditional Retrieval with High Controllability
SIGKDD 2025
·
Xiaoda Yang
DBLP profile ↗
ORCID search ↗
OmniBind: Large-scale Omni Multimodal Representation via Binding Spaces
ICLR 2025
·
Zehan Wang
DBLP profile ↗
ORCID search ↗
OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup
ICLR 2025
·
Xize Cheng
PACHAT: Persona-Aware Speech Assistant for Multi-party Dialogue
EMNLP 2025
·
Dongjie Fu
DBLP profile ↗
ORCID search ↗
Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching
ACL 2025
·
Jialong Zuo
DBLP profile ↗
ORCID search ↗
SpatialCLIP: Learning 3D-aware Image Representations from Spatially Discriminative Language
CVPR 2025
·
Zehan Wang
DBLP profile ↗
ORCID search ↗
T2A-Feedback: Improving Basic Capabilities of Text-to-Audio Generation via Fine-grained AI Feedback
ACL 2025
·
Zehan Wang
DBLP profile ↗
ORCID search ↗
VoxDialogue: Can Spoken Dialogue Systems Understand Information Beyond Words?
ICLR 2025
·
Xize Cheng
WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling
ICLR 2025
·
Shengpeng Ji
DBLP profile ↗
ORCID search ↗
AudioLCM: Efficient and High-Quality Text-to-Audio Generation with Minimal Inference Steps
ACM MM 2024
·
Huadai Liu
DBLP profile ↗
ORCID search ↗
AudioVSR: Enhancing Video Speech Recognition with Audio Data
EMNLP 2024
·
Xiaoda Yang
DBLP profile ↗
ORCID search ↗
Boosting Speech Recognition Robustness to Modality-Distortion with Contrast-Augmented Prompts
ACM MM 2024
·
Dongjie Fu
DBLP profile ↗
ORCID search ↗
Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers
NeurIPS 2024
·
Haifeng Huang
DBLP profile ↗
ORCID search ↗
Extending Multi-modal Contrastive Representations
NeurIPS 2024
·
Ziang Zhang
DBLP profile ↗
ORCID search ↗
FreeBind: Free Lunch in Unified Multimodal Space via Knowledge Fusion
ICML 2024
·
Zehan Wang
DBLP profile ↗
ORCID search ↗
InstructSpeech: Following Speech Editing Instructions via Large Language Models
ICML 2024
·
Rongjie Huang
DBLP profile ↗
ORCID search ↗
MimicTalk: Mimicking a personalized and expressive 3D talking face in minutes
NeurIPS 2024
·
Zhenhui Ye
DBLP profile ↗
ORCID search ↗
Rethinking the Multimodal Correlation of Multimodal Sequential Learning via Generalizable Attentional Results Alignment
ACL 2024
·
Tao Jin
DBLP profile ↗
ORCID search ↗
SegTalker: Segmentation-based Talking Face Generation with Mask-guided Local Editing
ACM MM 2024
·
Lingyu Xiong
DBLP profile ↗
ORCID search ↗
SyncTalklip: Highly Synchronized Lip-Readable Speaker Generation with Multi-Task Learning
ACM MM 2024
·
Xiaoda Yang
DBLP profile ↗
ORCID search ↗
Text-to-Song: Towards Controllable Music Generation Incorporating Vocal and Accompaniment
ACL 2024
·
Zhiqing Hong
DBLP profile ↗
ORCID search ↗
TransFace: Unit-Based Audio-Visual Speech Synthesizer for Talking Head Translation
ACL 2024
·
Xize Cheng
Uni-Dubbing: Zero-Shot Speech Synthesis from Visual Articulation
ACL 2024
·
Songju Lei
DBLP profile ↗
ORCID search ↗
VoiceTuner: Self-Supervised Pre-training and Efficient Fine-tuning For Voice Generation
ACM MM 2024
·
Rongjie Huang
DBLP profile ↗
ORCID search ↗
Wav2SQL: Direct Generalizable Speech-To-SQL Parsing
ACL 2024
·
Huadai Liu
DBLP profile ↗
ORCID search ↗