P
PaperPicks
Conferences
Minghui Fang
Zhejiang University, China
19 papers at tracked venues · 14 at CORE A* · active 2024–2025
DBLP profile ↗
ORCID 0009-0000-6488-9695 ↗
Homepage ↗
Venues
ACL
×5
InterSpeech
×3
AAAI
×2
ACM MM
×2
EMNLP
×2
ICLR
×2
ICCV
×1
NeurIPS
×1
SIGKDD
×1
Frequent coauthors
Shengpeng Ji
DBLP profile ↗
ORCID search ↗
×4
Xiaoda Yang
DBLP profile ↗
ORCID search ↗
×3
Hai Huang
DBLP profile ↗
ORCID search ↗
×2
Kaixuan Luan
DBLP profile ↗
ORCID search ↗
×1
Chenlin Liu
DBLP profile ↗
ORCID search ↗
×1
Xize Cheng
DBLP profile ↗
ORCID search ↗
×1
Jialong Zuo
DBLP profile ↗
ORCID search ↗
×1
Wenrui Liu
DBLP profile ↗
ORCID search ↗
×1
Ruofan Hu
DBLP profile ↗
ORCID search ↗
×1
Xinyue Fang
DBLP profile ↗
ORCID search ↗
×1
Fuming You
DBLP profile ↗
ORCID search ↗
×1
Papers
CART: A Generative Cross-Modal Retrieval Framework With Coarse-To-Fine Semantic Modeling
ACL 2025
·
Minghui Fang
ControlSpeech: Towards Simultaneous and Independent Zero-shot Speaker Cloning and Zero-shot Language Style Control
ACL 2025
·
Shengpeng Ji
DBLP profile ↗
ORCID search ↗
Enhancing Multimodal Unified Representations for Cross Modal Generalization
ACL 2025
·
Hai Huang
DBLP profile ↗
ORCID search ↗
GTA: Towards Generative Text-To-Audio Retrieval via Multi-Scale Tokenizer
InterSpeech 2025
·
Minghui Fang
Language-Codec: Bridging Discrete Codec Representations and Speech Language Models
ACL 2025
·
Shengpeng Ji
DBLP profile ↗
ORCID search ↗
MelRe: Vision-Based Mel-Spectrogram Restoration
InterSpeech 2025
·
Kaixuan Luan
DBLP profile ↗
ORCID search ↗
Mitigating Hallucinations in LM-Based TTS Models via Distribution Alignment Using GFlowNets
EMNLP 2025
·
Chenlin Liu
DBLP profile ↗
ORCID search ↗
Multimodal Conditional Retrieval with High Controllability
SIGKDD 2025
·
Xiaoda Yang
DBLP profile ↗
ORCID search ↗
OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup
ICLR 2025
·
Xize Cheng
DBLP profile ↗
ORCID search ↗
Open-Set Cross Modal Generalization via Multimodal Unified Representation
ICCV 2025
·
Hai Huang
DBLP profile ↗
ORCID search ↗
Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching
ACL 2025
·
Jialong Zuo
DBLP profile ↗
ORCID search ↗
Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation
ACM MM 2025
·
Wenrui Liu
DBLP profile ↗
ORCID search ↗
Speech Watermarking with Discrete Intermediate Representations
AAAI 2025
·
Shengpeng Ji
DBLP profile ↗
ORCID search ↗
Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval
InterSpeech 2025
·
Ruofan Hu
DBLP profile ↗
ORCID search ↗
WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling
ICLR 2025
·
Shengpeng Ji
DBLP profile ↗
ORCID search ↗
Zero-resource Hallucination Detection for Text Generation via Graph-based Contextual Knowledge Triples Modeling
AAAI 2025
·
Xinyue Fang
DBLP profile ↗
ORCID search ↗
AudioVSR: Enhancing Video Speech Recognition with Audio Data
EMNLP 2024
·
Xiaoda Yang
DBLP profile ↗
ORCID search ↗
MoMu-Diffusion: On Learning Long-Term Motion-Music Synchronization and Correspondence
NeurIPS 2024
·
Fuming You
DBLP profile ↗
ORCID search ↗
SyncTalklip: Highly Synchronized Lip-Readable Speaker Generation with Multi-Task Learning
ACM MM 2024
·
Xiaoda Yang
DBLP profile ↗
ORCID search ↗