P
PaperPicks
Conferences
Shengpeng Ji
29 papers at tracked venues · 26 at CORE A* · active 2024–2026
DBLP profile ↗
ORCID search ↗
Venues
ACL
×14
ICLR
×5
ACM MM
×2
EMNLP
×2
AAAI
×1
CVPR
×1
ICCV
×1
ICML
×1
InterSpeech
×1
NeurIPS
×1
Frequent coauthors
Yifu Chen
DBLP profile ↗
ORCID search ↗
×4
Xize Cheng
DBLP profile ↗
ORCID search ↗
×3
Zehan Wang
DBLP profile ↗
ORCID search ↗
×3
Minghui Fang
DBLP profile ↗
ORCID search ↗
×2
Hai Huang
DBLP profile ↗
ORCID search ↗
×2
Hanting Wang
DBLP profile ↗
ORCID search ↗
×2
Xiaoda Yang
DBLP profile ↗
ORCID search ↗
×2
Yangzhuo Li
DBLP profile ↗
ORCID search ↗
×1
Tianle Liang
DBLP profile ↗
ORCID search ↗
×1
Dingdong Wang
DBLP profile ↗
ORCID search ↗
×1
Jialong Zuo
DBLP profile ↗
ORCID search ↗
×1
Yidi Jiang
DBLP profile ↗
ORCID search ↗
×1
Papers
Dual-Axis Generative Reward Model Toward Semantic and Turn-taking Robustness in Interactive Spoken Dialogue Models
ACL 2026
·
Yifu Chen
DBLP profile ↗
ORCID search ↗
Dual-Reasoner: Bridging Interleaved Atomicity and Streaming Latency via Thinking-while-Talking
ACL 2026
·
Yangzhuo Li
DBLP profile ↗
ORCID search ↗
VoxMind: An End-to-End Agentic Spoken Dialogue System
ACL 2026
·
Tianle Liang
DBLP profile ↗
ORCID search ↗
WavAlign: Enhancing Intelligence and Expressiveness in Spoken Dialogue Models via Adaptive Hybrid Post-Training
ACL 2026
·
Yifu Chen
DBLP profile ↗
ORCID search ↗
AHa-Bench: Benchmarking Audio Hallucinations in Large Audio-Language Models
NeurIPS 2025
·
Xize Cheng
DBLP profile ↗
ORCID search ↗
CART: A Generative Cross-Modal Retrieval Framework With Coarse-To-Fine Semantic Modeling
ACL 2025
·
Minghui Fang
DBLP profile ↗
ORCID search ↗
ControlSpeech: Towards Simultaneous and Independent Zero-shot Speaker Cloning and Zero-shot Language Style Control
ACL 2025
·
Shengpeng Ji
Enhancing Multimodal Unified Representations for Cross Modal Generalization
ACL 2025
·
Hai Huang
DBLP profile ↗
ORCID search ↗
GTA: Towards Generative Text-To-Audio Retrieval via Multi-Scale Tokenizer
InterSpeech 2025
·
Minghui Fang
DBLP profile ↗
ORCID search ↗
IRBridge: Solving Image Restoration Bridge with Pre-trained Generative Diffusion Models
ICML 2025
·
Hanting Wang
DBLP profile ↗
ORCID search ↗
InSerter: Speech Instruction Following with Unsupervised Interleaved Pre-training
ACL 2025
·
Dingdong Wang
DBLP profile ↗
ORCID search ↗
InteractSpeech: A Speech Dialogue Interaction Corpus for Spoken Dialogue Model
EMNLP 2025
·
Yifu Chen
DBLP profile ↗
ORCID search ↗
Language-Codec: Bridging Discrete Codec Representations and Speech Language Models
ACL 2025
·
Shengpeng Ji
OmniBind: Large-scale Omni Multimodal Representation via Binding Spaces
ICLR 2025
·
Zehan Wang
DBLP profile ↗
ORCID search ↗
OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup
ICLR 2025
·
Xize Cheng
DBLP profile ↗
ORCID search ↗
Open-Set Cross Modal Generalization via Multimodal Unified Representation
ICCV 2025
·
Hai Huang
DBLP profile ↗
ORCID search ↗
Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching
ACL 2025
·
Jialong Zuo
DBLP profile ↗
ORCID search ↗
SpatialCLIP: Learning 3D-aware Image Representations from Spatially Discriminative Language
CVPR 2025
·
Zehan Wang
DBLP profile ↗
ORCID search ↗
Speech Watermarking with Discrete Intermediate Representations
AAAI 2025
·
Shengpeng Ji
T2A-Feedback: Improving Basic Capabilities of Text-to-Audio Generation via Fine-grained AI Feedback
ACL 2025
·
Zehan Wang
DBLP profile ↗
ORCID search ↗
TAP: Parameter-efficient Task-Aware Prompting for Adverse Weather Removal
ACM MM 2025
·
Hanting Wang
DBLP profile ↗
ORCID search ↗
UniCodec: Unified Audio Codec with Single Domain-Adaptive Codebook
ACL 2025
·
Yidi Jiang
DBLP profile ↗
ORCID search ↗
VoxDialogue: Can Spoken Dialogue Systems Understand Information Beyond Words?
ICLR 2025
·
Xize Cheng
DBLP profile ↗
ORCID search ↗
WavRAG: Audio-Integrated Retrieval Augmented Generation for Spoken Dialogue Models
ACL 2025
·
Yifu Chen
DBLP profile ↗
ORCID search ↗
WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling
ICLR 2025
·
Shengpeng Ji
AudioVSR: Enhancing Video Speech Recognition with Audio Data
EMNLP 2024
·
Xiaoda Yang
DBLP profile ↗
ORCID search ↗
Mega-TTS 2: Boosting Prompting Mechanisms for Zero-Shot Speech Synthesis
ICLR 2024
·
Ziyue Jiang
DBLP profile ↗
ORCID search ↗
MobileSpeech: A Fast and High-Fidelity Framework for Mobile Zero-Shot Text-to-Speech
ACL 2024
·
Shengpeng Ji
SyncTalklip: Highly Synchronized Lip-Readable Speaker Generation with Multi-Task Learning
ACM MM 2024
·
Xiaoda Yang
DBLP profile ↗
ORCID search ↗