P
PaperPicks
Conferences
Yuxuan Wang
12 papers at tracked venues · 10 at CORE A* · active 2024–2025
DBLP profile ↗
ORCID search ↗
Venues
ICML
×3
NeurIPS
×3
ACL
×2
AAAI
×1
ICLR
×1
IJCAI
×1
InterSpeech
×1
Frequent coauthors
Ziyang Ma
DBLP profile ↗
ORCID search ↗
×3
Dongya Jia
DBLP profile ↗
ORCID search ↗
×1
Siyin Wang
DBLP profile ↗
ORCID search ↗
×1
Wenyi Yu
DBLP profile ↗
ORCID search ↗
×1
Tingle Li
DBLP profile ↗
ORCID search ↗
×1
Changli Tang
DBLP profile ↗
ORCID search ↗
×1
Bing Han
DBLP profile ↗
ORCID search ↗
×1
Qianqian Dong
DBLP profile ↗
ORCID search ↗
×1
Junyi Ao
DBLP profile ↗
ORCID search ↗
×1
Guangzhi Sun
DBLP profile ↗
ORCID search ↗
×1
Papers
DiTAR: Diffusion Transformer Autoregressive Modeling for Speech Generation
ICML 2025
·
Dongya Jia
DBLP profile ↗
ORCID search ↗
Language Model Can Listen While Speaking
AAAI 2025
·
Ziyang Ma
DBLP profile ↗
ORCID search ↗
MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix
NeurIPS 2025
·
Ziyang Ma
DBLP profile ↗
ORCID search ↗
QualiSpeech: A Speech Quality Assessment Dataset with Natural Language Reasoning and Descriptions
ACL 2025
·
Siyin Wang
DBLP profile ↗
ORCID search ↗
SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation
NeurIPS 2025
·
Wenyi Yu
DBLP profile ↗
ORCID search ↗
Sounding that Object: Interactive Object-Aware Image to Audio Generation
ICML 2025
·
Tingle Li
DBLP profile ↗
ORCID search ↗
Towards Reliable Large Audio Language Model
ACL 2025
·
Ziyang Ma
DBLP profile ↗
ORCID search ↗
Can Large Language Models Understand Spatial Audio?
InterSpeech 2024
·
Changli Tang
DBLP profile ↗
ORCID search ↗
InstructME: An Instruction Guided Music Edit Framework with Latent Diffusion Models
IJCAI 2024
·
Bing Han
DBLP profile ↗
ORCID search ↗
PolyVoice: Language Models for Speech to Speech Translation
ICLR 2024
·
Qianqian Dong
DBLP profile ↗
ORCID search ↗
SD-Eval: A Benchmark Dataset for Spoken Dialogue Understanding Beyond Words
NeurIPS 2024
·
Junyi Ao
DBLP profile ↗
ORCID search ↗
video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models
ICML 2024
·
Guangzhi Sun
DBLP profile ↗
ORCID search ↗