PPaperPicks

Wen Wang

Alibaba Group, DAMO Academy, Speech Lab, Sunnyvale, CA, USA

19 papers at tracked venues · 18 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Dual-Axis Generative Reward Model Toward Semantic and Turn-taking Robustness in Interactive Spoken Dialogue Models
  2. GenesisFunc: Multi-Agent Data Generation for Accurate and Generalizable Function-Calling
  3. Say More with Less: Variable-Frame-Rate Speech Tokenization via Adaptive Clustering and Implicit Duration Coding
  4. SpeakerLM: End-to-End Versatile Speaker Diarization and Recognition with Multimodal Large Language Models
  5. UniVocal: Unified Speech-Singing Code-Switching Synthesis
  6. WavAlign: Enhancing Intelligence and Expressiveness in Spoken Dialogue Models via Adaptive Hybrid Post-Training
  7. ClinicalLab: Aligning Agents for Multi-Departmental Clinical Diagnostics in the Real World
  8. CodeHalu: Investigating Code Hallucinations in LLMs via Execution-based Verification
  9. ControlSpeech: Towards Simultaneous and Independent Zero-shot Speaker Cloning and Zero-shot Language Style Control
  10. Integrating Audio, Visual, and Semantic Information for Enhanced Multimodal Speaker Diarization on Multi-party Conversation
  11. Multimodal Fusion and Coherence Modeling for Video Topic Segmentation
  12. OmniAudio: Generating Spatial Audio from 360-Degree Video
  13. OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation
  14. Pushing the Frontiers of Self-Distillation Prototypes Network with Dimension Regularization and Score Normalization
  15. Recording for Eyes, Not Echoing to Ears: Contextualized Spoken-to-Written Conversion of ASR Transcripts
  16. ThinkSound: Chain-of-Thought Reasoning in Multimodal LLMs for Audio Generation and Editing
  17. UniCodec: Unified Audio Codec with Single Domain-Adaptive Codebook
  18. WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling
  19. CodeScope: An Execution-based Multilingual Multitask Multidimensional Benchmark for Evaluating LLMs on Code Understanding and Generation