PPaperPicks

Kai Yu

Shanghai Jiao Tong University, Computer Science and Engineering Department, China

36 papers at tracked venues · 21 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. AHAMask: Reliable Task Specification for Large Audio Language Models Without Instructions
  2. BSCodec: A Band-Split Neural Codec for High-Quality Universal Audio Reconstruction
  3. Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling
  4. Alignment for Efficient Tool Calling of Large Language Models
  5. Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video
  6. Communication-Efficient Diffusion Denoising Parallelization via Reuse-then-Predict Mechanism
  7. Enhancing Speech-to-Speech Dialogue Modeling with End-to-End Retrieval-Augmented Generation
  8. F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching
  9. GigaSpeech 2: An Evolving, Large-Scale and Multi-domain ASR Corpus for Low-Resource Languages with Automated Crawling, Transcription and Refinement
  10. Heads up! Large Language Models Can Perform Tasks Without Your Instruction via Selective Attention Head Masking
  11. LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec
  12. MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix
  13. MS-BART: Unified Modeling of Mass Spectra and Molecules for Structure Elucidation
  14. MobA: Multifaceted Memory-Enhanced Adaptive Planning for Efficient Mobile Task Automation
  15. NeuSym-RAG: Hybrid Neural Symbolic Retrieval with Multiview Structuring for PDF Question Answering
  16. Pseudo-Autoregressive Neural Codec Language Models for Efficient Zero-Shot Text-to-Speech Synthesis
  17. Reducing Tool Hallucination via Reliability Alignment
  18. SLAM-Omni: Timbre-Controllable Voice Interaction System with Single-Stage Training
  19. Task-Specific Data Selection for Instruction Tuning via Monosemantic Neuronal Activations
  20. URO-Bench: Towards Comprehensive Evaluation for End-to-End Spoken Dialogue Models
  21. Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate
  22. VQTalker: Towards Multilingual Talking Avatars Through Facial Motion Tokenization
  23. VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining
  24. AlignSum: Data Pyramid Hierarchical Fine-tuning for Aligning with Human Summarization Preference
  25. AniTalker: Animate Vivid and Diverse Talking Faces through Identity-Decoupled Facial Motion Encoding
  26. CoE-SQL: In-Context Learning for Multi-Turn Text-to-SQL with Chain-of-Editions
  27. DiveSound: LLM-Assisted Automatic Taxonomy Construction for Diverse Audio Generation
  28. Evolving Subnetwork Training for Large Language Models
  29. Hierarchical Multimodal Pre-training for Visually Rich Webpage Understanding
  30. IBSEN: Director-Actor Agent Collaboration for Controllable and Interactive Drama Script Generation
  31. On the Effectiveness of Acoustic BPE in Decoder-Only TTS
  32. SciEval: A Multi-Level Large Language Model Evaluation Benchmark for Scientific Research
  33. Sparsity-Accelerated Training for Large Language Models
  34. Spider2-V: How Far Are Multimodal Agents From Automating Data Science and Engineering Workflows?
  35. Text-aware Speech Separation for Multi-talker Keyword Spotting
  36. UniCATS: A Unified Context-Aware Text-to-Speech Framework with Contextual VQ-Diffusion and Vocoding