PPaperPicks

Helen Meng

The Chinese University of Hog Kong

41 papers at tracked venues · 17 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models
  2. Masked Text-to-Audio Flow-Matching and Reward Feedback Optimization
  3. UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment
  4. ALMTokenizer: A Low-bitrate and Semantic-rich Audio Codec Tokenizer for Audio Language Modeling
  5. Autoregressive Speech Synthesis without Vector Quantization
  6. Can Large Language Models Be Query Optimizer for Relational Databases?
  7. Decoding on Graphs: Faithful and Sound Reasoning on Knowledge Graphs through Generation of Well-Formed Chains
  8. Defending Unauthorized Voice Cloning with Watermark-Aware Codecs
  9. DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model
  10. Disentangling Speaker and Content in Pre-trained Speech Models with Latent Diffusion for Robust Speaker Verification
  11. Generate, Discriminate, Evolve: Enhancing Context Faithfulness via Fine-Grained Sentence-Level Self-Evolution
  12. Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction
  13. On the Within-class Variation Issue in Alzheimer's Disease Detection
  14. On-the-fly Routing for Zero-shot MoE Speaker Adaptation of Speech Foundation Models for Dysarthric Speech Recognition
  15. Optimizing Pause Context in Fine-Tuning Pre-trained Large Language Models for Dementia Detection
  16. RAG-Zeval: Enhancing RAG Responses Evaluator through End-to-End Reasoning and Ranking-Based Reinforcement Learning
  17. Self-Tuning: Instructing LLMs to Effectively Acquire New Knowledge through Self-Teaching
  18. SocialCC: Interactive Evaluation for Cultural Competence in Language Agents
  19. Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs
  20. Adaptive Query Rewriting: Aligning Rewriters through Marginal Probability of Conversational Answers
  21. COKE: A Cognitive Knowledge Graph for Machine Theory of Mind
  22. CoLM-DSR: Leveraging Neural Codec Language Modeling for Multi-Modal Dysarthric Speech Reconstruction
  23. Designing Scaffolding Strategies for Conversational Agents in Dialog Task of Neurocognitive Disorders Screening
  24. Empowering Whisper as a Joint Multi-Talker and Target-Talker Speech Recognition System
  25. Joint Speaker Features Learning for Audio-visual Multichannel Speech Separation and Recognition
  26. Large Language Model-based FMRI Encoding of Language Functions for Subjects with Neurocognitive Disorder
  27. LoRA-MER: Low-Rank Adaptation of Pre-Trained Speech Models for Multimodal Emotion Recognition Using Mutual Information
  28. Natural Language Embedded Programs for Hybrid Language Symbolic Reasoning
  29. Natural Language-Assisted Multi-modal Medication Recommendation
  30. Parameter-efficient Fine-tuning of Speaker-Aware Dynamic Prompts for Speaker Verification
  31. Prompting Large Language Models with Mispronunciation Detection and Diagnosis Abilities
  32. Rethinking Machine Ethics - Can LLMs Perform Moral Reasoning through the Lens of Moral Theories?
  33. Seamless Language Expansion: Enhancing Multilingual Mastery in Self-Supervised Models
  34. Self-Alignment for Factuality: Mitigating Hallucinations in LLMs via Self-Evaluation
  35. SimCalib: Graph Neural Network Calibration Based on Similarity between Nodes
  36. SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models
  37. SongCreator: Lyrics-based Universal Song Generation
  38. Spontaneous Style Text-to-Speech Synthesis with Controllable Spontaneous Behaviors Based on Language Models
  39. Towards Effective and Efficient Non-autoregressive Decoding Using Block-based Attention Mask
  40. UniAudio 1.5: Large Language Model-Driven Audio Codec is A Few-Shot Audio Task Learner
  41. UniAudio: Towards Universal Audio Generation with Large Language Models