PPaperPicks

Wei Xue

Hong Kong Baptist University, Division of Emerging Interdisciplinary Areas, Hong Kong

44 papers at tracked venues · 38 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. ActorMind: Emulating Human Actor Reasoning for Speech Role-Playing
  2. Benchmarking Fine-Grained Error Detection in Multimodal Reasoning
  3. Inference-time Scaling for Diffusion-based Audio Super-resolution
  4. Lighthouse: A Self-Reconfiguring Sociotechnical Infrastructure for the Unforeseen Long-Tail of Urban Crisis
  5. Omni-RewardBench: Toward a Comprehensive Evaluation of Generative Reward Models Across Modalities
  6. VMChill: A Dataset for Fine-Grained Visual-Musical Synergy
  7. WenetSpeech-Yue: A Large-Scale Cantonese Speech Corpus with Multi-dimensional Annotation
  8. AIRA: Activation-Informed Low-Rank Adaptation for Large Models
  9. BayesKD: Bayesian Knowledge Distillation for Compact LLMs in Constrained Fine-tuning Scenarios
  10. Boosting Policy and Process Reward Models with Monte Carlo Tree Search in Open-Domain QA
  11. Both Ears Wide Open: Towards Language-Driven Spatial Audio Generation
  12. Co3Gesture: Towards Coherent Concurrent Co-speech 3D Gesture Generation with Interactive Diffusion
  13. Codec Does Matter: Exploring the Semantic Shortcoming of Codec for Audio Language Model
  14. Delta Decompression for MoE-based LLMs Compression
  15. Efficient Fine-Tuning of Large Models Via Nested Low-Rank Adaptation
  16. Empowering World Models with Reflection for Embodied Video Prediction
  17. FlashAudio: Rectified Flow for Fast and High-Fidelity Text-to-Audio Generation
  18. Foundation Cures Personalization: Improving Personalized Models' Prompt Consistency via Hidden Foundation Knowledge
  19. Graceful Forgetting in Generative Language Models
  20. Importance Weighting Can Help Large Language Models Self-Improve
  21. LLaSE-G1: Incentivizing Generalization Capability for LLaMA-based Speech Enhancement
  22. MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix
  23. MelodyEdit: Zero-shot Music Editing with Disentangled Inversion Control
  24. MoE-SVD: Structured Mixture-of-Experts LLMs Compression via Singular Value Decomposition
  25. MuPT: A Generative Symbolic Music Pretrained Transformer
  26. OmniAudio: Generating Spatial Audio from 360-Degree Video
  27. PSHuman: Photorealistic Single-image 3D Human Reconstruction using Cross-Scale Multiview Diffusion and Explicit Remeshing
  28. STBLLM: Breaking the 1-Bit Barrier with Structured Binary LLMs
  29. ThinkSound: Chain-of-Thought Reasoning in Multimodal LLMs for Audio Generation and Editing
  30. VidMuse: A Simple Video-to-Music Generation Framework with Long-Short-Term Modeling
  31. AttnZero: Efficient Attention Discovery for Vision Transformers
  32. Auto-GAS: Automated Proxy Discovery for Training-Free Generative Architecture Search
  33. ChatEval: Towards Better LLM-based Evaluators through Multi-Agent Debate
  34. ChatMusician: Understanding and Generating Music Intrinsically with LLM
  35. DetKDS: Knowledge Distillation Search for Object Detectors
  36. Dirichlet Continual Learning: Tackling Catastrophic Forgetting in NLP
  37. Discovering Sparsity Allocation for Layer-wise Pruning of Large Language Models
  38. Era3D: High-Resolution Multiview Diffusion using Efficient Row-wise Attention
  39. FM-OV3D: Foundation Model-Based Cross-Modal Knowledge Blending for Open-Vocabulary 3D Detection
  40. FastSAG: Towards Fast Non-Autoregressive Singing Accompaniment Generation
  41. FlashSpeech: Efficient Zero-Shot Speech Synthesis
  42. PyramidCodec: Hierarchical Codec for Long-form Music Generation in Audio Domain
  43. ViDA: Homeostatic Visual Domain Adapter for Continual Test Time Adaptation
  44. Weakly-Supervised Emotion Transition Learning for Diverse 3D Co-Speech Gesture Generation