PPaperPicks

Xu Tan

Microsoft Research Asia, Beijing, China

37 papers at tracked venues · 28 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Pause or Fabricate? Training Language Models for Grounded Reasoning
  2. Think Then Rewrite: Reasoning Enhanced Query Rewriting for Domain Specific Retrieval
  3. Towards Fine-Grained and Multi-Granular Contrastive Language-Speech Pre-training
  4. UI-Copilot: Advancing Long-Horizon GUI Automation via Tool-Integrated Policy Optimization
  5. ALMTokenizer: A Low-bitrate and Semantic-rich Audio Codec Tokenizer for Audio Language Modeling
  6. CLaMP 2: Multimodal Music Information Retrieval Across 101 Languages Using Large Language Models
  7. Chain-of-Model Learning for Language Model
  8. Codec Does Matter: Exploring the Semantic Shortcoming of Codec for Audio Language Model
  9. EASYTOOL: Enhancing LLM-based Agents with Concise Tool Instruction
  10. EvoAgent: Towards Automatic Multi-Agent Generation via Evolutionary Algorithms
  11. GETMusic: Generating Music Tracks with a Unified Representation and Diffusion Framework
  12. InstructAvatar: Text-Guided Emotion and Motion Control for Avatar Generation
  13. MoonCast: High-Quality Zero-Shot Podcast Generation
  14. MuPT: A Generative Symbolic Music Pretrained Transformer
  15. The Best of Both Worlds: Integrating Language Models and Diffusion Models for Video Generation
  16. VidMuse: A Simple Video-to-Music Generation Framework with Long-Short-Term Modeling
  17. Connecting Large Language Models with Evolutionary Algorithms Yields Powerful Prompt Optimizers
  18. Contrastive Context-Speech Pretraining for Expressive Text-to-Speech Synthesis
  19. D-CPT Law: Domain-specific Continual Pre-Training Scaling Law for Large Language Models
  20. Empowering Diffusion Models on the Embedding Space for Text Generation
  21. FastSAG: Towards Fast Non-Autoregressive Singing Accompaniment Generation
  22. FlashSpeech: Efficient Zero-Shot Speech Synthesis
  23. GAIA: Zero-shot Talking Avatar Generation
  24. Mitigating Reversal Curse in Large Language Models via Semantic-aware Permutation Training
  25. NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers
  26. NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models
  27. Predictor-Corrector Enhanced Transformers with Exponential Moving Average Coefficient Learning
  28. PromptTTS 2: Describing and Generating Voices with Text Prompt
  29. PyramidCodec: Hierarchical Codec for Long-form Music Generation in Audio Domain
  30. Re-creation of Creations: A New Paradigm for Lyric-to-Melody Generation
  31. Regeneration Learning: A Learning Paradigm for Data Generation
    AAAI 2024 · Xu Tan
  32. Sentence-Level or Token-Level? A Comprehensive Study on Knowledge Distillation
  33. TaskBench: Benchmarking Large Language Models for Task Automation
  34. TiVA: Time-Aligned Video-to-Audio Generation
  35. UniAudio 1.5: Large Language Model-Driven Audio Codec is A Few-Shot Audio Task Learner
  36. UniAudio: Towards Universal Audio Generation with Large Language Models
  37. UniStyle: Unified Style Modeling for Speaking Style Captioning and Stylistic Speech Synthesis