PPaperPicks

Rongjie Huang

Zhejiang University, College of Computer Science and Software, Hangzhou, China

36 papers at tracked venues · 33 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Masked Text-to-Audio Flow-Matching and Reward Feedback Optimization
    ACL 2026 · Rongjie Huang
  2. FlashAudio: Rectified Flow for Fast and High-Fidelity Text-to-Audio Generation
  3. Integrating Audio, Visual, and Semantic Information for Enhanced Multimodal Speaker Diarization on Multi-party Conversation
  4. Lumina-T2X: Scalable Flow-based Large Diffusion Transformer for Flexible Resolution Generation
  5. MelodyEdit: Zero-shot Music Editing with Disentangled Inversion Control
  6. OmniAudio: Generating Spatial Audio from 360-Degree Video
  7. OmniBind: Large-scale Omni Multimodal Representation via Binding Spaces
  8. OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup
  9. TechSinger: Technique Controllable Multilingual Singing Voice Synthesis via Flow Matching
  10. Versatile Framework for Song Generation with Prompt-based Control
  11. VoxDialogue: Can Spoken Dialogue Systems Understand Information Beyond Words?
  12. WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling
  13. AudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head
    AAAI 2024 · Rongjie Huang
  14. AudioLCM: Efficient and High-Quality Text-to-Audio Generation with Minimal Inference Steps
  15. Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers
  16. Extending Multi-modal Contrastive Representations
  17. FreeBind: Free Lunch in Unified Multimodal Space via Knowledge Fusion
  18. Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching
  19. InstructSpeech: Following Speech Editing Instructions via Large Language Models
    ICML 2024 · Rongjie Huang
  20. Lumina-Next : Making Lumina-T2X Stronger and Faster with Next-DiT
  21. Make-A-Voice: Revisiting Voice Large Language Models as Scalable Multilingual and Multitask Learners
    ACL 2024 · Rongjie Huang
  22. MimicTalk: Mimicking a personalized and expressive 3D talking face in minutes
  23. MoMu-Diffusion: On Learning Long-Term Motion-Music Synchronization and Correspondence
  24. Prompt-Singer: Controllable Singing-Voice-Synthesis with Natural Language Prompt
  25. Real3D-Portrait: One-shot Realistic 3D Talking Portrait Synthesis
  26. Robust Singing Voice Transcription Serves Synthesis
  27. Self-Supervised Singing Voice Pre-Training towards Speech-to-Singing Conversion
  28. Speech-to-Speech Translation with Discrete-Unit-Based Style Transfer
  29. StyleSinger: Style Transfer for Out-of-Domain Singing Voice Synthesis
  30. TCSinger: Zero-Shot Singing Voice Synthesis with Style Transfer and Multi-Level Style Control
  31. Text-to-Song: Towards Controllable Music Generation Incorporating Vocal and Accompaniment
  32. TransFace: Unit-Based Audio-Visual Speech Synthesizer for Talking Head Translation
  33. UniAudio 1.5: Large Language Model-Driven Audio Codec is A Few-Shot Audio Task Learner
  34. UniAudio: Towards Universal Audio Generation with Large Language Models
  35. VoiceTuner: Self-Supervised Pre-training and Efficient Fine-tuning For Voice Generation
    ACM MM 2024 · Rongjie Huang
  36. Wav2SQL: Direct Generalizable Speech-To-SQL Parsing