PPaperPicks

Yongqi Wang

22 papers at tracked venues · 20 at CORE A* · active 20242025

Venues

Frequent coauthors

Papers

  1. Cross-Modal Facial Expression Recognition with Global Channel-Spatial Attention: Modal Enhancement and Proportional Criterion Fusion
  2. Dual-Stage Cross-Modal Network with Dynamic Feature Fusion for Emotional Mimicry Intensity Estimation
  3. Interactive Multimodal Framework with Temporal Modeling for Emotion Recognition
  4. K2: On Optimizing Distributed Transactions in a Multi-region Data Store with True-time Clocks
  5. METOR: A Unified Framework for Mutual Enhancement of Objects and Relationships in Open-vocabulary Video Visual Relationship Detection
    IJCAI 2025 · Yongqi Wang
  6. Robust Stage-Wise LVLM Adaptation: Multi-Phase Prompt Lora Fine-tuning for Compound Expression Recognition
  7. TechSinger: Technique Controllable Multilingual Singing Voice Synthesis via Flow Matching
  8. Towards Robust Multimodal AU Detection: STN-Enhanced Visual Encoding and Audio-Visual Spatial-Temporal Alignment
  9. AUD-TGN: Advancing Action Unit Detection with Temporal Convolution and GPT-2 in Wild Audiovisual Contexts
  10. Exploring Facial Expression Recognition through Semi-Supervised Pre-training and Temporal Modeling
  11. Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching
    NeurIPS 2024 · Yongqi Wang
  12. Improving Valence-Arousal Estimation with Spatiotemporal Relationship Learning and Multimodal Fusion
  13. InstructSpeech: Following Speech Editing Instructions via Large Language Models
  14. Make-A-Voice: Revisiting Voice Large Language Models as Scalable Multilingual and Multitask Learners
  15. MoMu-Diffusion: On Learning Long-Term Motion-Music Synchronization and Correspondence
  16. Multi-Modal Prompting for Open-Vocabulary Video Visual Relationship Detection
  17. Prompt-Singer: Controllable Singing-Voice-Synthesis with Natural Language Prompt
    NAACL 2024 · Yongqi Wang
  18. Robust Singing Voice Transcription Serves Synthesis
  19. Self-Supervised Singing Voice Pre-Training towards Speech-to-Singing Conversion
  20. Speech-to-Speech Translation with Discrete-Unit-Based Style Transfer
    ACL 2024 · Yongqi Wang
  21. Text-to-Song: Towards Controllable Music Generation Incorporating Vocal and Accompaniment
  22. VoiceTuner: Self-Supervised Pre-training and Efficient Fine-tuning For Voice Generation