PPaperPicks

Yuexian Zou

38 papers at tracked venues · 21 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Not All Tokens and Heads Are Equally Important: Dual-Level Attention Intervention for Hallucination Mitigation
  2. WhisperDiari: A Whisper-Based Speaker Diarization Framework in Token Space Leveraging Semantic and Speaker Information for Better Text Adaptability
  3. ATRI: Mitigating Multilingual Audio Text Retrieval Inconsistencies by Reducing Data Distribution Errors
  4. Advancing General Multimodal Capability of Vision-language Models with Pyramid-descent Visual Position Encoding
  5. FoleyMaster: High-Quality Video-to-Audio Synthesis via MLLM-Augmented Prompt Tuning and Joint Semantic-Temporal Adaptation
  6. Image Conductor: Precision Control for Interactive Video Synthesis
  7. SpeechSEC: A Unified Multi-Task Framework for Speech Synthesis, Editing, and Continuation
  8. UniCoTT: A Unified Framework for Structural Chain-of-Thought Distillation
  9. VASparse: Towards Efficient Visual Hallucination Mitigation via Visual-Aware Token Sparsification
  10. AFL-Net: Integrating Audio, Facial, and Lip Modalities with a Two-step Cross-attention for Robust Speaker Diarization in the Wild
  11. Aligner²: Enhancing Joint Multiple Intent Detection and Slot Filling via Adjustive and Forced Cross-Task Alignment
  12. Audio-text Retrieval with Transformer-based Hierarchical Alignment and Disentangled Cross-modal Representation
  13. AudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head
  14. Code-Switching Can be Better Aligners: Advancing Cross-Lingual SLU through Representation-Level and Prediction-Level Alignment
  15. Cyclical Contrastive Learning Based on Geodesic for Zero-shot Cross-lingual Spoken Language Understanding
  16. Dance with Labels: Dual-Heterogeneous Label Graph Interaction for Multi-intent Spoken Language Understanding
  17. DiffATR: Diffusion-based Generative Modeling for Audio-Text Retrieval
  18. Dual-oriented Disentangled Network with Counterfactual Intervention for Multimodal Intent Detection
  19. Embracing Language Inclusivity and Diversity in CLIP through Continual Language Learning
  20. Exploiting Auxiliary Caption for Video Grounding
  21. GPA: Global and Prototype Alignment for Audio-Text Retrieval
  22. Game on Tree: Visual Hallucination Mitigation via Coarse-to-Fine View Tree and Game Theory
  23. Generating More Audios for End-to-End Spoken Language Understanding
  24. KDProR: A Knowledge-Decoupling Probabilistic Framework for Video-Text Retrieval
  25. Learning to Match Representations is Better for End-to-End Task-Oriented Dialog System
  26. MaCSC: Towards Multimodal-augmented Pre-trained Language Models via Conceptual Prototypes and Self-balancing Calibration
  27. MoE-SLU: Towards ASR-Robust Spoken Language Understanding via Mixture-of-Experts
  28. On the Worst Prompt Performance of Large Language Models
  29. PCAD: Towards ASR-Robust Spoken Language Understanding via Prototype Calibration and Asymmetric Decoupling
  30. Relevance Is a Guiding Light: Relevance-aware Adaptive Learning for End-to-end Task-oriented Dialogue System
  31. Retrieval is Accurate Generation
  32. Robust Heterophily Graph Learning via Uniformity Augmentation
  33. SaLa: Scenario-aware Label Graph Interaction for Multi-intent Spoken Language Understanding
  34. Soul-Mix: Enhancing Multimodal Machine Translation with Manifold Mixup
  35. Towards Explainable Joint Models via Information Theory for Multiple Intent Detection and Slot Filling
  36. Towards Multi-Intent Spoken Language Understanding via Hierarchical Attention and Optimal Transport
  37. Towards Multimodal-augmented Pre-trained Language Models via Self-balanced Expectation-Maximization Iteration
  38. What are the Generator Preferences for End-to-end Task-Oriented Dialog System?