PPaperPicks

Xianwei Zhuang

23 papers at tracked venues · 12 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Not All Tokens and Heads Are Equally Important: Dual-Level Attention Intervention for Hallucination Mitigation
  2. ATRI: Mitigating Multilingual Audio Text Retrieval Inconsistencies by Reducing Data Distribution Errors
  3. Can We Trust AI Doctors? A Survey of Medical Hallucination in Large Language and Large Vision-Language Models
  4. FoleyMaster: High-Quality Video-to-Audio Synthesis via MLLM-Augmented Prompt Tuning and Joint Semantic-Temporal Adaptation
  5. SpeechSEC: A Unified Multi-Task Framework for Speech Synthesis, Editing, and Continuation
  6. UniCoTT: A Unified Framework for Structural Chain-of-Thought Distillation
    ICLR 2025 · Xianwei Zhuang
  7. VASparse: Towards Efficient Visual Hallucination Mitigation via Visual-Aware Token Sparsification
    CVPR 2025 · Xianwei Zhuang
  8. Code-Switching Can be Better Aligners: Advancing Cross-Lingual SLU through Representation-Level and Prediction-Level Alignment
  9. Cyclical Contrastive Learning Based on Geodesic for Zero-shot Cross-lingual Spoken Language Understanding
  10. Dual-oriented Disentangled Network with Counterfactual Intervention for Multimodal Intent Detection
  11. GPA: Global and Prototype Alignment for Audio-Text Retrieval
  12. Game on Tree: Visual Hallucination Mitigation via Coarse-to-Fine View Tree and Game Theory
    EMNLP 2024 · Xianwei Zhuang
  13. KDProR: A Knowledge-Decoupling Probabilistic Framework for Video-Text Retrieval
    ECCV 2024 · Xianwei Zhuang
  14. MaCSC: Towards Multimodal-augmented Pre-trained Language Models via Conceptual Prototypes and Self-balancing Calibration
    NAACL 2024 · Xianwei Zhuang
  15. MoE-SLU: Towards ASR-Robust Spoken Language Understanding via Mixture-of-Experts
  16. PCAD: Towards ASR-Robust Spoken Language Understanding via Prototype Calibration and Asymmetric Decoupling
    ACL 2024 · Xianwei Zhuang
  17. Relevance Is a Guiding Light: Relevance-aware Adaptive Learning for End-to-end Task-oriented Dialogue System
  18. TFCD: Towards Multi-modal Sarcasm Detection via Training-Free Counterfactual Debiasing
  19. Towards Explainable Joint Models via Information Theory for Multiple Intent Detection and Slot Filling
    AAAI 2024 · Xianwei Zhuang
  20. Towards Multi-Intent Spoken Language Understanding via Hierarchical Attention and Optimal Transport
  21. Towards Multimodal-augmented Pre-trained Language Models via Self-balanced Expectation-Maximization Iteration
    ACM MM 2024 · Xianwei Zhuang
  22. Uncertainty-Aware Sign Language Video Retrieval with Probability Distribution Modeling
  23. What are the Generator Preferences for End-to-end Task-Oriented Dialog System?