PPaperPicks

Zitong Yu

35 papers at tracked venues · 24 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. FaceShield: Explainable Face Anti-Spoofing with Multimodal Large Language Models
  2. H-GAR: A Hierarchical Interaction Framework via Goal-Driven Observation-Action Refinement for Robotic Manipulation
  3. PA-FAS: Towards Interpretable and Generalizable Multimodal Face Anti-Spoofing via Path-Augmented Reinforcement Learning
  4. Retrieving to Recover: Towards Incomplete Audio-Visual Question Answering via Semantic-consistent Purification
  5. SUGAR: Learning Skeleton Representation with Visual-Motion Knowledge for Action Recognition
  6. When Eyes and Ears Disagree: Can MLLMs Discern Audio-Visual Confusion?
  7. BiMSRec: A Progressive Image Reconstruction Framework for Medical Image Fusion Guided by Multi-scale Deformation Fields
  8. CA-Edit: Causality-Aware Condition Adapter for High-Fidelity Local Facial Attribute Editing
  9. DADM: Dual Alignment of Domain and Modality for Face Anti-Spoofing
  10. Dynamic Analysis and Adaptive Discriminator for Fake News Detection
  11. Dynamic Collaboration of Multi-Language Models based on Minimal Complete Semantic Units
  12. EmoSym: A Symbiotic Framework for Unified Emotional Understanding and Generation via Latent Reasoning
  13. Enhancing Adversarial Transferability by Balancing Exploration and Exploitation with Gradient-Guided Sampling
  14. FEALLM: Advancing Facial Emotion Analysis in Multimodal Large Language Models with Emotional Synergy and Reasoning
  15. FSBench: A Figure Skating Benchmark for Advancing Artistic Sports Understanding
  16. Few-Shot Audio-Visual Class-Incremental Learning with Temporal Prompting and Regularization
  17. GM-DF: Generalized Multi-Scenario Deepfake Detection
  18. Kronecker Mask and Interpretive Prompts are Language-Action Video Learners
  19. MSAmba: Exploring Multimodal Sentiment Analysis with State Space Models
  20. MedIQA: A Scalable Foundation Model for Prompt-Driven Medical Image Quality Assessment
  21. MoEdit: On Learning Quantity Perception for Multi-object Image Editing
  22. Multimodal Fake News Detection: MFND Dataset and Shallow-Deep Multitask Learning
  23. Multiple Appropriate Facial Reaction Generation Based on Multi-View Transformation of Speaker Video
  24. Smooth Online Multiple Appropriate Facial Reaction Generation
  25. TRRG: Towards Truthful Radiology Report Generation With Cross-Modal Disease Clue Enhanced Large Language Models
  26. AUFormer: Vision Transformers Are Parameter-Efficient Facial Action Unit Detectors
  27. CAT: Enhancing Multimodal Large Language Model to Answer Questions in Dynamic Audio-Visual Scenarios
  28. DiffFAS: Face Anti-spoofing via Generative Diffusion Models
  29. Difflare: Removing Image Lens Flare with Latent Diffusion Models
  30. Facial Physiological and Emotional Analysis
    ACM MM 2024 · Zitong Yu
  31. GPT as Psychologist? Preliminary Evaluations for GPT-4V on Visual Affective Computing
  32. Generalized Face Anti-Spoofing via Finer Domain Partition and Disentangling Liveness-Irrelevant Factors
  33. HideMIA: Hidden Wavelet Mining for Privacy-Enhancing Medical Image Analysis
  34. MTaDCS: Moving Trace and Feature Density-Based Confidence Sample Selection Under Label Noise
  35. Suppress and Rebalance: Towards Generalized Multi-Modal Face Anti-Spoofing