PPaperPicks

Dan Guo

Hefei University of Technology, Hefei, China

40 papers at tracked venues · 38 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. A Closer Look at Knowledge Distillation in Spiking Neural Network Training
  2. AgentMental: An Interactive Multi-Agent Framework for Explainable and Adaptive Mental Health Assessment
  3. Bidirectional Counterfactual Distillation for Review-Based Recommendation
  4. CLASP: Cross-modal Salient Anchor-based Semantic Propagation for Weakly-supervised Dense Audio-Visual Event Localization
  5. LinProVSR: Linguistics-Knowledge Guided Progressive Disambiguation Network for Visual Speech Recognition
  6. Psyche-R1: Towards Reliable Psychological LLMs through Unified Empathy, Expertise, and Reasoning
  7. SIAM: Towards Generalizable Articulated Object Modeling via Single Robot-Object Interaction
  8. XInsight: Integrative Stage-Consistent Psychological Counseling Support Agents for Digital Well-Being
  9. ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
  10. AugRefer: Advancing 3D Visual Grounding via Cross-Modal Augmentation and Spatial Relation-based Referring
  11. DFGAP: Towards Depth-Free Cross-Category GAParts Perception via Uncertainty-Quantified Modeling
  12. Dense Audio-Visual Event Localization Under Cross-Modal Consistency and Multi-Temporal Granularity Collaboration
  13. Discrete to Continuous: Generating Smooth Transition Poses from Sign Language Observations
  14. EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
  15. Learning from Heterogeneity: Generalizing Dynamic Facial Expression Recognition via Distributionally Robust Optimization
  16. MAC 2025: The 2nd Micro-Action Analysis Grand Challenge
  17. MMAD: Multi-Label Micro-Action Detection in Videos
  18. MOL-Mamba: Enhancing Molecular Representation with Structural & Electronic Insights
  19. Moderating the Generalization of Score-Based Generative Model
  20. Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing
  21. NTIRE 2025 Challenge on Low Light Image Enhancement: Methods and Results
  22. Patch-level Sounding Object Tracking for Audio-Visual Question Answering
  23. PhysDiff: Physiology-based Dynamicity Disentangled Diffusion Model for Remote Physiological Measurement
  24. Prototypical Calibrating Ambiguous Samples for Micro-Action Recognition
  25. Reproducibility Companion Paper: Maskable Retentive Network for Video Moment Retrieval
  26. Sign-IDD: Iconicity Disentangled Diffusion for Sign Language Production
  27. Towards Open-Vocabulary Audio-Visual Event Localization
  28. Cluster-Phys: Facial Clues Clustering Towards Efficient Remote Physiological Measurement
  29. Data-Free Quantization via Pseudo-label Filtering
  30. EulerMormer: Robust Eulerian Motion Magnification via Dynamic Filtering within Transformer
  31. Frequency Decoupling for Motion Magnification Via Multi-Level Isomorphic Architecture
  32. KPA-Tracker: Towards Robust and Real-Time Category-Level Articulated Object 6D Pose Tracking
  33. Label-Anticipated Event Disentanglement for Audio-Visual Video Parsing
  34. MAC 2024: Micro-Action Analysis Grand Challenge
    ACM MM 2024 · Dan Guo
  35. Maskable Retentive Network for Video Moment Retrieval
  36. Object-Aware Adaptive-Positivity Learning for Audio-Visual Question Answering
  37. Text-Based Occluded Person Re-identification via Multi-Granularity Contrastive Consistency Learning
  38. The Ninth NTIRE 2024 Efficient Super-Resolution Challenge Report
  39. Towards Understanding Future: Consistency Guided Probabilistic Modeling for Action Anticipation
  40. Training A Small Emotional Vision Language Model for Visual Art Comprehension