PPaperPicks

Meng Wang

Hefei University of Technology, China

83 papers at tracked venues · 72 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. BalDRO: A Distributionally Robust Optimization based Framework for Large Language Model Unlearning
  2. Benchmarking Trustworthiness in Multimodal LLMs for Video Understanding
  3. FilmWeaver: Weaving Consistent Multi-Shot Videos with Cache-Guided Autoregressive Diffusion
  4. Generating Realistic Human Mobility Data with Hybrid Large Language Model Agent
  5. Modeling Stage-wise Evolution of User Interests for News Recommendation
  6. Multi-Agent Debate based Concept Augmentation for Enhanced Cognitive Diagnosis
  7. Post-hoc Provider Fairness Adaptation via Hierarchical Exposure Alignment
  8. Psyche-R1: Towards Reliable Psychological LLMs through Unified Empathy, Expertise, and Reasoning
  9. RMBRec: Robust Multi-Behavior Recommendation towards Target Behaviors
  10. RecCocktail: A Generalizable and Efficient Framework for LLM-Based Recommendation
  11. RipAlert: A Future-Frame-Aware Framework for Rip Current Forecasting and Early Alerting
    AAAI 2026 · Meng Wang
  12. Sparse-Scale Transformer with Bidirectional Awareness for Time Series Forecasting
  13. Understanding and Mitigating Spurious Signal Amplification in Test-Time Reinforcement Learning for Math Reasoning
  14. WebUncertainty: Dual-Level Uncertainty Driven Planning and Reasoning For Autonomous Web Agent
  15. XInsight: Integrative Stage-Consistent Psychological Counseling Support Agents for Digital Well-Being
  16. ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
  17. Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark
  18. Beyond General Alignment: Fine-Grained Entity-Centric Image-Text Matching with Multimodal Attentive Experts
  19. Boosting Adversarial Transferability via Residual Perturbation Attack
  20. EgoBlind: Towards Egocentric Visual Assistance for the Blind
  21. EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
  22. Exploring Heterogeneity and Uncertainty for Graph-based Cognitive Diagnosis Models in Intelligent Education
  23. Fair Personalized Learner Modeling Without Sensitive Attributes
  24. FakeDiffer: Distributional Disparity Learning on Differentiated Reconstruction for Face Forgery Detection
  25. Generalizable Engagement Estimation in Conversation via Domain Prompting and Parallel Attention
  26. Gt-Mean Loss: a Simple Yet Effective Solution for Brightness Mismatch in Low-Light Image Enhancement
  27. I3-MRec: Invariant Learning with Information Bottleneck for Incomplete Modality Recommendation
  28. Invariance Matters: Empowering Social Recommendation via Graph Invariant Learning
  29. Knowledge Swapping via Learning and Unlearning
  30. Learning from Heterogeneity: Generalizing Dynamic Facial Expression Recognition via Distributionally Robust Optimization
  31. Listening to the Unspoken: Exploring '365' Aspects of Multimodal Interview Performance Assessment
  32. MAC 2025: The 2nd Micro-Action Analysis Grand Challenge
  33. MMAD: Multi-Label Micro-Action Detection in Videos
  34. MOL-Mamba: Enhancing Molecular Representation with Structural & Electronic Insights
  35. Motion Matters: Motion-guided Modulation Network for Skeleton-based Micro-Action Recognition
  36. Navigating Semantic Drift in Task-Agnostic Class-Incremental Learning
  37. One Stone with Two Birds: A Null-Text-Null Frequency-Aware Diffusion Models for Text-Guided Image Inpainting
  38. PhysDiff: Physiology-based Dynamicity Disentangled Diffusion Model for Remote Physiological Measurement
  39. Precise Localization of Memories: A Fine-grained Neuron-level Knowledge Editing Technique for LLMs
  40. Prototypical Calibrating Ambiguous Samples for Micro-Action Recognition
  41. RIFNet: Bridging Modalities for Accurate and Detailed Ocular Disease Analysis
  42. Reproducibility Companion Paper: Maskable Retentive Network for Video Moment Retrieval
  43. RetBench: Which Ophthalmic Foundation Model Performs Best and Why?
  44. Revisiting Audio-Visual Segmentation with Vision-Centric Transformer
  45. TASAR: Transfer-based Attack on Skeletal Action Recognition
  46. Towards Efficient General Feature Prediction in Masked Skeleton Modeling
  47. Towards Micro-Action Recognition with Limited Annotations: An Asynchronous Pseudo Labeling and Training Approach
  48. Towards Open-Vocabulary Audio-Visual Event Localization
  49. Traits Run Deep: Enhancing Personality Assessment via Psychology-Guided LLM Representations and Multimodal Apparent Behaviors
  50. VAEmo: Efficient Representation Learning for Visual-Audio Emotion With Knowledge Injection
  51. VSumMamba: Mamba Empowered Efficient Video Summarization with Multi-Scale Spatial-Temporal Modeling
  52. Visual-Oriented Fine-Grained Knowledge Editing for MultiModal Large Language Models
  53. A Coarse to Fine Detection Method for Prohibited Object in X-ray Images Based on Progressive Transformer Decoder
  54. A Dual-Way Enhanced Framework from Text Matching Point of View for Multimodal Entity Linking
  55. Cluster-Phys: Facial Clues Clustering Towards Efficient Remote Physiological Measurement
  56. Collaborative-Enhanced Prediction of Spending on Newly Downloaded Mobile Games under Consumption Uncertainty
  57. DAT: Dialogue-Aware Transformer with Modality-Group Fusion for Human Engagement Estimation
  58. Data-Free Quantization via Pseudo-label Filtering
  59. Diffusion-Based Cloud-Edge-Device Collaborative Learning for Next POI Recommendations
  60. Dual Cross-Stage Partial Learning for Detecting Objects in Dehazed Images
  61. Emotional Synchronization for Audio-Driven Talking-Head Generation
  62. Enhancing Large Foundation Models to Identify Fundus Diseases Based on Contrastive Enhanced Low-Rank Adaptation Prompt
    MICCAI 2024 · Meng Wang
  63. EulerMormer: Robust Eulerian Motion Magnification via Dynamic Filtering within Transformer
  64. Finding and Editing Multi-Modal Neurons in Pre-Trained Transformers
  65. Frequency Decoupling for Motion Magnification Via Multi-Level Isomorphic Architecture
  66. Graph Bottlenecked Social Recommendation
  67. KPA-Tracker: Towards Robust and Real-Time Category-Level Articulated Object 6D Pose Tracking
  68. Label-Anticipated Event Disentanglement for Audio-Visual Video Parsing
  69. Large Language Model-driven Meta-structure Discovery in Heterogeneous Information Network
  70. Lightweight Embeddings for Graph Collaborative Filtering
  71. MAC 2024: Micro-Action Analysis Grand Challenge
  72. Maskable Retentive Network for Video Moment Retrieval
  73. Mixed Attention Network for Cross-domain Sequential Recommendation
  74. Multimodality Invariant Learning for Multimedia-Based New Item Recommendation
  75. OSIC: A New One-Stage Image Captioner Coined
  76. Object-Aware Adaptive-Positivity Learning for Audio-Visual Question Answering
  77. Path-Specific Causal Reasoning for Fairness-aware Cognitive Diagnosis
  78. Popularity-Aware Alignment and Contrast for Mitigating Popularity Bias
  79. Region-Native Visual Tokenization
    ECCV 2024 · Meng Wang
  80. Revisiting the Power of Prompt for Visual Tuning
  81. Structure Matters: Tackling the Semantic Discrepancy in Diffusion Models for Image Inpainting
  82. Temporal Sentence Grounding with Relevance Feedback in Videos
  83. Training A Small Emotional Vision Language Model for Visual Art Comprehension