PPaperPicks

Mengmeng Wang

Zhejiang University, Laboratory of Advanced Perception on Robotics and Intelligent Learning, Hangzhou, China

22 papers at tracked venues · 16 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Improving Region Representation Learning from Urban Imagery with Noisy Long-Caption Supervision
  2. Action Detail Matters: Refining Video Recognition with Local Action Queries
    CVPR 2025 · Mengmeng Wang
  3. DynaMind: Reasoning over Abstract Video Dynamics for Embodied Decision-Making
  4. EchoGPT: An Interactive Cardiac Function Assessment Model for Echocardiogram Videos
  5. Instructing Text-to-Image Diffusion Models via Classifier-Guided Semantic Optimization
  6. LLM-TPF: Multiscale Temporal Periodicity-Semantic Fusion LLMs for Time Series Forecasting
  7. Manifold Constraint Reduces Exposure Bias in Accelerated Diffusion Sampling
  8. MonoLift: Learning 3D Manipulation Policies from Monocular RGB via Distillation
  9. SpotActor: Training-Free Layout-Controlled Consistent Image Generation
  10. TrackAny3D: Transferring Pretrained 3D Models for Category-Unified 3D Point Cloud Tracking
    ICCV 2025 · Mengmeng Wang
  11. TriCLIP-3D: A Unified Parameter-Efficient Framework for Tri-Modal 3D Visual Grounding based on CLIP
  12. VidEvo: Evolving Video Editing through Exhaustive Temporal Modeling
  13. A Multimodal, Multi-Task Adapting Framework for Video Action Recognition
    AAAI 2024 · Mengmeng Wang
  14. A Robotic-centric Paradigm for 3D Human Tracking Under Complex Environments Using Multi-modal Adaptation
  15. Decentralized Riemannian Conjugate Gradient Method on the Stiefel Manifold
  16. Flipped Classroom: Aligning Teacher Attention with Student in Generalized Category Discovery
  17. Generating Action-conditioned Prompts for Open-vocabulary Video Action Recognition
  18. Multi-modal 3D Human Tracking for Robots in Complex Environment with Siamese Point-Video Transformer
  19. OneActor: Consistent Subject Generation via Cluster-Conditioned Guidance
  20. SDSTrack: Self-Distillation Symmetric Adapter Learning for Multi-Modal Visual Object Tracking
  21. SSMG: Spatial-Semantic Map Guided Diffusion Model for Free-Form Layout-to-Image Generation
  22. Schedule Your Edit: A Simple yet Effective Diffusion Noise Schedule for Image Editing