PPaperPicks

Weiming Hu

ShanghaiTech University, Shanghai, China

33 papers at tracked venues · 25 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. HDGS: Hierarchical Dynamic Gaussian Splatting for Urban Driving Scenes
  2. Integrating Diverse Assignment Strategies into DETRs
  3. MMhops-R1: Multimodal Multi-hop Reasoning
  4. Making MLLMs Blind: Adversarial Smuggling Attacks in MLLM Content Moderation
  5. CST Anti-UAV: A Thermal Infrared Benchmark for Tiny UAV Tracking in Complex Scenes
  6. DeepTAGE: Deep Temporal-Aligned Gradient Enhancement for Optimizing Spiking Neural Networks
  7. Each Complexity Deserves a Pruning Policy
  8. Height-Fidelity Dense Global Fusion for Multi-Modal 3D Object Detection
  9. MI-TRQR: Mutual Information-Based Temporal Redundancy Quantification and Reduction for Energy-Efficient Spiking Neural Networks
  10. Mitigating Hallucinations in Large Vision-Language Models by Self-Injecting Hallucinations
  11. NTIRE 2025 challenge on Text to Image Generation Model Quality Assessment
  12. Noise-Optimized Distribution Distillation for Dataset Condensation
  13. Online Segment Any 3D Thing as Instance Tracking
  14. Reversing Flow for Image Restoration
  15. SSTrack: Sample-interval Scheduling for Lightweight Visual Object Tracking
  16. SynCL: A Synergistic Training Strategy with Instance-Aware Contrastive Learning for End-to-End Multi-Camera 3D Tracking
  17. The Third Visual Object Tracking Segmentation VOTS2025 Challenge Results
  18. Towards More Discriminative Feature Learning in SNNs with Temporal-Self-Erasing Supervision
  19. VisionMath: Vision-Form Mathematical Problem-Solving
  20. Visual-Instructed Degradation Diffusion for All-in-One Image Restoration
  21. A-Teacher: Asymmetric Network for 3D Semi-Supervised Object Detection
  22. Animate3D: Animating Any 3D Model with Multi-view Video Diffusion
  23. BEV2PR: BEV-Enhanced Visual Place Recognition with Structural Cues
  24. Consistent4D: Consistent 360° Dynamic Object Generation from Monocular Video
  25. EA-VTR: Event-Aware Video-Text Retrieval
  26. How to Make Cross Encoder a Good Teacher for Efficient Image-Text Retrieval?
  27. MIBench: Evaluating Multimodal Large Language Models over Multiple Images
  28. MobileIQA: Exploiting Mobile-Level Diverse Opinion Network For No-Reference Image Quality Assessment Using Knowledge Distillation
  29. NFT1000: A Cross-Modal Dataset For Non-Fungible Token Retrieval
  30. PromptIQA: Boosting the Performance and Generalization for No-Reference Image Quality Assessment via Prompts
  31. STAG4D: Spatial-Temporal Anchored Generative 4D Gaussians
  32. Set Prediction Guided by Semantic Concepts for Diverse Video Captioning
  33. VQ-Map: Bird's-Eye-View Map Layout Estimation in Tokenized Discrete Space via Vector Quantization