PPaperPicks

Di Huang

Beihang University, School of Computer Science and Engineering, Beijing, China

25 papers at tracked venues · 20 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. RMAdapter: Reconstruction-based Multi-Modal Adapter for Vision-Language Models
  2. SceneGenesis: 3D Scene Synthesis via Semantic Structural Priors and Mesh-Guided Video-Geometry Fusion
  3. 3D²-Actor: Learning Pose-Conditioned 3D-Aware Denoiser for Realistic Gaussian Avatar Modeling
  4. APHQ-ViT: Post-Training Quantization with Average Perturbation Hessian Based Reconstruction for Vision Transformers
  5. Attend and Replay: Efficient Action Understanding in Long Videos via Mechanistic Interpretability
  6. CoSDH: Communication-Efficient Collaborative Perception via Supply-Demand Awareness and Intermediate-Late Hybridization
  7. Diffusion-4K: Ultra-High-Resolution Image Synthesis with Latent Diffusion Models
  8. Implicit Modeling for Transferability Estimation of Vision Foundation Models
  9. Micro-macro Wavelet-based Gaussian Splatting for 3D Reconstruction from Unconstrained Images
  10. Progressive Parameter Efficient Transfer Learning for Semantic Segmentation
  11. ShortFT: Diffusion Model Alignment via Shortcut-Based Fine-Tuning
  12. Test-Time Adaptive Object Detection with Foundation Model
  13. Towards Training-free Anomaly Detection with Vision and Language Foundation Models
  14. Unveiling the Knowledge of CLIP for Training-Free Open-Vocabulary Semantic Segmentation
  15. Active Perception for Grasp Detection via Neural Graspness Field
  16. AdaLog: Post-training Quantization for Vision Transformers with Adaptive Logarithm Quantizer
  17. Align-DETR: Enhancing End-to-end Object Detection with Aligned Loss
  18. Crowd-SAM: SAM as a Smart Annotator for Object Detection in Crowded Scenes
  19. Generalizing 6-DoF Grasp Detection via Domain Prior Knowledge
  20. Initno: Boosting Text-to-Image Diffusion Models via Initial Noise Optimization
  21. Multi-modal Relation Distillation for Unified 3D Representation Learning
  22. PS-TTL: Prototype-based Soft-labels and Test-Time Learning for Few-shot Object Detection
  23. Rotation Has Two Sides: Evaluating Data Augmentation for Deep One-class Classification
  24. Sim-to-Real Grasp Detection with Global-to-Local RGB-D Adaptation
  25. Transforming Vision Transformer: Towards Efficient Multi-Task Asynchronous Learner