PPaperPicks

Hao Tang

Peking University, National Key Laboratory for Multimedia Information Processing, Beijing, China

43 papers at tracked venues · 28 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. ICM-Fusion: In-Context Meta-Optimized LoRA Fusion for Multi-Task Adaptation
  2. TR-DQ: Time-Rotation Diffusion Quantization
  3. ARNet: Self-Supervised FG-SBIR with Unified Sample Feature Alignment and Multi-Scale Token Recycling
  4. Boosting Adversarial Transferability with Spatial Adversarial Alignment
  5. CRUISE: Cooperative Reconstruction and Editing in V2X Scenarios using Gaussian Splatting
  6. DiffFNO: Diffusion Fourier Neural Operator
  7. DynImg: Key Frames with Visual Prompts are Good Representation for Multi-Modal Video Understanding
  8. Enhancing Diffusion-based Unrestricted Adversarial Attacks via Adversary Preferences Alignment
  9. EventVAD: Training-Free Event-Aware Video Anomaly Detection
  10. FairSMOE: Mitigating Multi-Attribute Fairness Problem with Sparse Mixture-of-Experts
  11. From Redundancy to Relevance: Information Flow in LVLMs Across Reasoning Tasks
  12. In-Context Meta LoRA Generation
  13. MambaIC: State Space Models for High-Performance Learned Image Compression
  14. MaskSAM: Auto-Prompt SAM with Mask Classification for Volumetric Medical Image Segmentation
  15. PartRM: Modeling Part-Level Dynamics with Large Cross-State Reconstruction Model
  16. Q-TempFusion: Quantization-Aware Temporal Multi-Sensor Fusion on Bird's-Eye View Representation
  17. RobustMerge: Parameter-Efficient Model Merging for MLLMs with Direction Robustness
  18. Semantic-Guided Diffusion Model for Single-Step Image Super-Resolution
  19. Stable-Hair: Real-World Hair Transfer via Diffusion Model
  20. TTTFusion: A Test-Time Training-Based Strategy for Multimodal Medical Image Fusion in Surgical Robots
  21. Toward Adaptive Large Language Models Structured Pruning via Hybrid-grained Weight Importance Assessment
  22. Toward Zero-Shot Learning for Visual Dehazing of Urological Surgical Robots
  23. Towards Better Dental AI: A Multimodal Benchmark and Instruction Dataset for Panoramic X-ray Analysis
  24. UFO: A Unified Approach to Fine-grained Visual Perception via Open-ended Language Interface
    NeurIPS 2025 · Hao Tang
  25. 3D Weakly Supervised Semantic Segmentation with 2D Vision-Language Guidance
  26. CoIn: A Lightweight and Effective Framework for Story Visualization and Continuation
  27. ConsistentAvatar: Learning to Diffuse Fully Consistent Talking Head Avatar with Temporal Guidance
  28. Dataset Growth
  29. Distilling ODE Solvers of Diffusion Models into Smaller Steps
  30. G2P-DDM: Generating Sign Pose Sequence from Gloss Sequence with Discrete Diffusion Model
  31. GiT: Towards Generalist Vision Transformer Through Universal Language Interface
  32. HandDiff: 3D Hand Pose Estimation with Diffusion on Image-Point Cloud
  33. InstructGIE: Towards Generalizable Image Editing
  34. Motion Mamba: Efficient and Long Sequence Motion Generation
  35. On the Faithfulness of Vision Transformer Explanations
  36. Revisiting Adversarial Patches for Designing Camera-Agnostic Attacks against Person Detection
  37. SCP-Diff: Spatial-Categorical Joint Prior for Diffusion Based Semantic Image Synthesis
  38. SSR-Encoder: Encoding Selective Subject Representation for Subject-Driven Generation
  39. StoryImager: A Unified and Efficient Framework for Coherent Story Visualization and Completion
  40. Token Transformation Matters: Towards Faithful Post-Hoc Explanation for Vision Transformer
  41. Towards Online Real-Time Memory-based Video Inpainting Transformers
  42. Towards Robust 3D Pose Transfer with Adversarial Learning
  43. Versatile Navigation Under Partial Observability via Value-Guided Diffusion Policy