PPaperPicks

Hang Xu

Huawei Noah's Ark Lab, Shanghai, China

42 papers at tracked venues · 31 at CORE A* · active 20242025

Venues

Frequent coauthors

Papers

  1. 4D-VLA: Spatiotemporal Vision-Language-Action Pretraining with Cross-Scene Calibration
  2. ACE: Anti-Editing Concept Erasure in Text-to-Image Models
  3. Adaptive Dropout: Unleashing Dropout across Layers for Generalizable Image Super-Resolution
    CVPR 2025 · Hang Xu
  4. DisCo: Discovering Common Affordance from Large Models for Actionable Part Perception
  5. EDEN: Enhanced Diffusion for High-quality Large-motion Video Frame Interpolation
  6. FramePainter: Endowing Interactive Image Editing with Video Diffusion Priors
  7. FreeDNA: Endowing Domain Adaptation of Diffusion-Based Dense Prediction with Training-Free Domain Noise Alignment
    ICCV 2025 · Hang Xu
  8. FreqPrior: Improving Video Diffusion Models with Frequency Filtering Gaussian Noise
  9. From Flatland to Space: Teaching Vision-Language Models to Perceive and Reason in 3D
  10. G-LLaVA: Solving Geometric Problem with Multi-Modal Large Language Model
  11. Getting More Juice Out of Your Data: Hard Pair Refinement Enhances Visual-Language Models Without Extra Data
  12. HiRes-LLaVA: Restoring Fragmentation Input in High-Resolution Large Vision-Language Models
  13. ILLUME: Illuminating Your LLMs to See, Draw, and Self-Enhance
  14. INST-IT: Boosting Instance Understanding via Explicit Visual Prompt Instruction Tuning
  15. SeePhys: Does Seeing Help Thinking? - Benchmarking Vision-Based Physics Reasoning
  16. Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization
  17. UniGS: Unified Language-Image-3D Pretraining with Gaussian Splatting
  18. VTimeCoT: Thinking by Drawing for Video Temporal Grounding and Reasoning
  19. Any-Size-Diffusion: Toward Efficient Text-Driven Synthesis for Any-Size HD Images
  20. CorNav: Autonomous Agent with Self-Corrected Planning for Zero-Shot Vision-and-Language Navigation
  21. DetCLIPv3: Towards Versatile Generative Open-Vocabulary Object Detection
  22. DreamControl: Control-Based Text-to-3D Generation with 3D Self-Prior
  23. Eyes Closed, Safety on: Protecting Multimodal LLMs via Image-to-Text Transformation
  24. Fuse Your Latents: Video Editing with Multi-source Latent Diffusion Models
  25. Gaining Wisdom from Setbacks: Aligning Large Language Models via Mistake Analysis
  26. Holistic Autonomous Driving Understanding by Bird'View Injected Multi-Modal Large Models
  27. HumanRefiner: Benchmarking Abnormal Human Generation and Refining with Coarse-to-Fine Pose-Reversible Guidance
  28. Implicit Concept Removal of Diffusion Models
  29. Ins-DetCLIP: Aligning Detection Model to Follow Human-Language Instruction
  30. JointDreamer: Ensuring Geometry Consistency and Text Congruence in Text-to-3D Generation via Joint Score Distillation
  31. LaneGraph2Seq: Lane Topology Extraction with Language Model via Vertex-Edge Encoding and Connectivity Enhancement
  32. LayerDiff: Exploring Text-Guided Multi-layered Composable Image Synthesis via Layer-Collaborative Diffusion Model
  33. MagDiff: Multi-alignment Diffusion for High-Fidelity Video Generation and Editing
  34. OpenOcc: Open Vocabulary 3D Scene Reconstruction via Occupancy Representation
  35. PIVOT-R: Primitive-Driven Waypoint-Aware World Model for Robotic Manipulation
  36. PanGu-Draw: Advancing Resource-Efficient Text-to-Image Synthesis with Time-Decoupled Training and Reusable Coop-Diffusion
  37. Reason2Drive: Towards Interpretable and Chain-Based Reasoning for Autonomous Driving
  38. Self-Adaptive Reality-Guided Diffusion for Artifact-Free Super-Resolution
  39. SlowFocus: Enhancing Fine-grained Temporal Understanding in Video LLM
  40. TextField3D: Towards Enhancing Open-Vocabulary 3D Generation with Noisy Text Fields
  41. UNIT: Unifying Image and Text Recognition in One Vision Encoder
  42. VidMan: Exploiting Implicit Dynamics from Video Diffusion Model for Effective Robot Manipulation