PPaperPicks

Hanwang Zhang

61 papers at tracked venues · 56 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. DEPO: Dual-Efficiency Preference Optimization for LLM Agents
  2. DragNeXt: Rethinking Drag-Based Image Editing
  3. Hierarchical Semantic Alignment for Image Clustering
  4. Learning to Animate Images from A Few Videos to Portray Delicate Human Actions
  5. NeuSpring: Neural Spring Fields for Reconstruction and Simulation of Deformable Objects from Videos
  6. Object Fusion via Diffusion Time-step for Customized Image Editing with Single Example
  7. Personalize Your Gaussian: Consistent 3D Scene Personalization from a Single Image
  8. Pushing Rendering Boundaries: Hard Gaussian Splatting
  9. 3D Question Answering via only 2D Vision-Language Models
  10. A Closer Look at Time Steps is Worthy of Triple Speed-Up for Diffusion Model Training
  11. AnyEdit: Mastering Unified High-Quality Image Editing for Any Idea
  12. CARE Transformer: Mobile-Friendly Linear Visual Transformer via Decoupled Dual Interaction
  13. Ca2-VDM: Efficient Autoregressive Video Diffusion Model with Causal Generation and Cache Sharing
  14. Co-Reinforcement Learning for Unified Multimodal Understanding and Generation
  15. Corvid: Improving Multimodal Large Language Models Towards Chain-of-Thought Reasoning
  16. Distilling Parallel Gradients for Fast ODE Solvers of Diffusion Models
  17. Dynamic Multimodal Prototype Learning in Vision-Language Models
  18. Enhancing CLIP Robustness via Cross-Modality Alignment
  19. Generative Multimodal Pretraining with Discrete Diffusion Timestep Tokens
  20. Large Generative Models Meet Multimodal Applications (LGM3A)
  21. Learning 4D Panoptic Scene Graph Generation from Rich 2D Visual Scene
  22. Nautilus: Locality-Aware Autoencoder for Scalable Mesh Generation
  23. On Path to Multimodal Generalist: General-Level and General-Bench
  24. Project-Probe-Aggregate: Efficient Fine-Tuning for Group Robustness
  25. SGDiff: Scene Graph Guided Diffusion Model for Image Collaborative SegCaptioning
  26. Selftok-Zero: Reinforcement Learning for Visual Generation via Discrete and Autoregressive Visual Tokens
  27. Towards Semantic Equivalence of Tokenization in Multimodal LLM
  28. Unsupervised Visual Chain-of-Thought Reasoning via Preference Optimization
  29. Vinci: Deep Thinking in Text-to-Image Generation using Unified Model with Reinforcement Learning
  30. VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models
  31. Action Imitation in Common Action Space for Customized Action Image Synthesis
  32. Auto-Encoding Morph-Tokens for Multimodal LLM
  33. Classes Are Not Equal: An Empirical Study on Image Recognition Fairness
  34. Consistent3D: Towards Consistent High-Fidelity Text-to-3D Generation with Deterministic Sampling Prior
  35. Decoupled Kullback-Leibler Divergence Loss
  36. Diffusion Time-step Curriculum for One Image to 3D Generation
  37. Disco: Disentangled Control for Realistic Human Dance Generation
  38. Discriminative Probing and Tuning for Text-to-Image Generation
  39. Distributionally Generative Augmentation for Fair Facial Attribute Classification
  40. Doubly Abductive Counterfactual Inference for Text-Based Image Editing
  41. Dual-Perspective Knowledge Enrichment for Semi-supervised 3D Object Detection
  42. Dysen-VDM: Empowering Dynamics-Aware Text-to-Video Diffusion with LLMs
  43. Enhancing Zero-Shot Vision Models by Label-Free Prompt Distribution Learning and Bias Correcting
  44. Exploring Diffusion Time-steps for Unsupervised Representation Learning
  45. Few-Shot Learner Parameterization by Diffusion Time-Steps
  46. Few-Shot NeRF by Adaptive Rendering Loss Regularization
  47. Fine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative Instructions
  48. From Multimodal LLM to Human-level AI: Modality, Instruction, Reasoning and Beyond
  49. Instruction Tuning-Free Visual Token Complement for Multimodal LLMs
  50. Lever LM: Configuring In-Context Sequence to Lever Large Vision Language Models
  51. MGNet: Learning Correspondences via Multiple Graphs
  52. MVGamba: Unify 3D Content Generation as State Space Sequence Modeling
  53. Non-confusing Generation of Customized Concepts in Diffusion Models
  54. Rethinking and Improving Visual Prompt Selection for In-Context Learning Segmentation
  55. Robust Fine-tuning of Zero-shot Models via Variance Reduction
  56. Selective Vision-Language Subspace Projection for Few-shot CLIP
  57. Towards Unified Multimodal Editing with Enhanced Knowledge Collaboration
  58. Unified Generative and Discriminative Training for Multi-modal Large Language Models
  59. Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition
  60. View-Consistent 3D Editing with Gaussian Splatting
  61. Vitron: A Unified Pixel-level Vision LLM for Understanding, Generating, Segmenting, Editing