PPaperPicks

Fan Wang

Alibaba Group, Hangzhou, China

28 papers at tracked venues · 26 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. CyC3D: Fine-grained Controllable 3D Generation via Cycle Consistency Regularization
  2. EarthCrafter: Scalable 3D Earth Generation via Dual-Sparse Latent Diffusion
  3. 3DV-TON: Textured 3D-Guided Consistent Video Try-on via Diffusion Models
  4. AnimateAnyMesh: A Feed-Forward 4D Foundation Model for Text-Driven Universal Mesh Animation
  5. CoT-lized Diffusion: Let's Reinforce T2I Generation Step-by-step
  6. Dynamic Diffusion Transformer
  7. EOC-Bench: Can MLLMs Identify, Recall, and Forecast Objects in an Egocentric World?
  8. FPSAttention: Training-Aware FP8 and Sparsity Co-Design for Fast Video Diffusion
  9. GeoVideo: Introducing Geometric Regularization into Video Generation Model
  10. Inference-Time Alignment of Diffusion Models with Direct Noise Optimization
  11. MVGenMaster: Scaling Multi-View Generation from Any Image via 3D Priors Enhanced Diffusion Model
  12. MovieDreamer: Hierarchical Generation for Coherent Long Visual Sequences
  13. PlayerOne: Egocentric World Simulator
  14. Preacher: Paper-to-Video Agentic System
  15. RealisHuman: A Two-Stage Approach for Refining Malformed Human Parts in Generated Images
  16. SparseDiT: Token Sparsification for Efficient Diffusion Transformer
  17. UniLumos: Fast and Unified Image and Video Relighting with Physics-Plausible Feedback
  18. Accelerating Parallel Sampling of Diffusion Models
  19. Adaptive Query Selection for Camouflaged Instance Segmentation
  20. Animate3D: Animating Any 3D Model with Multi-view Video Diffusion
  21. BVT-IMA: Binary Vision Transformer with Information-Modified Attention
  22. CL2CM: Improving Cross-Lingual Cross-Modal Retrieval via Cross-Lingual Knowledge Transfer
  23. Continuous-Multiple Image Outpainting in One-Step via Positional Query and A Diffusion-based Approach
  24. DiffAug: Enhance Unsupervised Contrastive Learning with Domain-Knowledge-Free Diffusion-based Data Augmentation
  25. Dynamic Tuning Towards Parameter and Inference Efficiency for ViT Adaptation
  26. MVInpainter: Learning Multi-View Consistent Inpainting to Bridge 2D and 3D Editing
  27. SC4D: Sparse-Controlled Video-to-4D Generation and Motion Transfer
  28. VCD-Texture: Variance Alignment Based 3D-2D Co-denoising for Text-Guided Texturing