PPaperPicks

Xinggang Wang

38 papers at tracked venues · 30 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Few-step Flow for 3D Generation via Marginal-Data Transport Distillation
  2. Gait Recognition via Collaborating Discriminative and Generative Diffusion Models
  3. LENS: Learning to Segment Anything with Unified Reinforced Reasoning
  4. MolSight: Optical Chemical Structure Recognition with SMILES Pretraining, Multi-Granularity Learning and Reinforcement Learning
  5. Phys-Liquid: A Physics-Informed Dataset for Estimating 3D Geometry and Volume of Transparent Deformable Liquids
  6. Turbo-VAED: Fast and Stable Transfer of Video-VAEs to Mobile Devices
  7. WPIS: From In-the-Wild Web Images to Physics-Aware 3D Scene Graphs for Physical Reasoning
  8. ControlAR: Controllable Image Generation with Autoregressive Models
  9. DiG: Scalable and Efficient Diffusion Models with Gated Linear Attention
  10. DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving
  11. Dynamic 2D Gaussians: Geometrically Accurate Radiance Fields for Dynamic Objects
  12. GaraMoSt: Parallel Multi-Granularity Motion and Structural Modeling for Efficient Multi-Frame Interpolation in DSA Images
  13. GaussTR: Foundation Model-Aligned Gaussian Transformer for Self-Supervised 3D Spatial Understanding
  14. Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency
  15. GroundingSuite: Measuring Complex Multi-Granular Pixel Grounding
  16. JudgeLM: Fine-tuned Large Language Models are Scalable Judges
  17. MaTVLM: Hybrid Mamba-Transformer for Efficient Vision-Language Modeling
  18. Mask-Adapter: The Devil is in the Masks for Open-Vocabulary Segmentation
  19. RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS-based Reinforcement Learning
  20. Reconstruction vs. Generation: Taming Optimization Dilemma in Latent Diffusion Models
  21. SuperCLIP: CLIP with Simple Classification Supervision
  22. ViG: Linear-complexity Visual Sequence Learning with Gated Linear Attention
  23. 4D Gaussian Splatting for Real-Time Dynamic Scene Rendering
  24. Cascade-Zero123: One Image to Highly Consistent 3D with Self-prompted Nearby Views
  25. Causality-Inspired Discriminative Feature Learning in Triple Domains for Gait Recognition
  26. Co-Student: Collaborating Strong and Weak Students for Sparsely Annotated Object Detection
  27. FasterDiT: Towards Faster Diffusion Transformers Training without Architecture Modification
  28. GaussianDreamer: Fast Generation from Text to 3D Gaussians by Bridging 2D and 3D Diffusion Models
  29. Lane Graph as Path: Continuity-Preserving Path-Wise Modeling for Online Lane Graph Construction
  30. MoSt-DSA: Modeling Motion and Structural Interactions for Direct Multi-Frame Interpolation in DSA Images
  31. MobileInst: Video Instance Segmentation on the Mobile
  32. Occupancy as Set of Points
  33. Symphonize 3D Semantic Scene Completion with Contextual Instance Queries
  34. Towards Dual Transparent Liquid Level Estimation in Biomedical Lab: Dataset, Methods and Practices
  35. Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model
  36. Visual Text Generation in the Wild
  37. WeakSAM: Segment Anything Meets Weakly-supervised Instance-level Recognition
  38. YOLO-World: Real-Time Open-Vocabulary Object Detection