PPaperPicks

Yadong Mu

Peking University, Beijing, China

24 papers at tracked venues · 22 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Generating Attribute-Aware Human Motions from Textual Prompt
  2. Closed-Loop Long-Horizon Robotic Planning via Equilibrium Sequence Modeling
  3. DiffSplat: Repurposing Image Diffusion Models for Scalable Gaussian Splat Generation
  4. Enhancing Consistency of Flow-Based Image Editing through Kalman Control
  5. Granularity-Adaptive Spatial Evidence Tokenization for Video Question Answering
  6. NavQ: Learning a Q-Model for Foresighted Vision-and-Language Navigation
  7. Neural Assembler: Learning to Generate Fine-Grained Robotic Assembly Instructions from Multi-View Images
  8. OmniPhysGS: 3D Constitutive Gaussians for General Physics-Based Dynamics Generation
  9. PartCrafter: Structured 3D Mesh Generation via Compositional Latent Diffusion Transformers
  10. Pyramidal Flow Matching for Efficient Video Generative Modeling
  11. Removing Concepts from Text-to-Image Models with Only Negative Samples
  12. Weakly-Supervised Affordance Grounding Guided by Part-Level Semantic Priors
  13. Countering Personalized Text-to-Image Generation with Influence Watermarks
  14. Exploring Orthogonality in Open World Object Detection
  15. HumanSplat: Generalizable Single-Image Human Gaussian Splatting with Structure Priors
  16. Ink Dot-Oriented Differentiable Optimization for Neural Image Halftoning
  17. InstructScene: Instruction-Driven 3D Indoor Scene Synthesis with Semantic Graph Prior
  18. Learning Solution-Aware Transformers for Efficiently Solving Quadratic Assignment Problem
  19. Local Occupancy-Enhanced Object Grasping with Multiple Triplanar Projection
  20. RectifID: Personalizing Rectified Flow with Anchored Classifier Guidance
  21. Transferable Video Moment Localization by Moment-Guided Query Prompting
  22. Unified Language-Vision Pretraining in LLM with Dynamic Discrete Visual Tokenization
  23. Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual-Motional Tokenization
  24. Weakly-Supervised Spatio-Temporal Video Grounding with Variational Cross-Modal Alignment