PPaperPicks

Qi Dai

Microsoft Research Asia, Beijing, China

22 papers at tracked venues · 20 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. GoViG: Goal-Conditioned Visual Navigation Instruction Generation via Multimodal Reasoning
  2. HiTVideo: Hierarchical Tokenizers for Enhancing Text-to-Video Generation with Autoregressive Large Language Models
  3. LLM2CLIP: Powerful Language Model Unlocks Richer Cross-Modality Representation
  4. MageBench: Bridging Large Multimodal Models to Agents
  5. Aid: Adapting Image2video Diffusion Models for Instruction-Guided Video Prediction
  6. FaceA-Net: Facial Attribute-Driven ID Preserving Image Generation Network
  7. FloVD: Optical Flow Meets Video Diffusion Model for Enhanced Camera-Controlled Video Synthesis
  8. HomoGen: Enhanced Video Inpainting via Homography Propagation and Diffusion
  9. JointDiT: Enhancing RGB-Depth Joint Modeling with Diffusion Transformers
  10. MagicMotion: Controllable Video Generation with Dense-to-Sparse Trajectory Guidance
  11. MotionFollower: Editing Video Motion via Score-Guided Diffusion
  12. REDUCIO! Generating 1K Video Within 16 Seconds Using Extremely Compressed Motion Latents
  13. Securing the Skies: A Comprehensive Survey on Anti-UAV Methods, Benchmarking, and Future Directions
  14. StableAnimator: High-Quality Identity-Preserving Human Image Animation
  15. UCDR-Adapter: Exploring Adaptation of Pre-Trained Vision-Language Models for Universal Cross-Domain Retrieval
  16. ART•V: Auto-Regressive Text-to-Video Generation with Diffusion Models
  17. Aligning Vision Models with Human Aesthetics in Retrieval: Benchmarks and Algorithms
  18. BlockGCN: Redefine Topology Awareness for Skeleton-Based Action Recognition
  19. Human-Aware Vision-and-Language Navigation: Bridging Simulation to Reality with Dynamic Human Interactions
  20. MicroCinema: A Divide-and-Conquer Approach for Text-to-Video Generation
  21. MotionEditor: Editing Video Motion via Content-Aware Diffusion
  22. SimDA: Simple Diffusion Adapter for Efficient Video Generation