PPaperPicks

Yu Liu

Sensetime Group Ltd., Beijing, China

28 papers at tracked venues · 21 at CORE A* · active 20242025

Venues

Frequent coauthors

Papers

  1. EasyRef: Omni-Generalized Group Image Reference for Diffusion Models via Multimodal LLM
  2. MMSearch: Unveiling the Potential of Large Models as Multi-modal Search Engines
  3. Pretrained Reversible Generation as Unsupervised Visual Representation Learning
  4. Robo-MUTUAL: Robotic Multimodal Task Specification via Unimodal Learning
  5. See Further When Clear: Curriculum Consistency Model
  6. SmartPretrain: Model-Agnostic and Dataset-Agnostic Representation Learning for Motion Prediction
  7. Universal Actions for Enhanced Embodied Foundation Models
  8. VividFace: A Robost and High-Fidelity Video Face Swapping Framework
  9. A Perspective of Q-value Estimation on Offline-to-Online Reinforcement Learning
  10. Be-Your-Outpainter: Mastering Video Outpainting Through Input-Specific Adaptation
  11. CoMat: Aligning Text-to-Image Diffusion Model with Image-to-Text Concept Matching
  12. Critic-Guided Decision Transformer for Offline Reinforcement Learning
  13. DecisionNCE: Embodied Multimodal Representations via Implicit Preference Learning
  14. Deep Reward Supervisions for Tuning Text-to-Image Diffusion Models
  15. EasyDrag: Efficient Point-Based Manipulation on Diffusion Models
  16. Exploring the Role of Large Language Models in Prompt Encoding for Diffusion Models
  17. FouriScale: A Frequency Perspective on Training-Free High-Resolution Image Synthesis
  18. GLID: Pre-training a Generalist Encoder-Decoder Vision Model
  19. GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest
  20. Instruction-Guided Visual Masking
  21. LMDrive: Closed-Loop End-to-End Driving with Large Language Models
  22. MoVA: Adapting Mixture of Vision Experts to Multimodal Context
  23. Phased Consistency Models
  24. Rethinking the Spatial Inconsistency in Classifier-Free Diffusion Guidance
  25. SmartRefine: A Scenario-Adaptive Refinement Framework for Efficient Motion Prediction
  26. Three Things We Need to Know About Transferring Stable Diffusion to Visual Dense Prediction Tasks
  27. Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning
  28. ZoLA: Zero-Shot Creative Long Animation Generation with Short Video Model