PPaperPicks

Qifeng Chen

Hong Kong University of Science and Technology, Hong Kong

53 papers at tracked venues · 39 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. LPO: Towards Accurate GUI Agent Interaction via Location Preference Optimization
  2. LongVideoAgent: Multi-Agent Reasoning with Long Videos
  3. Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding
  4. Robust-R1: Degradation-Aware Reasoning for Robust Visual Understanding
  5. AlignGuard: Scalable Safety Alignment for Text-to-Image Generation
  6. AvatarArtist: Open-Domain 4D Avatarization
  7. DiT4Edit: Diffusion Transformer for Image Editing
  8. Edicho: Consistent Image Editing in the Wild
  9. Exploring Sparse MoE in GANs for Text-conditioned Image Synthesis
  10. Follow-Your-Click: Open-domain Regional Image Animation via Motion Prompts
  11. Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation
  12. Hints of Prompt: Enhancing Visual Representation for Multimodal LLMs in Autonomous Driving
  13. Infinite-Canvas: Higher-Resolution Video Outpainting with Extensive Content Generation
  14. InstantSwap: Fast Customized Concept Swapping across Sharp Shape Differences
  15. LDM-ISP: Enhancing Neural ISP for Low Light with Latent Diffusion Models
  16. LeviTor: 3D Trajectory Oriented Image-to-Video Synthesis
  17. MagicQuill: An Intelligent Interactive Image Editing System
  18. MagicStick: Controllable Video Editing via Control Handle Transformations
  19. MangaNinja: Line Art Colorization with Precise Reference Following
  20. Master Rules from Chaos: Learning to Reason, Plan, and Interact from Chaos for Tangram Assembly
  21. Model as a Game: On Numerical and Spatial Consistency for Generative Games
  22. Rethinking Layered Graphic Design Generation with a Top-Down Approach
  23. Robust Portrait Image Matting and Depth-of-field Synthesis via Multiplane Images
  24. SkillMimic: Learning Basketball Interaction Skills from Demonstrations
  25. SpA2V: Harnessing Spatial Auditory Cues for Audio-driven Spatially-aware Video Generation
  26. VidMuse: A Simple Video-to-Music Generation Framework with Long-Short-Term Modeling
  27. VideoDPO: Omni-Preference Alignment for Video Diffusion Generation
  28. VideoVAE+: Large Motion Video Autoencoding with Cross-Modal Video VAE
  29. A Diffusion Model with State Estimation for Degradation-Blind Inverse Imaging
  30. Adaptive Domain Learning for Cross-domain Image Denoising
  31. Automatic Controllable Colorization via Imagination
  32. CoDeF: Content Deformation Fields for Temporally Consistent Video Processing
  33. ControlLLM: Augment Language Models with Tools by Searching on Graphs
  34. Cross-Cluster Shifting for Efficient and Effective 3D Object Detection in Autonomous Driving
  35. DiffSHEG: A Diffusion-Based Approach for Real-Time Speech-Driven Holistic 3D Expression and Gesture Generation
  36. Follow Your Pose: Pose-Guided Text-to-Video Generation Using Pose-Free Videos
  37. GIC: Gaussian-Informed Continuum for Physical Property Identification and Simulation
  38. Gaussian Shell Maps for Efficient 3D Human Generation
  39. HAWK: Learning to Understand Open-World Video Anomalies
  40. Latent Guard: A Safety Framework for Text-to-Image Generation
  41. Learning High-Resolution Vector Representation from Multi-camera Images for 3D Object Detection
  42. Make a Cheap Scaling: A Self-Cascade Diffusion Model for Higher-Resolution Adaptation
  43. Multitarget Device-Free Localization via Cross-Domain Wi-Fi RSS Training Data and Attentional Prior Fusion
  44. PPAD: Iterative Interactions of Prediction and Planning for End-to-End Autonomous Driving
  45. Real-Time 3D-Aware Portrait Editing from a Single Image
  46. Robust Depth Enhancement via Polarization Prompt Fusion Tuning
  47. SPIRE: Semantic Prompt-Driven Image Restoration
  48. ScaleCrafter: Tuning-free Higher-Resolution Visual Generation with Diffusion Models
  49. Seeing and Hearing: Open-domain Visual-Audio Generation with Diffusion Latent Aligners
  50. Storytelling Video Generation with Retrieval Augmentation and Character Consistency
  51. TALE: Training-free Cross-domain Image Composition via Adaptive Latent Manipulation and Energy-guided Optimization
  52. TextDiffuser-2: Unleashing the Power of Language Models for Text Rendering
  53. Using Left and Right Brains Together: Towards Vision and Language Planning