PPaperPicks

Long Chen

Hong Kong University of Science and Technology, Department of Computer Science and Engineering, Hong Kong

43 papers at tracked venues · 35 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. BalanceSFT: Improving LLM Function Calling with Balanced Training Signals and Data Hardness
  2. Heterogeneous Uncertainty-Guided Composed Image Retrieval with Fine-Grained Probabilistic Learning
  3. Personalize Your Gaussian: Consistent 3D Scene Personalization from a Single Image
  4. Relation-R1: Progressively Cognitive Chain-of-Thought Guided Reinforcement Learning for Unified Relation Comprehension
  5. CLIPDrag: Combining Text-based and Drag-based Instructions for Image Editing
  6. Ca2-VDM: Efficient Autoregressive Video Diffusion Model with Causal Generation and Cache Sharing
  7. CoMM: A Coherent Interleaved Image-Text Dataset for Multimodal Understanding and Generation
  8. Compositional Zero-shot Learning via Progressive Language-based Observations
  9. Cyclic Contrastive Knowledge Transfer for Open-Vocabulary Object Detection
  10. Decoupling Contrastive Decoding: Robust Hallucination Mitigation in Multimodal Large Language Models
  11. DisPose: Disentangling Pose Guidance for Controllable Human Image Animation
  12. Embracing Collaboration Over Competition: Condensing Multiple Prompts for Visual In-Context Learning
  13. Enhancing Partially Relevant Video Retrieval with Hyperbolic Learning
  14. Event-Customized Image Generation
  15. Interaction-Centric Knowledge Infusion and Transfer for Open Vocabulary Scene Graph Generation
  16. Inversion Circle Interpolation: Diffusion-based Image Augmentation for Data-scarce Classification
  17. IterIS: Iterative Inference-Solving Alignment for LoRA Merging
  18. Learning Causal Transition Matrix for Instance-dependent Label Noise
  19. Modeling Uncertainty in Composed Image Retrieval via Probabilistic Embeddings
  20. Multi-Resolution Decomposable Diffusion Model for Non-Stationary Time Series Anomaly Detection
  21. Nautilus: Locality-Aware Autoencoder for Scalable Mesh Generation
  22. Noise Matters: Optimizing Matching Noise for Diffusion Classifiers
  23. Open-World Multimodal Understanding and Generation with Efficiently Finetuned Foundation Models
    AAAI 2025 · Long Chen
  24. RED: Unleashing Token-Level Rewards from Holistic Feedback via Reward Redistribution
  25. SpA2V: Harnessing Spatial Auditory Cues for Audio-driven Spatially-aware Video Generation
  26. Towards Better Alignment: Training Diffusion Models with Reinforcement Learning Against Sparse Rewards
  27. Zero-shot Compositional Action Recognition with Neural Logic Constraints
  28. $\text{Di}2\text{Pose}$: Discrete Diffusion Model for Occluded 3D Human Pose Estimation
  29. An Efficient and Effective Transformer Decoder-Based Framework for Multi-task Visual Grounding
  30. Beyond Grounding: Extracting Fine-Grained Event Hierarchies across Modalities
  31. ClothPPO: A Proximal Policy Optimization Enhancing Framework for Robotic Cloth Manipulation with Observation-Aligned Action Spaces
  32. DECap: Towards Generalized Explicit Caption Editing via Diffusion Mechanism
  33. Distributionally Generative Augmentation for Fair Facial Attribute Classification
  34. LLMs Can Evolve Continually on Modality for X-Modal Reasoning
  35. MIND: Multimodal Shopping Intention Distillation from Large Vision-language Models for E-commerce Purchase Understanding
  36. Optimizing Language Models with Fair and Stable Reward Composition in Reinforcement Learning
  37. PROMOTE: Prior-Guided Diffusion Model with Global-Local Contrastive Learning for Exemplar-Based Image Translation
  38. RAP: Efficient Text-Video Retrieval with Sparse-and-Correlated Adapter
  39. SCHEMA: State CHangEs MAtter for Procedure Planning in Instructional Videos
  40. SHERL: Synthesizing High Accuracy and Efficient Memory for Resource-Limited Transfer Learning
  41. Seeing Beyond Classes: Zero-Shot Grounded Situation Recognition via Language Explainer
  42. UniPT: Universal Parallel Tuning for Transfer Learning with Efficient Parameter and Memory
  43. View-Consistent 3D Editing with Gaussian Splatting