PPaperPicks

Xiangyu Yue

Chinese University of Hong Kong, Department of Information Engineering, Multimedia Lab (MMLab), Hong Kong

38 papers at tracked venues · 36 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. AdaTooler-V: Adaptive Tool-Use for Images and Videos
  2. Exploring Reasoning Reward Model for Agents
  3. Learning While Staying Curious: Entropy-Preserving Supervised Fine-Tuning via Adaptive Self-Distillation for Large Reasoning Models
  4. Probing Audio-Visual Reasoning in Multimodal Language Models through the Lens of Audio
  5. SpatialLogic-Bench: A Diagnostic Benchmark for Task-Oriented Spatiotemporal Reasoning
  6. Breaking the Encoder Barrier for Seamless Video-Language Understanding
  7. CMT: A Cascade MAR with Topology Predictor for Multimodal Conditional CAD Generation
  8. Chimera: Improving Generalist Model with Domain-Specific Experts
  9. DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation
  10. Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning
  11. FairGen: Enhancing Fairness in Text-to-Image Diffusion Models via Self-Discovering Latent Directions
  12. Fira: Can We Achieve Full-rank Training of LLMs Under Low-rank Constraint?
  13. From Easy to Hard: Progressive Active Learning Framework for Infrared Small Target Detection with Single Point Supervision
  14. HYPDAE: Hyperbolic Diffusion Autoencoders for Hierarchical Few-Shot Image Generation
  15. HiddenDetect: Detecting Jailbreak Attacks against Multimodal Large Language Models via Monitoring Hidden States
  16. Learning Beyond Still Frames: Scaling Vision-Language Models with Video
  17. Learning to Integrate Diffusion ODEs by Averaging the Derivatives
  18. Native-Resolution Image Synthesis
  19. RAP: Retrieval-Augmented Personalization for Multimodal Large Language Models
  20. ReSim: Reliable World Simulation for Autonomous Driving
  21. Scaling Omni-Modal Pretraining with Multimodal Context: Advancing Universal Representation Learning Across Modalities
  22. SemGeoMo: Dynamic Contextual Human Motion Generation with Semantic and Geometric Guidance
  23. SynFER: Towards Boosting Facial Expression Recognition With Synthetic Data
  24. Training Matting Models Without Alpha Labels
  25. UniSTD: Towards Unified Spatio-Temporal Learning across Diverse Disciplines
  26. Unleashing Vecset Diffusion Model for Fast Shape Generation
  27. Unposed Sparse Views Room Layout Reconstruction in the Age of Pretrain Model
  28. Video-R1: Reinforcing Video Reasoning in MLLMs
  29. Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations
  30. Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization
  31. Bifröst: 3D-Aware Image Compositing with Language Instructions
  32. EMR-Merging: Tuning-Free High-Performance Model Merging
  33. Lumina-Next : Making Lumina-T2X Stronger and Faster with Next-DiT
  34. Multimodal Pathway: Improve Transformers with Irrelevant Data from Other Modalities
  35. OneLLM: One Framework to Align All Modalities with Language
  36. Online Vectorized HD Map Construction Using Geometry
  37. Reg-TTA3D: Better Regression Makes Better Test-Time Adaptive 3D Object Detection
  38. UniRepLKNet: A Universal Perception Large-Kernel ConvNet for Audio, Video, Point Cloud, Time-Series and Image Recognition