PPaperPicks

Fengyun Rao

17 papers at tracked venues · 17 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. MMhops-R1: Multimodal Multi-hop Reasoning
  2. FlexSelect: Flexible Token Selection for Efficient Long Video Understanding
  3. From Trial to Triumph: Advancing Long Video Understanding via Visual Context Sample Scaling and Self-Reward Alignment
  4. HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models
  5. HarmonySet: A Comprehensive Dataset for Understanding Video-Music Semantic Alignment and Temporal Synchronization
  6. Instruction-Oriented Preference Alignment for Enhancing Multi-Modal Comprehension Capability of MLLMs
  7. Instruction-augmented Multimodal Alignment for Image-Text and Element Matching
  8. MMAR: Towards Lossless Multi-Modal Auto-Regressive Probabilistic Modeling
  9. Number it: Temporal Grounding Videos like Flipping Manga
  10. PerturboLLaVA: Reducing Multimodal Hallucinations with Perturbative Visual Training
  11. R1-Onevision: Advancing Generalized Multimodal Reasoning Through Cross-Modal Formalization
  12. Image Captioning with Multi-Context Synthetic Data
  13. Inter-X: Towards Versatile Human-Human Interaction Analysis
  14. ReGenNet: Towards Human Action-Reaction Synthesis
  15. Spatial-Semantic Collaborative Cropping for User Generated Content
  16. Task Navigator: Decomposing Complex Tasks for Multimodal Large Language Models
  17. Visual Perception by Large Language Model's Weights