PPaperPicks

Yu Qiao

Shanghai AI Laboratory, OpenGVLab, China

159 papers at tracked venues · 133 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and a Comprehensive Multimodal Dataset Towards General Medical AI
  2. Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy
  3. OS-Symphony: A Holistic Framework for Robust and Generalist Computer-Using Agents
  4. Towards Self-Evolving Agents: Enabling Autonomy through Interactive Experience Refinement
  5. Uni-MMMU: A Massive Multi-discipline Multimodal Unified Benchmark
  6. VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning
  7. An Empirical Study of Federated Prompt Learning for Vision Language Model
  8. An Intelligent Agentic System for Complex Image Restoration Problems
  9. ArchCAD-400K: A Large-Scale CAD drawings Dataset and New Baseline for Panoptic Symbol Spotting
  10. Bootstrapping Language-Guided Navigation Learning with Self-Refining Data Flywheel
  11. DiffVSR: Revealing an Effective Recipe for Taming Robust Video Super-Resolution Against Complex Degradations
  12. DiffusionMat: Alpha Matting as Deterministic Sequential Refinement Learning
  13. Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy
  14. Dolphin: Moving Towards Closed-loop Auto-research through Thinking, Practice, and Feedback
  15. DriveArena: A Closed-Loop Generative Simulation Platform for Autonomous Driving
  16. Dual-Expert Consistency Model for Efficient and High-Quality Video Generation
  17. DynamicCity: Large-Scale 4D Occupancy Generation from Dynamic Scenes
  18. EgoThinker: Unveiling Egocentric Reasoning with Spatio-Temporal CoT
  19. Evaluation Agent: Efficient and Promptable Evaluation Framework for Visual Generative Models
  20. FasterCache: Training-Free Video Diffusion Model Acceleration with High Quality
  21. GigaGS: 3D Gaussian Based Planar Representation for Large-Scene Surface Reconstruction
  22. H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving
  23. HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding
  24. Interactive Evolution: A Neural-Symbolic Self-Training Framework For Large Language Models
  25. LLMs know their vulnerabilities: Uncover Safety Gaps through Natural Distribution Shifts
  26. Learning Causal Alignment for Reliable Disease Diagnosis
  27. Lumina-Image 2.0: a Unified and Efficient Image Generative Framework
  28. Lumina-T2X: Scalable Flow-based Large Diffusion Transformer for Flexible Resolution Generation
  29. MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models
  30. MMRC: A Large-Scale Benchmark for Understanding Multimodal Large Language Model in Real-World Conversation
  31. MSWAL: 3D Multi-class Segmentation of Whole Abdominal Lesions Dataset
  32. Maintaining Structural Integrity in Parameter Spaces for Parameter Efficient Fine-tuning
  33. Modeling Fine-Grained Hand-Object Dynamics for Egocentric Video Representation Learning
  34. Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training
  35. Muses: 3D-Controllable Image Generation via Multi-Modal Agent Collaboration
  36. OS-ATLAS: Foundation Action Model for Generalist GUI Agents
  37. OS-Genesis: Automating GUI Agent Trajectory Construction via Reverse Task Synthesis
  38. OpenING: A Comprehensive Benchmark for Judging Open-ended Interleaved Image-Text Generation
  39. Point or Line? Using Line-based Representation for Panoptic Symbol Spotting in CAD Drawings
  40. REEF: Representation Encoding Fingerprints for Large Language Models
  41. RH20T-P: A Primitive-Level Robotic Manipulation Dataset towards Composable Generalization Agents in Real-world Scenarios
  42. SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Models
  43. ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models
  44. SlideChat: A Large Vision-Language Assistant for Whole-Slide Pathology Image Understanding
  45. Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment
  46. The Devil is in the Prompts: Retrieval-Augmented Prompt Optimization for Text-to-Video Generation
  47. TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
  48. Towards Explicit Exoskeleton for the Reconstruction of Complicated 3D Human Avatars
  49. VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos
  50. VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative Perception
  51. Vision-RWKV: Efficient and Scalable Visual Perception with RWKV-Like Architectures
  52. 4Diffusion: Multi-view Video Diffusion Model for 4D Generation
  53. A Comparative Study of Image Restoration Networks for General Backbone Network Design
  54. Aleth-NeRF: Illumination Adaptive NeRF with Concealing Field Assumption
  55. AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning
  56. Are We on the Right Way for Evaluating Large Vision-Language Models?
  57. Asymmetric Masked Distillation for Pre-Training Small Foundation Models
  58. Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey
  59. Auto MC-Reward: Automated Dense Reward Design with Large Language Models for Minecraft
  60. BESA: Pruning Large Language Models with Blockwise Parameter-Efficient Sparsity Allocation
  61. Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization
  62. Brush Your Text: Synthesize Any Scene Text on Images via Diffusion Model
  63. CO2: Efficient Distributed Training with Full Communication-Computation Overlap
  64. Causal Discovery via Conditional Independence Testing with Proxy Variables
  65. ChartAssistant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction Tuning
  66. Clearer Frames, Anytime: Resolving Velocity Ambiguity in Video Frame Interpolation
  67. ConditionVideo: Training-Free Condition-Guided Video Generation
  68. Continuously Learning, Adapting, and Improving: A Dual-Process Approach to Autonomous Driving
  69. ControlLLM: Augment Language Models with Tools by Searching on Graphs
  70. ConvBench: A Multi-Turn Conversation Evaluation Benchmark with Hierarchical Ablation Capability for Large Vision-Language Models
  71. Critic-Guided Decision Transformer for Offline Reinforcement Learning
  72. DIBS: Enhancing Dense Video Captioning with Unlabeled Videos via Pseudo Boundary Enrichment and Online Refinement
  73. Data Adaptive Traceback for Vision-Language Foundation Models in Image Classification
  74. DiLu: A Knowledge-Driven Approach to Autonomous Driving with Large Language Models
  75. DiffAgent: Fast and Accurate Text-to-Image API Selection with Large Language Model
  76. DiffBIR: Toward Blind Image Restoration with Generative Diffusion Prior
  77. DiffInDScene: Diffusion-Based High-Quality 3D Indoor Scene Generation
  78. Distilling Knowledge from Large-Scale Image Models for Object Detection
  79. Does Video-Text Pretraining Help Open-Vocabulary Online Action Detection?
  80. Efficient Deformable ConvNets: Rethinking Dynamic and Sparse Operator for Vision Applications
  81. EgoExoLearn: A Dataset for Bridging Asynchronous Ego- and Exo-centric View of Procedural Activities in Real World
  82. Embodied Understanding of Driving Scenarios
  83. Emulated Disalignment: Safety Alignment for Large Language Models May Backfire!
  84. EpiDiff: Enhancing Multi-View Synthesis via Localized Epipolar-Constrained Diffusion
  85. Fake Alignment: Are LLMs Really Aligned Well?
  86. GMAI-MMBench: A Comprehensive Multimodal Evaluation Benchmark Towards General Medical AI
  87. GRIDS: Grouped Multiple-Degradation Restoration with Image Degradation Similarity
  88. Generalized Predictive Model for Autonomous Driving
  89. Generate Like Experts: Multi-Stage Font Generation by Incorporating Font Transfer Process into Diffusion Models
  90. Inference-Time Language Model Alignment via Integrated Value Guidance
  91. Intern VL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  92. InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD
  93. InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation
  94. InternVideo2: Scaling Foundation Models for Multimodal Video Understanding
  95. LLaMA-Adapter: Efficient Fine-tuning of Large Language Models with Zero-initialized Attention
  96. LLaMA-Excitor: General Instruction Tuning via Indirect Feature Interaction
  97. LLaMAX: Scaling Linguistic Horizons of LLM by Enhancing Translation Capabilities Beyond 100 Languages
  98. Language-aware Visual Semantic Distillation for Video Question Answering
  99. Learning 1D Causal Visual Representation with De-focus Attention Networks
  100. Learning A Low-Level Vision Generalist via Visual Task Prompt
  101. Learning Manipulation by Predicting Interaction
  102. Lumina-Next : Making Lumina-T2X Stronger and Faster with Next-DiT
  103. M-BEV: Masked BEV Perception for Robust Autonomous Driving
  104. MATHVERSE: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?
  105. MLLMGuard: A Multi-dimensional Safety Evaluation Suite for Multimodal Large Language Models
  106. MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language Models
  107. MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs
  108. MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI
  109. MP5: A Multi-modal Open-ended Embodied System in Minecraft via Active Perception
  110. MVBench: A Comprehensive Multi-modal Video Understanding Benchmark
  111. Mask as Supervision: Leveraging Unified Mask Information for Unsupervised 3D Pose Estimation
  112. MoPS: Modular Story Premise Synthesis for Open-Ended Automatic Story Generation
  113. Needle In A Multimodal Haystack
  114. OlympicArena: Benchmarking Multi-discipline Cognitive Reasoning for Superintelligent AI
  115. OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLM
  116. OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models
  117. OneLLM: One Framework to Align All Modalities with Language
  118. Parameter-Inverted Image Pyramid Networks
  119. Personalize Segment Anything Model with One Shot
  120. Point Transformer V3: Simpler, Faster, Stronger
  121. Point2RBox: Combine Knowledge from Synthetic Visual Patterns for End-to-End Oriented Object Detection with Single Point Supervision
  122. Position: Towards Implicit Prompt For Text-To-Image Models
  123. PsySafe: A Comprehensive Framework for Psychological-based Attack, Defense, and Evaluation of Multi-agent System Safety
  124. ReSimAD: Zero-Shot 3D Domain Transfer for Autonomous Driving with Source Reconstruction and Target Simulation
  125. Referred by Multi-Modality: A Unified Temporal Transformer for Video Object Segmentation
  126. Reg-TTA3D: Better Regression Makes Better Test-Time Adaptive 3D Object Detection
  127. Rethinking Human Evaluation Protocol for Text-to-Video Models: Enhancing Reliability, Reproducibility, and Practicality
  128. RoboCodeX: Multimodal Code Generation for Robotic Behavior Synthesis
  129. SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
  130. SAM-Med3D: Towards General-Purpose Segmentation Models for Volumetric Medical Images
  131. SEAL: A Framework for Systematic Evaluation of Real-World Super-Resolution
  132. SEER: Facilitating Structured Reasoning and Explanation via Reinforcement Learning
  133. SEINE: Short-to-Long Video Diffusion Model for Generative Transition and Prediction
  134. SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language Models
  135. SPHINX: A Mixer of Weights, Visual Embeddings and Image Scales for Multi-modal Large Language Models
  136. Safety of Multimodal Large Language Models on Images and Text
  137. Scaling Up to Excellence: Practicing Model Scaling for Photo-Realistic Image Restoration In the Wild
  138. ScoreHypo: Probabilistic Human Mesh Estimation with Hypothesis Scoring
  139. SearchLVLMs: A Plug-and-Play Framework for Augmenting Large Vision-Language Models by Searching Up-to-Date Internet Knowledge
  140. ShareGPT4Video: Improving Video Understanding and Generation with Better Captions
  141. SinSR: Diffusion-Based Image Super-Resolution in a Single Step
  142. Symbol-LLM: Towards Foundational Symbol-centric Interface For Large Language Models
  143. SyncVIS: Synchronized Video Instance Segmentation
  144. The All-Seeing Project V2: Towards General Relation Comprehension of the Open World
  145. The All-Seeing Project: Towards Panoptic Visual Recognition and Understanding of the Open World
  146. Towards Real-world Video Face Restoration: A New Benchmark
  147. Towards Tracing Trustworthiness Dynamics: Revisiting Pre-training Period of Large Language Models
  148. TransAgent: Transfer Vision-Language Foundation Models with Heterogeneous Agent Collaboration
  149. Tree-Planner: Efficient Close-loop Task Planning with Large Language Models
  150. Unifying Image Processing as Visual Prompting Question Answering
  151. VBench: Comprehensive Benchmark Suite for Video Generative Models
  152. VideoBooth: Diffusion-based Video Generation with Image Prompts
  153. VideoMamba: State Space Model for Efficient Video Understanding
  154. Vision Model Pre-training on Interleaved Image-Text Data via Latent Compression Learning
  155. VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks
  156. Vlogger: Make Your Dream A Vlog
  157. Weak-to-Strong Search: Align Large Language Models via Searching over Small Language Models
  158. Within the Dynamic Context: Inertia-Aware 3D Human Modeling with Pose Sequence
  159. ZOPP: A Framework of Zero-shot Offboard Panoptic Perception for Autonomous Driving