P
PaperPicks
Conferences
Xiaoyi Dong
32 papers at tracked venues · 30 at CORE A* · active 2024–2026
DBLP profile ↗
ORCID search ↗
Venues
ICCV
×7
NeurIPS
×7
CVPR
×5
ACL
×4
ICML
×3
ECCV
×2
ICLR
×2
AAAI
×1
ACM MM
×1
Frequent coauthors
Ziyu Liu
DBLP profile ↗
ORCID search ↗
×3
Junbo Niu
DBLP profile ↗
ORCID search ↗
×2
Zeyi Sun
DBLP profile ↗
ORCID search ↗
×2
Jiazi Bu
DBLP profile ↗
ORCID search ↗
×2
Qidong Huang
DBLP profile ↗
ORCID search ↗
×2
Rui Qian
DBLP profile ↗
ORCID search ↗
×2
Shuangrui Ding
DBLP profile ↗
ORCID search ↗
×2
Yubo Ma
DBLP profile ↗
ORCID search ↗
×2
Long Xing
DBLP profile ↗
ORCID search ↗
×1
Yuhang Zang
DBLP profile ↗
ORCID search ↗
×1
Yujie Zhou
DBLP profile ↗
ORCID search ↗
×1
Shengyuan Ding
DBLP profile ↗
ORCID search ↗
×1
Papers
MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing
ACL 2026
·
Junbo Niu
DBLP profile ↗
ORCID search ↗
Bootstrap3D: Improving Multi-View Diffusion Model with Synthetic Data
ICCV 2025
·
Zeyi Sun
DBLP profile ↗
ORCID search ↗
ByTheWay: Boost Your Text-to-Video Generation Model to Higher Quality in a Training-free Way
CVPR 2025
·
Jiazi Bu
DBLP profile ↗
ORCID search ↗
Conical Visual Concentration for Efficient Large Vision-Language Models
CVPR 2025
·
Long Xing
DBLP profile ↗
ORCID search ↗
Deciphering Cross-Modal Alignment in Large Vision-Language Models Via Modality Integration Rate
ICCV 2025
·
Qidong Huang
DBLP profile ↗
ORCID search ↗
Dispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and Reaction
CVPR 2025
·
Rui Qian
DBLP profile ↗
ORCID search ↗
HiFlow: Training-free High-Resolution Image Generation with Flow-Aligned Guidance
NeurIPS 2025
·
Jiazi Bu
DBLP profile ↗
ORCID search ↗
InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model
ACL 2025
·
Yuhang Zang
DBLP profile ↗
ORCID search ↗
Light-a-Video: Training-Free Video Relighting via Progressive Light Fusion
ICCV 2025
·
Yujie Zhou
DBLP profile ↗
ORCID search ↗
MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models
ICLR 2025
·
Ziyu Liu
DBLP profile ↗
ORCID search ↗
MM-IFEngine: Towards Multimodal Instruction Following
ICCV 2025
·
Shengyuan Ding
DBLP profile ↗
ORCID search ↗
Maximum Entropy Reinforcement Learning with Diffusion Policy
ICML 2025
·
Xiaoyi Dong
MotionClone: Training-Free Motion Cloning for Controllable Video Generation
ICLR 2025
·
Pengyang Ling
DBLP profile ↗
ORCID search ↗
OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?
CVPR 2025
·
Junbo Niu
DBLP profile ↗
ORCID search ↗
SAM2LONG: Enhancing SAM 2 for Long Video Segmentation with a Training-Free Memory Tree
ICCV 2025
·
Shuangrui Ding
DBLP profile ↗
ORCID search ↗
SongComposer: A Large Language Model for Lyric and Melody Generation in Song Composition
ACL 2025
·
Shuangrui Ding
DBLP profile ↗
ORCID search ↗
SongGen: A Single Stage Auto-regressive Transformer for Text-to-Song Generation
ICML 2025
·
Zihan Liu
DBLP profile ↗
ORCID search ↗
Towards Storage-Efficient Visual Document Retrieval: An Empirical Study on Reducing Patch-Level Embeddings
ACL 2025
·
Yubo Ma
DBLP profile ↗
ORCID search ↗
VideoRoPE: What Makes for Good Video Rotary Position Embedding?
ICML 2025
·
Xilin Wei
DBLP profile ↗
ORCID search ↗
Visual-RFT: Visual Reinforcement Fine-Tuning
ICCV 2025
·
Ziyu Liu
DBLP profile ↗
ORCID search ↗
X-Prompt: Generalizable Auto-Regressive Visual Learning with In-Context Prompting
ICCV 2025
·
Zeyi Sun
DBLP profile ↗
ORCID search ↗
Are We on the Right Way for Evaluating Large Vision-Language Models?
NeurIPS 2024
·
Lin Chen
DBLP profile ↗
ORCID search ↗
InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD
NeurIPS 2024
·
Xiaoyi Dong
Long-CLIP: Unlocking the Long-Text Capability of CLIP
ECCV 2024
·
Beichen Zhang
DBLP profile ↗
ORCID search ↗
MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs
NeurIPS 2024
·
Ziyu Liu
DBLP profile ↗
ORCID search ↗
MMLONGBENCH-DOC: Benchmarking Long-context Document Understanding with Visualizations
NeurIPS 2024
·
Yubo Ma
DBLP profile ↗
ORCID search ↗
OPERA: Alleviating Hallucination in Multi-Modal Large Language Models via Over-Trust Penalty and Retrospection-Allocation
CVPR 2024
·
Qidong Huang
DBLP profile ↗
ORCID search ↗
ShareGPT4V: Improving Large Multi-modal Models with Better Captions
ECCV 2024
·
Lin Chen
DBLP profile ↗
ORCID search ↗
ShareGPT4Video: Improving Video Understanding and Generation with Better Captions
NeurIPS 2024
·
Lin Chen
DBLP profile ↗
ORCID search ↗
Streaming Long Video Understanding with Large Language Models
NeurIPS 2024
·
Rui Qian
DBLP profile ↗
ORCID search ↗
VIGC: Visual Instruction Generation and Correction
AAAI 2024
·
Bin Wang
DBLP profile ↗
ORCID search ↗
VLMEvalKit: An Open-Source ToolKit for Evaluating Large Multi-Modality Models
ACM MM 2024
·
Haodong Duan
DBLP profile ↗
ORCID search ↗