P
PaperPicks
Conferences
Weidi Xie
34 papers at tracked venues · 24 at CORE A* · active 2024–2026
DBLP profile ↗
ORCID search ↗
Venues
CVPR
×9
ECCV
×5
ICCV
×4
ICLR
×4
ACM MM
×3
EMNLP
×3
AAAI
×2
MICCAI
×2
NeurIPS
×2
Frequent coauthors
Jiayuan Rao
DBLP profile ↗
ORCID search ↗
×3
Jilan Xu
DBLP profile ↗
ORCID search ↗
×2
Yibin Yan
DBLP profile ↗
ORCID search ↗
×2
Junyu Xie
DBLP profile ↗
ORCID search ↗
×2
Zeqian Li
DBLP profile ↗
ORCID search ↗
×2
Guanqi Zhan
DBLP profile ↗
ORCID search ↗
×2
Jiayu Lei
DBLP profile ↗
ORCID search ↗
×1
Shilin Yan
DBLP profile ↗
ORCID search ↗
×1
Zhongrui Gui
DBLP profile ↗
ORCID search ↗
×1
Yudi Shi
DBLP profile ↗
ORCID search ↗
×1
Qirui Chen
DBLP profile ↗
ORCID search ↗
×1
Yikun Liu
DBLP profile ↗
ORCID search ↗
×1
Papers
Versatile Vision-Language Model for 3D Computed Tomography
AAAI 2026
·
Jiayu Lei
DBLP profile ↗
ORCID search ↗
A Sanity Check for AI-generated Image Detection
ICLR 2025
·
Shilin Yan
DBLP profile ↗
ORCID search ↗
Character-Centric Understanding of Animated Movies
ACM MM 2025
·
Zhongrui Gui
DBLP profile ↗
ORCID search ↗
EgoExo-Gen: Ego-centric Video Prediction by Watching Exo-centric Videos
ICLR 2025
·
Jilan Xu
DBLP profile ↗
ORCID search ↗
Enhancing Video-LLM Reasoning via Agent-of-Thoughts Distillation
CVPR 2025
·
Yudi Shi
DBLP profile ↗
ORCID search ↗
Grounded Multi-Hop VideoQA in Long-Form Egocentric Videos
AAAI 2025
·
Qirui Chen
DBLP profile ↗
ORCID search ↗
LamRA: Large Multimodal Model as Your Advanced Retrieval Assistant
CVPR 2025
·
Yikun Liu
DBLP profile ↗
ORCID search ↗
Learning Streaming Video Representation via Multitask Training
ICCV 2025
·
Yibin Yan
DBLP profile ↗
ORCID search ↗
M3Builder: A Multi-agent System for Automated Machine Learning in Medical Imaging
MICCAI 2025
·
Jinghao Feng
DBLP profile ↗
ORCID search ↗
MRGen: Segmentation Data Engine for Underrepresented MRI Modalities
ICCV 2025
·
Haoning Wu
DBLP profile ↗
ORCID search ↗
Modeling Fine-Grained Hand-Object Dynamics for Egocentric Video Representation Learning
ICLR 2025
·
Baoqi Pei
DBLP profile ↗
ORCID search ↗
Multi-Agent System for Comprehensive Soccer Understanding
ACM MM 2025
·
Jiayuan Rao
DBLP profile ↗
ORCID search ↗
Object-Centric Video Question Answering with Visual Grounding and Referring
ICCV 2025
·
Haochen Wang
DBLP profile ↗
ORCID search ↗
RadIR: A Scalable Framework for Multi-grained Medical Image Retrieval via Radiology Report Mining
MICCAI 2025
·
Tengfei Zhang
DBLP profile ↗
ORCID search ↗
Shot-by-Shot: Film-Grammar-Aware Training-Free Audio Description Generation
ICCV 2025
·
Junyu Xie
DBLP profile ↗
ORCID search ↗
Towards Universal Soccer Video Understanding
CVPR 2025
·
Jiayuan Rao
DBLP profile ↗
ORCID search ↗
Track-On: Transformer-based Online Point Tracking with Memory
ICLR 2025
·
Görkay Aydemir
DBLP profile ↗
ORCID search ↗
Universal Video Temporal Grounding with Generative Multi-modal Large Language Models
NeurIPS 2025
·
Zeqian Li
DBLP profile ↗
ORCID search ↗
A General Protocol to Probe Large Vision Models for 3D Physical Understanding
NeurIPS 2024
·
Guanqi Zhan
DBLP profile ↗
ORCID search ↗
Amodal Ground Truth and Completion in the Wild
CVPR 2024
·
Guanqi Zhan
DBLP profile ↗
ORCID search ↗
Appearance-Based Refinement for Object-Centric Motion Segmentation
ECCV 2024
·
Junyu Xie
DBLP profile ↗
ORCID search ↗
Auto-ACD: A Large-scale Dataset for Audio-Language Representation Learning
ACM MM 2024
·
Luoyi Sun
DBLP profile ↗
ORCID search ↗
AutoAD III: The Prequel - Back to the Pixels
CVPR 2024
·
Tengda Han
DBLP profile ↗
ORCID search ↗
EchoSight: Advancing Visual-Language Models with Wiki Knowledge
EMNLP 2024
·
Yibin Yan
DBLP profile ↗
ORCID search ↗
Grounded Question-Answering in Long Egocentric Videos
CVPR 2024
·
Shangzhe Di
DBLP profile ↗
ORCID search ↗
InstaGen: Enhancing Object Detection by Training on Synthetic Dataset
CVPR 2024
·
Chengjian Feng
DBLP profile ↗
ORCID search ↗
Intelligent Grimm - Open-ended Visual Storytelling via Latent Diffusion Models
CVPR 2024
·
Chang Liu
DBLP profile ↗
ORCID search ↗
Knowledge-Enhanced Visual-Language Pretraining for Computational Pathology
ECCV 2024
·
Xiao Zhou
DBLP profile ↗
ORCID search ↗
Made to Order: Discovering Monotonic Temporal Changes via Self-supervised Video Ordering
ECCV 2024
·
Charig Yang
DBLP profile ↗
ORCID search ↗
MatchTime: Towards Automatic Soccer Game Commentary Generation
EMNLP 2024
·
Jiayuan Rao
DBLP profile ↗
ORCID search ↗
Multi-sentence Grounding for Long-Term Instructional Video
ECCV 2024
·
Zeqian Li
DBLP profile ↗
ORCID search ↗
RaTEScore: A Metric for Radiology Report Generation
EMNLP 2024
·
Weike Zhao
DBLP profile ↗
ORCID search ↗
Retrieval-Augmented Egocentric Video Captioning
CVPR 2024
·
Jilan Xu
DBLP profile ↗
ORCID search ↗
VISA: Reasoning Video Object Segmentation via Large Language Models
ECCV 2024
·
Cilin Yan
DBLP profile ↗
ORCID search ↗