P
PaperPicks
Conferences
Cordelia Schmid
INRIA, France
33 papers at tracked venues · 27 at CORE A* · active 2024–2025
DBLP profile ↗
ORCID 0009-0005-7239-3741 ↗
Google Scholar ↗
Homepage ↗
Venues
CVPR
×15
NeurIPS
×4
ICCV
×3
ICLR
×2
ICRA
×2
AAAI
×1
ACL
×1
ECCV
×1
EMNLP
×1
ICML
×1
IROS
×1
NAACL
×1
Frequent coauthors
Lucas Ventura
DBLP profile ↗
ORCID search ↗
×2
Xingyi Zhou
DBLP profile ↗
ORCID search ↗
×2
Zerui Chen
DBLP profile ↗
ORCID search ↗
×2
Riccardo Cadei
DBLP profile ↗
ORCID search ↗
×2
Matthieu Futeral
DBLP profile ↗
ORCID search ↗
×2
Mathilde Caron
DBLP profile ↗
ORCID search ↗
×2
Ian Huang
DBLP profile ↗
ORCID search ↗
×1
Shyamal Buch
DBLP profile ↗
ORCID search ↗
×1
Samiran Gode
DBLP profile ↗
ORCID search ↗
×1
Sai Kumar Dwivedi
DBLP profile ↗
ORCID search ↗
×1
Kaiwen Zha
DBLP profile ↗
ORCID search ↗
×1
Evangelos Kazakos
DBLP profile ↗
ORCID search ↗
×1
Papers
Chapter-Llama: Efficient Chaptering in Hour-Long Videos with LLMs
CVPR 2025
·
Lucas Ventura
DBLP profile ↗
ORCID search ↗
Dense Video Object Captioning from Disjoint Supervision
ICLR 2025
·
Xingyi Zhou
DBLP profile ↗
ORCID search ↗
FirePlace: Geometric Refinements of LLM Common Sense Reasoning for 3D Object Placement
CVPR 2025
·
Ian Huang
DBLP profile ↗
ORCID search ↗
Flexible Frame Selection for Efficient Video Reasoning
CVPR 2025
·
Shyamal Buch
DBLP profile ↗
ORCID search ↗
FlowNav: Combining Flow Matching and Depth Priors for Efficient Navigation
IROS 2025
·
Samiran Gode
DBLP profile ↗
ORCID search ↗
HORT: Monocular Hand-held Objects Reconstruction with Transformers
ICCV 2025
·
Zerui Chen
DBLP profile ↗
ORCID search ↗
InteractVLM: 3D Interaction Reasoning from 2D Foundational Models
CVPR 2025
·
Sai Kumar Dwivedi
DBLP profile ↗
ORCID search ↗
Language-Guided Image Tokenization for Generation
CVPR 2025
·
Kaiwen Zha
DBLP profile ↗
ORCID search ↗
Large-Scale Pre-Training for Grounded Video Caption Generation
ICCV 2025
·
Evangelos Kazakos
DBLP profile ↗
ORCID search ↗
Minerva: Evaluating Complex Video Reasoning
ICCV 2025
·
Arsha Nagrani
DBLP profile ↗
ORCID search ↗
OVFact: Measuring and Improving Open-Vocabulary Factuality for Long Caption Models
EMNLP 2025
·
Monika Wysoczanska
DBLP profile ↗
ORCID search ↗
Prediction-Powered Causal Inferences
NeurIPS 2025
·
Riccardo Cadei
DBLP profile ↗
ORCID search ↗
Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames
NeurIPS 2025
·
Anurag Arnab
DBLP profile ↗
ORCID search ↗
Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-Guided 3D Policy
ICRA 2025
·
Ricardo Garcia
DBLP profile ↗
ORCID search ↗
Towards Zero-Shot Multimodal Machine Translation
NAACL 2025
·
Matthieu Futeral
DBLP profile ↗
ORCID search ↗
ViViDex: Learning Vision-Based Dexterous Manipulation from Human Videos
ICRA 2025
·
Zerui Chen
DBLP profile ↗
ORCID search ↗
Visual Lexicon: Rich Image Features in Language Space
CVPR 2025
·
Xudong Wang
DBLP profile ↗
ORCID search ↗
mOSCAR: A Large-scale Multilingual and Multimodal Document-level Corpus
ACL 2025
·
Matthieu Futeral
DBLP profile ↗
ORCID search ↗
A Generative Approach for Wikipedia-Scale Visual Entity Recognition
CVPR 2024
·
Mathilde Caron
DBLP profile ↗
ORCID search ↗
CoVR: Learning Composed Video Retrieval from Web Video Captions
AAAI 2024
·
Lucas Ventura
DBLP profile ↗
ORCID search ↗
DataDream: Few-Shot Guided Dataset Generation
ECCV 2024
·
Jae Myung Kim
DBLP profile ↗
ORCID search ↗
Dense Optical Tracking: Connecting the Dots
CVPR 2024
·
Guillaume Le Moing
DBLP profile ↗
ORCID search ↗
End-to-End Spatio-Temporal Action Localisation with Video Transformers
CVPR 2024
·
Alexey A. Gritsenko
DBLP profile ↗
ORCID search ↗
Learning Correlation Structures for Vision Transformers
CVPR 2024
·
Manjin Kim
DBLP profile ↗
ORCID search ↗
MoReVQA: Exploring Modular Reasoning Models for Video Question Answering
CVPR 2024
·
Juhong Min
DBLP profile ↗
ORCID search ↗
Pixel Aligned Language Models
CVPR 2024
·
Jiarui Xu
DBLP profile ↗
ORCID search ↗
Retrieval-Enhanced Contrastive Vision-Text Models
ICLR 2024
·
Ahmet Iscen
DBLP profile ↗
ORCID search ↗
SUGAR : Pre-training 3D Visual Representations for Robotics
CVPR 2024
·
Shizhe Chen
DBLP profile ↗
ORCID search ↗
SceneCraft: An LLM Agent for Synthesizing 3D Scenes as Blender Code
ICML 2024
·
Ziniu Hu
DBLP profile ↗
ORCID search ↗
Smoke and Mirrors in Causal Downstream Tasks
NeurIPS 2024
·
Riccardo Cadei
DBLP profile ↗
ORCID search ↗
Streaming Dense Video Captioning
CVPR 2024
·
Xingyi Zhou
DBLP profile ↗
ORCID search ↗
Time-, Memory- and Parameter-Efficient Visual Adaptation
CVPR 2024
·
Otniel-Bogdan Mercea
DBLP profile ↗
ORCID search ↗
Web-Scale Visual Entity Recognition: An LLM-Driven Data Approach
NeurIPS 2024
·
Mathilde Caron
DBLP profile ↗
ORCID search ↗