P
PaperPicks
Conferences
Longteng Guo
17 papers at tracked venues · 13 at CORE A* · active 2024–2026
DBLP profile ↗
ORCID 0000-0002-4340-4000 ↗
Venues
ACL
×3
CVPR
×3
EMNLP
×3
AAAI
×2
ACM MM
×2
ICLR
×2
ICCV
×1
WACV
×1
Frequent coauthors
Tongtian Yue
DBLP profile ↗
ORCID search ↗
×2
Zijia Zhao
DBLP profile ↗
ORCID search ↗
×2
Shichen Lu
DBLP profile ↗
ORCID search ↗
×2
Jiatong Ma
DBLP profile ↗
ORCID search ↗
×1
Yanghong Mei
DBLP profile ↗
ORCID search ↗
×1
Handong Li
DBLP profile ↗
ORCID search ↗
×1
Qianyi Liu
DBLP profile ↗
ORCID search ↗
×1
Zikang Liu
DBLP profile ↗
ORCID search ↗
×1
Junyi Chen
DBLP profile ↗
ORCID search ↗
×1
Mingzhen Sun
DBLP profile ↗
ORCID search ↗
×1
Dongze Hao
DBLP profile ↗
ORCID search ↗
×1
Wenxuan Wang
DBLP profile ↗
ORCID search ↗
×1
Papers
Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning
ACL 2026
·
Longteng Guo
M³-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering
ACL 2026
·
Jiatong Ma
DBLP profile ↗
ORCID search ↗
SciVQR: A Multidisciplinary Multimodal Benchmark for Advanced Scientific Reasoning Evaluation
ACL 2026
·
Longteng Guo
UrbanNav: Learning Language-Guided Embodied Urban Navigation from Web-Scale Human Trajectories
AAAI 2026
·
Yanghong Mei
DBLP profile ↗
ORCID search ↗
Ada-K Routing: Boosting the Efficiency of MoE-based LLMs
ICLR 2025
·
Tongtian Yue
DBLP profile ↗
ORCID search ↗
Breaking the Encoder Barrier for Seamless Video-Language Understanding
ICCV 2025
·
Handong Li
DBLP profile ↗
ORCID search ↗
Efficient Motion-Aware Video MLLM
CVPR 2025
·
Zijia Zhao
DBLP profile ↗
ORCID search ↗
GroundingMate: Aiding Object Grounding for Goal-Oriented Vision-and-Language Navigation
WACV 2025
·
Qianyi Liu
DBLP profile ↗
ORCID search ↗
Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs
ICLR 2025
·
Zijia Zhao
DBLP profile ↗
ORCID search ↗
VRoPE: Rotary Position Embedding for Video Large Language Models
EMNLP 2025
·
Zikang Liu
DBLP profile ↗
ORCID search ↗
ViPE: Visual Perception in Parameter Space for Efficient Video-Language Understanding
EMNLP 2025
·
Shichen Lu
DBLP profile ↗
ORCID search ↗
Collaborative Training of Tiny-Large Vision Language Models
ACM MM 2024
·
Shichen Lu
DBLP profile ↗
ORCID search ↗
EVE: Efficient Vision-Language Pre-training with Masked Prediction and Modality-Aware MoE
AAAI 2024
·
Junyi Chen
DBLP profile ↗
ORCID search ↗
MM-LDM: Multi-Modal Latent Diffusion Model for Sounding Video Generation
ACM MM 2024
·
Mingzhen Sun
DBLP profile ↗
ORCID search ↗
SC- Tune: Unleashing Self-Consistent Referential Comprehension in Large Vision Language Models
CVPR 2024
·
Tongtian Yue
DBLP profile ↗
ORCID search ↗
Self-Bootstrapped Visual-Language Model for Knowledge Selection and Question Answering
EMNLP 2024
·
Dongze Hao
DBLP profile ↗
ORCID search ↗
Unveiling Parts Beyond Objects: Towards Finer-Granularity Referring Expression Segmentation
CVPR 2024
·
Wenxuan Wang
DBLP profile ↗
ORCID search ↗