P
PaperPicks
Conferences
Haiyang Xu
Alibaba Group
21 papers at tracked venues · 18 at CORE A* · active 2024–2026
DBLP profile ↗
ORCID 0000-0001-9442-5912 ↗
Google Scholar ↗
Homepage ↗
Venues
NeurIPS
×4
ACL
×3
CVPR
×3
EMNLP
×3
AAAI
×2
ACM MM
×2
ICLR
×2
ICML
×2
Frequent coauthors
Chaoya Jiang
DBLP profile ↗
ORCID search ↗
×5
Anwen Hu
DBLP profile ↗
ORCID search ↗
×3
Lang Feng
DBLP profile ↗
ORCID search ↗
×2
Zihua Wang
DBLP profile ↗
ORCID search ↗
×1
Zhengxi Lu
DBLP profile ↗
ORCID search ↗
×1
Shengjie Zhou
DBLP profile ↗
ORCID search ↗
×1
Xin Cheng
DBLP profile ↗
ORCID search ↗
×1
Yuyang Wanyan
DBLP profile ↗
ORCID search ↗
×1
Hongrui Jia
DBLP profile ↗
ORCID search ↗
×1
Jiabo Ye
DBLP profile ↗
ORCID search ↗
×1
Haowei Liu
DBLP profile ↗
ORCID search ↗
×1
Junyang Wang
DBLP profile ↗
ORCID search ↗
×1
Papers
AgentOCR: Reimagining Agent History via Optical Self-Compression
ACL 2026
·
Lang Feng
DBLP profile ↗
ORCID search ↗
Efficient and Effective In-context Demonstration Selection with Coreset
AAAI 2026
·
Zihua Wang
DBLP profile ↗
ORCID search ↗
Experience-driven Multi-turn Reinforcement Learning for GUI Agents
ACL 2026
·
Zhengxi Lu
DBLP profile ↗
ORCID search ↗
Endowing Visual Reprogramming with Adversarial Robustness
ICLR 2025
·
Shengjie Zhou
DBLP profile ↗
ORCID search ↗
Exploiting Presentative Feature Distributions for Parameter-Efficient Continual Learning of Large Language Models
ICML 2025
·
Xin Cheng
DBLP profile ↗
ORCID search ↗
Look Before You Leap: A GUI-Critic-R1 Model for Pre-Operative Error Diagnosis in GUI Automation
NeurIPS 2025
·
Yuyang Wanyan
DBLP profile ↗
ORCID search ↗
SymDPO: Boosting In-Context Learning of Large Multimodal Models with Symbol Demonstration Direct Preference Optimization
CVPR 2025
·
Hongrui Jia
DBLP profile ↗
ORCID search ↗
Towards Efficient Online Tuning of VLM Agents via Counterfactual Soft Reinforcement Learning
ICML 2025
·
Lang Feng
DBLP profile ↗
ORCID search ↗
VLM-R³: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought
NeurIPS 2025
·
Chaoya Jiang
DBLP profile ↗
ORCID search ↗
mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding
ACL 2025
·
Anwen Hu
DBLP profile ↗
ORCID search ↗
mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models
ICLR 2025
·
Jiabo Ye
DBLP profile ↗
ORCID search ↗
Hal-Eval: A Universal and Fine-grained Hallucination Evaluation Framework for Large Vision Language Models
ACM MM 2024
·
Chaoya Jiang
DBLP profile ↗
ORCID search ↗
Hallucination Augmented Contrastive Learning for Multimodal Large Language Model
CVPR 2024
·
Chaoya Jiang
DBLP profile ↗
ORCID search ↗
MIBench: Evaluating Multimodal Large Language Models over Multiple Images
EMNLP 2024
·
Haowei Liu
DBLP profile ↗
ORCID search ↗
MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
NeurIPS 2024
·
Chaoya Jiang
DBLP profile ↗
ORCID search ↗
Mobile-Agent-v2: Mobile Device Operation Assistant with Effective Navigation via Multi-Agent Collaboration
NeurIPS 2024
·
Junyang Wang
DBLP profile ↗
ORCID search ↗
TiMix: Text-Aware Image Mixing for Effective Vision-Language Pre-training
AAAI 2024
·
Chaoya Jiang
DBLP profile ↗
ORCID search ↗
TinyChart: Efficient Chart Understanding with Program-of-Thoughts Learning and Visual Token Merging
EMNLP 2024
·
Liang Zhang
DBLP profile ↗
ORCID search ↗
mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding
EMNLP 2024
·
Anwen Hu
DBLP profile ↗
ORCID search ↗
mPLUG-OwI2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration
CVPR 2024
·
Qinghao Ye
DBLP profile ↗
ORCID search ↗
mPLUG-PaperOwl: Scientific Diagram Analysis with the Multimodal Large Language Model
ACM MM 2024
·
Anwen Hu
DBLP profile ↗
ORCID search ↗