P
PaperPicks
Conferences
Xiang Bai
52 papers at tracked venues · 41 at CORE A* · active 2024–2026
DBLP profile ↗
ORCID 0000-0002-3449-5940 ↗
Homepage ↗
Venues
ICCV
×11
NeurIPS
×11
CVPR
×8
ECCV
×8
AAAI
×4
ACL
×4
EMNLP
×2
ICLR
×1
ICML
×1
MICCAI
×1
SIGIR
×1
Frequent coauthors
Dingkang Liang
DBLP profile ↗
ORCID search ↗
×2
Chunlin Zhong
DBLP profile ↗
ORCID search ↗
×2
Hongkai Lin
DBLP profile ↗
ORCID search ↗
×2
Zijie Wu
DBLP profile ↗
ORCID search ↗
×2
Xin Zhou
DBLP profile ↗
ORCID search ↗
×2
Zhang Li
DBLP profile ↗
ORCID search ↗
×2
Mingxin Huang
DBLP profile ↗
ORCID search ↗
×2
Wei Xu
DBLP profile ↗
ORCID search ↗
×2
Zhe Liu
DBLP profile ↗
ORCID search ↗
×2
Ziyang Wang
DBLP profile ↗
ORCID search ↗
×1
Yuanlei Zheng
DBLP profile ↗
ORCID search ↗
×1
Jinghan Yu
DBLP profile ↗
ORCID search ↗
×1
Papers
AutoLink: Autonomous Schema Exploration and Expansion for Scalable Schema Linking in Text-to-SQL at Scale
AAAI 2026
·
Ziyang Wang
DBLP profile ↗
ORCID search ↗
Cook and Clean Together: Teaching Embodied Agents for Parallel Task Execution
AAAI 2026
·
Dingkang Liang
DBLP profile ↗
ORCID search ↗
Doc-V*: Coarse-to-Fine Interactive Visual Reasoning for Multi-Page Document VQA
ACL 2026
·
Yuanlei Zheng
DBLP profile ↗
ORCID search ↗
I2E: From Image Pixels to Actionable Interactive Environments for Text-Guided Image Editing
ACL 2026
·
Jinghan Yu
DBLP profile ↗
ORCID search ↗
OwlCap: Harmonizing Motion-Detail for Video Captioning via HMD-270K and Caption Set Equivalence Reward
AAAI 2026
·
Chunlin Zhong
DBLP profile ↗
ORCID search ↗
StreamKV: Streaming Video Question-Answering with Segment-based KV Cache Retrieval and Compression
AAAI 2026
·
Yilong Chen
DBLP profile ↗
ORCID search ↗
A Unified Image-Dense Annotation Generation Model for Underwater Scenes
CVPR 2025
·
Hongkai Lin
DBLP profile ↗
ORCID search ↗
AnimateAnyMesh: A Feed-Forward 4D Foundation Model for Text-Driven Universal Mesh Animation
ICCV 2025
·
Zijie Wu
DBLP profile ↗
ORCID search ↗
CLIP-AdaM: Adapting Multi-view CLIP for Open-set 3D Object Retrieval
SIGIR 2025
·
Xinwei He
DBLP profile ↗
ORCID search ↗
Describe, Adapt and Combine: Empowering CLIP Encoders for Open-Set 3D Object Retrieval
ICCV 2025
·
Zhichuan Wang
DBLP profile ↗
ORCID search ↗
DocThinker: Explainable Multimodal Large Language Models with Rule-Based Reinforcement Learning for Document Understanding
ICCV 2025
·
Wenwen Yu
DBLP profile ↗
ORCID search ↗
HERMES: A Unified Self-Driving World Model for Simultaneous 3D Scene Understanding and Generation
ICCV 2025
·
Xin Zhou
DBLP profile ↗
ORCID search ↗
LIRA: Inferring Segmentation in Large Multi-Modal Models with Local Interleaved Region Assistance
ICCV 2025
·
Zhang Li
DBLP profile ↗
ORCID search ↗
LLaVA-KD: A Framework of Distilling Multimodal Large Language Models
ICCV 2025
·
Yuxuan Cai
DBLP profile ↗
ORCID search ↗
MINIMA: Modality Invariant Image Matching
CVPR 2025
·
Jiangwei Ren
DBLP profile ↗
ORCID search ↗
MSTAR: Box-free Multi-query Scene Text Retrieval with Attention Recycling
NeurIPS 2025
·
Liang Yin
DBLP profile ↗
ORCID search ↗
MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering
ACL 2025
·
Jingqun Tang
DBLP profile ↗
ORCID search ↗
MiCo: Multi-image Contrast for Reinforcement Visual Reasoning
NeurIPS 2025
·
Xi Chen
DBLP profile ↗
ORCID search ↗
Mini-Monkey: Alleviating the Semantic Sawtooth Effect for Lightweight MLLMs via Complementary Image Pyramid
ICLR 2025
·
Mingxin Huang
DBLP profile ↗
ORCID search ↗
More Than Generation: Unifying Generation and Depth Estimation via Text-to-Image Diffusion Models
NeurIPS 2025
·
Hongkai Lin
DBLP profile ↗
ORCID search ↗
Multi-Scenario Overlapping Text Segmentation with Depth Awareness
ICCV 2025
·
Yang Liu
DBLP profile ↗
ORCID search ↗
NAUTILUS: A Large Multimodal Model for Underwater Scene Understanding
NeurIPS 2025
·
Wei Xu
DBLP profile ↗
ORCID search ↗
OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning
NeurIPS 2025
·
Ling Fu
DBLP profile ↗
ORCID search ↗
Orion: A Holistic End-To-End Autonomous Driving Framework by Vision-Language Instructed Action Generation
ICCV 2025
·
Haoyu Fu
DBLP profile ↗
ORCID search ↗
PathVG: A New Benchmark and Dataset for Pathology Visual Grounding
MICCAI 2025
·
Chunlin Zhong
DBLP profile ↗
ORCID search ↗
PlayerOne: Egocentric World Simulator
NeurIPS 2025
·
Yuanpeng Tu
DBLP profile ↗
ORCID search ↗
Recammaster: Camera-Controlled Generative Rendering From a Single Video
ICCV 2025
·
Jianhong Bai
DBLP profile ↗
ORCID search ↗
SemiETS: Integrating Spatial and Content Consistencies for Semi-Supervised End-to-end Text Spotting
CVPR 2025
·
Dongliang Luo
DBLP profile ↗
ORCID search ↗
Theorem-Validated Reverse Chain-of-Thought Problem Generation for Geometric Reasoning
EMNLP 2025
·
Linger Deng
DBLP profile ↗
ORCID search ↗
Towards Comprehensive Lecture Slides Understanding: Large-Scale Dataset and Effective Method
ICCV 2025
·
Enming Zhang
DBLP profile ↗
ORCID search ↗
Training-Free Geometric Image Editing on Diffusion Models
ICCV 2025
·
Hanshen Zhu
DBLP profile ↗
ORCID search ↗
URDF-Anything: Constructing Articulated Objects with 3D Multimodal Language Model
NeurIPS 2025
·
Zhe Li
DBLP profile ↗
ORCID search ↗
VIP: Vision Instructed Pre-training for Robotic Manipulation
ICML 2025
·
Zhuoling Li
DBLP profile ↗
ORCID search ↗
WildDoc: How Far Are We from Achieving Comprehensive and Robust Document Understanding in the Wild?
EMNLP 2025
·
An-Lan Wang
DBLP profile ↗
ORCID search ↗
A Unified Framework for 3D Scene Understanding
NeurIPS 2024
·
Wei Xu
DBLP profile ↗
ORCID search ↗
Bridging the Gap Between End-to-End and Two-Step Text Spotting
CVPR 2024
·
Mingxin Huang
DBLP profile ↗
ORCID search ↗
Deciphering Oracle Bone Language with Diffusion Models
ACL 2024
·
Haisu Guan
DBLP profile ↗
ORCID search ↗
Dynamic Adapter Meets Prompt Tuning: Parameter-Efficient Transfer Learning for Point Cloud Analysis
CVPR 2024
·
Xin Zhou
DBLP profile ↗
ORCID search ↗
General Object Foundation Model for Images and Videos at Scale
CVPR 2024
·
Junfeng Wu
DBLP profile ↗
ORCID search ↗
LION: Linear Group RNN for 3D Object Detection in Point Clouds
NeurIPS 2024
·
Zhe Liu
DBLP profile ↗
ORCID search ↗
Make Your ViT-Based Multi-view 3D Detectors Faster via Token Compression
ECCV 2024
·
Dingyuan Zhang
DBLP profile ↗
ORCID search ↗
MoE Jetpack: From Dense Checkpoints to Adaptive Mixture of Experts for Vision Tasks
NeurIPS 2024
·
Xingkui Zhu
DBLP profile ↗
ORCID search ↗
Monkey: Image Resolution and Text Label are Important Things for Large Multi-Modal Models
CVPR 2024
·
Zhang Li
DBLP profile ↗
ORCID search ↗
OMNIPARSER: A Unified Framework for Text Spotting, Key Information Extraction and Table Recognition
CVPR 2024
·
Jianqiang Wan
DBLP profile ↗
ORCID search ↗
OPEN: Object-Wise Position Embedding for Multi-view 3D Object Detection
ECCV 2024
·
Jinghua Hou
DBLP profile ↗
ORCID search ↗
PSALM: Pixelwise SegmentAtion with Large Multi-modal Model
ECCV 2024
·
Zheng Zhang
DBLP profile ↗
ORCID search ↗
PartGLEE: A Foundation Model for Recognizing and Parsing Any Objects
ECCV 2024
·
Junyi Li
DBLP profile ↗
ORCID search ↗
PointMamba: A Simple State Space Model for Point Cloud Analysis
NeurIPS 2024
·
Dingkang Liang
DBLP profile ↗
ORCID search ↗
SC4D: Sparse-Controlled Video-to-4D Generation and Motion Transfer
ECCV 2024
·
Zijie Wu
DBLP profile ↗
ORCID search ↗
SEED: A Simple and Effective 3D DETR in Point Clouds
ECCV 2024
·
Zhe Liu
DBLP profile ↗
ORCID search ↗
WAS: Dataset and Methods for Artistic Text Segmentation
ECCV 2024
·
Xudong Xie
DBLP profile ↗
ORCID search ↗
Well Begun is Half Done: The Importance of Initialization in Dataset Distillation
ECCV 2024
·
Yiran Guan
DBLP profile ↗
ORCID search ↗