P
PaperPicks
Conferences
Xiangtai Li
51 papers at tracked venues · 45 at CORE A* · active 2024–2026
DBLP profile ↗
ORCID 0000-0002-0550-8247 ↗
Homepage ↗
Venues
CVPR
×13
NeurIPS
×10
ICLR
×6
AAAI
×5
ICCV
×5
ECCV
×4
ACM MM
×3
ICML
×3
CIKM
×1
ICRA
×1
Frequent coauthors
Chaoyang Wang
DBLP profile ↗
ORCID search ↗
×3
Jianzong Wu
DBLP profile ↗
ORCID search ↗
×3
Hao Yang
DBLP profile ↗
ORCID search ↗
×2
Zhucun Xue
DBLP profile ↗
ORCID search ↗
×2
Yikang Zhou
DBLP profile ↗
ORCID search ↗
×2
Qingyu Shi
DBLP profile ↗
ORCID search ↗
×2
Shengqiong Wu
DBLP profile ↗
ORCID search ↗
×2
Huadai Liu
DBLP profile ↗
ORCID search ↗
×2
Hao Fei
DBLP profile ↗
ORCID search ↗
×2
Tao Zhang
DBLP profile ↗
ORCID search ↗
×2
Yicheng Chen
DBLP profile ↗
ORCID search ↗
×1
Peiwen Sun
DBLP profile ↗
ORCID search ↗
×1
Papers
PointDGRWKV: Generalizing RWKV-like Architecture to Unseen Domains for Point Cloud Classification
AAAI 2026
·
Hao Yang
DBLP profile ↗
ORCID search ↗
AdaVideoRAG: Omni-Contextual Adaptive Retrieval-Augmented Efficient Long Video Understanding
NeurIPS 2025
·
Zhucun Xue
DBLP profile ↗
ORCID search ↗
Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs
ICCV 2025
·
Yikang Zhou
DBLP profile ↗
ORCID search ↗
Auto Cherry-Picker: Learning from High-quality Generative Data Driven by Language
CVPR 2025
·
Yicheng Chen
DBLP profile ↗
ORCID search ↗
Both Ears Wide Open: Towards Language-Driven Spatial Audio Generation
ICLR 2025
·
Peiwen Sun
DBLP profile ↗
ORCID search ↗
Bridge Feature Matching and Cross-Modal Alignment with Mutual-Filtering for Zero-Shot Anomaly Detection
ICCV 2025
·
Yuhu Bai
DBLP profile ↗
ORCID search ↗
Conditional Panoramic Image Generation via Masked Autoregressive Modeling
NeurIPS 2025
·
Chaoyang Wang
DBLP profile ↗
ORCID search ↗
Decouple and Track: Benchmarking and Improving Video Diffusion Transformers for Motion Transfer
ICCV 2025
·
Qingyu Shi
DBLP profile ↗
ORCID search ↗
DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation
CVPR 2025
·
Jianzong Wu
DBLP profile ↗
ORCID search ↗
DreamRelation: Bridging Customization and Relation Generation
CVPR 2025
·
Qingyu Shi
DBLP profile ↗
ORCID search ↗
Explore In-Context Segmentation via Latent Diffusion Models
AAAI 2025
·
Chaoyang Wang
DBLP profile ↗
ORCID search ↗
Learning 4D Panoptic Scene Graph Generation from Rich 2D Visual Scene
CVPR 2025
·
Shengqiong Wu
DBLP profile ↗
ORCID search ↗
MERIT: Multilingual Semantic Retrieval with Interleaved Multi-Condition Query
NeurIPS 2025
·
Wei Chow
DBLP profile ↗
ORCID search ↗
Meissonic: Revitalizing Masked Generative Transformers for Efficient High-Resolution Text-to-Image Synthesis
ICLR 2025
·
Jinbin Bai
DBLP profile ↗
ORCID search ↗
MelodyEdit: Zero-shot Music Editing with Disentangled Inversion Control
ACM MM 2025
·
Huadai Liu
DBLP profile ↗
ORCID search ↗
NTIRE 2025 Challenge on Day and Night Raindrop Removal for Dual-Focused Images: Methods and Results
CVPR 2025
·
Xin Li
DBLP profile ↗
ORCID search ↗
OmniAudio: Generating Spatial Audio from 360-Degree Video
ICML 2025
·
Huadai Liu
DBLP profile ↗
ORCID search ↗
On Path to Multimodal Generalist: General-Level and General-Bench
ICML 2025
·
Hao Fei
DBLP profile ↗
ORCID search ↗
Point Cloud Mamba: Point Cloud Learning via State Space Model
AAAI 2025
·
Tao Zhang
DBLP profile ↗
ORCID search ↗
PointDGMamba: Domain Generalization of Point Cloud Classification via Generalized State Space Model
AAAI 2025
·
Hao Yang
DBLP profile ↗
ORCID search ↗
PointRWKV: Efficient RWKV-Like Model for Hierarchical Point Cloud Learning
AAAI 2025
·
Qingdong He
DBLP profile ↗
ORCID search ↗
QK-Edit: Revisiting Attention-based Injection in MM-DiT for Image and Video Editing
ICCV 2025
·
Tiancheng Shen
DBLP profile ↗
ORCID search ↗
RMP-SAM: Towards Real-Time Multi-Purpose Segment Anything
ICLR 2025
·
Shilin Xu
DBLP profile ↗
ORCID search ↗
RobuRCDet: Enhancing Robustness of Radar-Camera Fusion in Bird's Eye View for 3D Object Detection
ICLR 2025
·
Jingtong Yue
DBLP profile ↗
ORCID search ↗
SIDA: Social Media Image Deepfake Detection, Localization and Explanation with Large Multimodal Model
CVPR 2025
·
Zhenglin Huang
DBLP profile ↗
ORCID search ↗
The Scalability of Simplicity: Empirical Analysis of Vision-Language Learning with a Single Transformer
ICCV 2025
·
Weixian Lei
DBLP profile ↗
ORCID search ↗
Three-Dimensional Trajectory Prediction with 3DMoTraj Dataset
ICML 2025
·
Hao Zhou
DBLP profile ↗
ORCID search ↗
Towards Semantic Equivalence of Tokenization in Multimodal LLM
ICLR 2025
·
Shengqiong Wu
DBLP profile ↗
ORCID search ↗
UltraVideo: High-Quality UHD Video Dataset with Comprehensive Captions
NeurIPS 2025
·
Zhucun Xue
DBLP profile ↗
ORCID search ↗
Unified Dense Prediction of Video Diffusion
CVPR 2025
·
Lehan Yang
DBLP profile ↗
ORCID search ↗
VimoRAG: Video-based Retrieval-augmented 3D Motion Generation for Motion Language Models
NeurIPS 2025
·
Haidong Xu
DBLP profile ↗
ORCID search ↗
BA-SAM: Scalable Bias-Mode Attention Mask for Segment Anything Model
CVPR 2024
·
Yiran Song
DBLP profile ↗
ORCID search ↗
CLIPSelf: Vision Transformer Distills Itself for Open-Vocabulary Dense Prediction
ICLR 2024
·
Size Wu
DBLP profile ↗
ORCID search ↗
DGMamba: Domain Generalization via Generalized State Space Model
ACM MM 2024
·
Shaocong Long
DBLP profile ↗
ORCID search ↗
Face-Adapter for Pre-trained Diffusion Models with Fine-Grained ID and Attribute Control
ECCV 2024
·
Yue Han
DBLP profile ↗
ORCID search ↗
From Multimodal LLM to Human-level AI: Modality, Instruction, Reasoning and Beyond
ACM MM 2024
·
Hao Fei
DBLP profile ↗
ORCID search ↗
GenView: Enhancing View Quality with Pretrained Generative Model for Self-Supervised Learning
ECCV 2024
·
Xiaojie Li
DBLP profile ↗
ORCID search ↗
Improving Video Segmentation via Dynamic Anchor Queries
ECCV 2024
·
Yikang Zhou
DBLP profile ↗
ORCID search ↗
MambaAD: Exploring State Space Models for Multi-class Unsupervised Anomaly Detection
NeurIPS 2024
·
Haoyang He
DBLP profile ↗
ORCID search ↗
MotionBooth: Motion-Aware Customized Text-to-Video Generation
NeurIPS 2024
·
Jianzong Wu
DBLP profile ↗
ORCID search ↗
OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding
NeurIPS 2024
·
Tao Zhang
DBLP profile ↗
ORCID search ↗
OMG-Seg: Is One Model Good Enough for all Segmentation?
CVPR 2024
·
Xiangtai Li
Open-Vocabulary SAM: Segment and Recognize Twenty-Thousand Classes Interactively
ECCV 2024
·
Haobo Yuan
DBLP profile ↗
ORCID search ↗
RTMO: Towards High-Performance One-Stage Real-Time Multi-Person Pose Estimation
CVPR 2024
·
Peng Lu
DBLP profile ↗
ORCID search ↗
Referring Image Editing: Object-Level Image Editing via Referring Expressions
CVPR 2024
·
Chang Liu
DBLP profile ↗
ORCID search ↗
SemFlow: Binding Semantic Segmentation and Image Synthesis via Rectified Flow
NeurIPS 2024
·
Chaoyang Wang
DBLP profile ↗
ORCID search ↗
Skeleton-in-Context: Unified Skeleton Sequence Modeling with In-Context Learning
CVPR 2024
·
Xinshun Wang
DBLP profile ↗
ORCID search ↗
Synergistic Dual Spatial-aware Generation of Image-to-text and Text-to-image
NeurIPS 2024
·
Yu Zhao
DBLP profile ↗
ORCID search ↗
Towards Language-Driven Video Inpainting via Multimodal Large Language Models
CVPR 2024
·
Jianzong Wu
DBLP profile ↗
ORCID search ↗
VG4D: Vision-Language Model Goes 4D Video Recognition
ICRA 2024
·
Zhichao Deng
DBLP profile ↗
ORCID search ↗
You Can't Ignore Either: Unifying Structure and Feature Denoising for Robust Graph Learning
CIKM 2024
·
Tianmeng Yang
DBLP profile ↗
ORCID search ↗