P
PaperPicks
Conferences
Xiaoshuai Sun
35 papers at tracked venues · 32 at CORE A* · active 2024–2026
DBLP profile ↗
ORCID 0000-0003-3912-9306 ↗
Homepage ↗
Venues
AAAI
×8
ACM MM
×6
NeurIPS
×5
CVPR
×4
ICML
×4
ICLR
×3
ECCV
×2
ACL
×1
EMNLP
×1
ICCV
×1
Frequent coauthors
Zhipeng Qian
DBLP profile ↗
ORCID search ↗
×4
Changli Wu
DBLP profile ↗
ORCID search ↗
×3
Mingrui Wu
DBLP profile ↗
ORCID search ↗
×3
Qiong Wu
DBLP profile ↗
ORCID search ↗
×2
Ziyin Zhou
DBLP profile ↗
ORCID search ↗
×2
Jinlu Zhang
DBLP profile ↗
ORCID search ↗
×2
Ke Sun
DBLP profile ↗
ORCID search ↗
×2
Danni Yang
DBLP profile ↗
ORCID search ↗
×2
Yiwei Ma
DBLP profile ↗
ORCID search ↗
×2
Lvpan Cai
DBLP profile ↗
ORCID search ↗
×1
Yubin Gu
DBLP profile ↗
ORCID search ↗
×1
Gen Luo
DBLP profile ↗
ORCID search ↗
×1
Papers
CSMCIR: CoT-Enhanced Symmetric Alignment with Memory Bank for Composed Image Retrieval
ACL 2026
·
Zhipeng Qian
DBLP profile ↗
ORCID search ↗
Zooming In on Fakes: A Novel Dataset for Localized AI-Generated Image Detection with Forgery Amplification Approach
AAAI 2026
·
Lvpan Cai
DBLP profile ↗
ORCID search ↗
ACL: Activating Capability of Linear Attention for Image Restoration
CVPR 2025
·
Yubin Gu
DBLP profile ↗
ORCID search ↗
Accelerating Multimodal Large Language Models via Dynamic Visual-Token Exit and the Empirical Findings
NeurIPS 2025
·
Qiong Wu
DBLP profile ↗
ORCID search ↗
Aigi-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models
ICCV 2025
·
Ziyin Zhou
DBLP profile ↗
ORCID search ↗
Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models
ICLR 2025
·
Gen Luo
DBLP profile ↗
ORCID search ↗
FlashSloth : Lightning Multimodal Large Language Models via Embedded Visual Compression
CVPR 2025
·
Bo Tong
DBLP profile ↗
ORCID search ↗
HRSeg: High-Resolution Visual Perception and Enhancement for Reasoning Segmentation
ACM MM 2025
·
Weihuang Lin
DBLP profile ↗
ORCID search ↗
IPDN: Image-enhanced Prompt Decoding Network for 3D Referring Expression Segmentation
AAAI 2025
·
Qi Chen
DBLP profile ↗
ORCID search ↗
MIHBench: Benchmarking and Mitigating Multi-Image Hallucinations in Multimodal Large Language Models
ACM MM 2025
·
Jiale Li
DBLP profile ↗
ORCID search ↗
Routing Experts: Learning to Route Dynamic Experts in Existing Multi-modal Large Language Models
ICLR 2025
·
Qiong Wu
DBLP profile ↗
ORCID search ↗
StoryWeaver: A Unified World Model for Knowledge-Enhanced Story Character Customization
AAAI 2025
·
Jinlu Zhang
DBLP profile ↗
ORCID search ↗
Towards General Visual-Linguistic Face Forgery Detection
CVPR 2025
·
Ke Sun
DBLP profile ↗
ORCID search ↗
γ-MoD: Exploring Mixture-of-Depth Adaptation for Multimodal Large Language Models
ICLR 2025
·
Yaxin Luo
DBLP profile ↗
ORCID search ↗
3D-GRES: Generalized 3D Referring Expression Segmentation
ACM MM 2024
·
Changli Wu
DBLP profile ↗
ORCID search ↗
3D-STMN: Dependency-Driven Superpoint-Text Matching Network for End-to-End 3D Referring Expression Segmentation
AAAI 2024
·
Changli Wu
DBLP profile ↗
ORCID search ↗
AnyTrans: Translate AnyText in the Image with Large Scale Models
EMNLP 2024
·
Zhipeng Qian
DBLP profile ↗
ORCID search ↗
ControlMLLM: Training-Free Visual Prompt Learning for Multimodal Large Language Models
NeurIPS 2024
·
Mingrui Wu
DBLP profile ↗
ORCID search ↗
Deep Instruction Tuning for Segment Anything Model
ACM MM 2024
·
Xiaorui Huang
DBLP profile ↗
ORCID search ↗
DiffusionFake: Enhancing Generalization in Deepfake Detection via Guided Stable Diffusion
NeurIPS 2024
·
Ke Sun
DBLP profile ↗
ORCID search ↗
Evaluating and Analyzing Relationship Hallucinations in Large Vision-Language Models
ICML 2024
·
Mingrui Wu
DBLP profile ↗
ORCID search ↗
Exploring Phrase-Level Grounding with Text-to-Image Diffusion Model
ECCV 2024
·
Danni Yang
DBLP profile ↗
ORCID search ↗
Fast Text-to-3D-Aware Face Generation and Manipulation via Direct Cross-modal Mapping and Geometric Regularization
ICML 2024
·
Jinlu Zhang
DBLP profile ↗
ORCID search ↗
I2EBench: A Comprehensive Benchmark for Instruction-based Image Editing
NeurIPS 2024
·
Yiwei Ma
DBLP profile ↗
ORCID search ↗
Improving Panoptic Narrative Grounding by Harnessing Semantic Relationships and Visual Confirmation
AAAI 2024
·
Tianyu Guo
DBLP profile ↗
ORCID search ↗
Multi-branch Collaborative Learning Network for 3D Visual Grounding
ECCV 2024
·
Zhipeng Qian
DBLP profile ↗
ORCID search ↗
QueryMatch: A Query-based Contrastive Learning Framework for Weakly Supervised Visual Grounding
ACM MM 2024
·
Shengxin Chen
DBLP profile ↗
ORCID search ↗
RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation
NeurIPS 2024
·
Changli Wu
DBLP profile ↗
ORCID search ↗
Rotated Multi-Scale Interaction Network for Referring Remote Sensing Image Segmentation
CVPR 2024
·
Sihan Liu
DBLP profile ↗
ORCID search ↗
SAM as the Guide: Mastering Pseudo-Label Refinement in Semi-Supervised Referring Expression Segmentation
ICML 2024
·
Danni Yang
DBLP profile ↗
ORCID search ↗
StealthDiffusion: Towards Evading Diffusion Forensic Detection through Diffusion Model
ACM MM 2024
·
Ziyin Zhou
DBLP profile ↗
ORCID search ↗
Toward Open-Set Human Object Interaction Detection
AAAI 2024
·
Mingrui Wu
DBLP profile ↗
ORCID search ↗
Towards Efficient Diffusion-Based Image Editing with Instant Attention Masks
AAAI 2024
·
Siyu Zou
DBLP profile ↗
ORCID search ↗
X-Oscar: A Progressive Framework for High-quality Text-guided 3D Animatable Avatar Generation
ICML 2024
·
Yiwei Ma
DBLP profile ↗
ORCID search ↗
X-RefSeg3D: Enhancing Referring 3D Instance Segmentation via Structured Cross-Modal Graph Neural Networks
AAAI 2024
·
Zhipeng Qian
DBLP profile ↗
ORCID search ↗