P
PaperPicks
Conferences
Shanghang Zhang
71 papers at tracked venues · 58 at CORE A* · active 2024–2026
DBLP profile ↗
ORCID 0000-0003-4047-3526 ↗
Homepage ↗
Venues
CVPR
×13
NeurIPS
×11
AAAI
×10
ICML
×8
ICRA
×6
ICCV
×5
ICLR
×5
ACL
×3
ACM MM
×3
ECCV
×2
EMNLP
×2
IROS
×2
IJCAI
×1
Frequent coauthors
Jiaming Liu
DBLP profile ↗
ORCID search ↗
×5
Rongyu Zhang
DBLP profile ↗
ORCID search ↗
×3
Xiaobao Wei
DBLP profile ↗
ORCID search ↗
×3
Yuan Zhang
DBLP profile ↗
ORCID search ↗
×3
Jiajun Cao
DBLP profile ↗
ORCID search ↗
×2
Lingfeng Zhang
DBLP profile ↗
ORCID search ↗
×2
Qizhe Zhang
DBLP profile ↗
ORCID search ↗
×2
Xingqun Qi
DBLP profile ↗
ORCID search ↗
×2
Yueru Jia
DBLP profile ↗
ORCID search ↗
×2
Tianyu Chen
DBLP profile ↗
ORCID search ↗
×2
Nan Huang
DBLP profile ↗
ORCID search ↗
×2
Senqiao Yang
DBLP profile ↗
ORCID search ↗
×2
Papers
FastDriveVLA: Efficient End-to-End Driving via Plug-and-Play Reconstruction-based Token Pruning
AAAI 2026
·
Jiajun Cao
DBLP profile ↗
ORCID search ↗
MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs
AAAI 2026
·
Junpeng Ma
DBLP profile ↗
ORCID search ↗
MoLe-VLA: Dynamic Layer-skipping Vision Language Action Model via Mixture-of-Layers for Efficient Robot Manipulation
AAAI 2026
·
Rongyu Zhang
DBLP profile ↗
ORCID search ↗
NavA³: Understanding Any Instruction, Navigating Anywhere, Finding Anything
ACL 2026
·
Lingfeng Zhang
DBLP profile ↗
ORCID search ↗
4D Visual Pre-Training for Robot Learning
ICCV 2025
·
Chengkai Hou
DBLP profile ↗
ORCID search ↗
AC-DiT: Adaptive Coordination Diffusion Transformer for Mobile Manipulation
NeurIPS 2025
·
Sixiang Chen
DBLP profile ↗
ORCID search ↗
AffordGrasp: In-Context Affordance Reasoning for Open-Vocabulary Task-Oriented Grasping in Clutter
IROS 2025
·
Yingbo Tang
DBLP profile ↗
ORCID search ↗
Authentic 4D Driving Simulation with a Video Generation Model
ICCV 2025
·
Lening Wang
DBLP profile ↗
ORCID search ↗
Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs
NeurIPS 2025
·
Qizhe Zhang
DBLP profile ↗
ORCID search ↗
Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs
ICCV 2025
·
Qizhe Zhang
DBLP profile ↗
ORCID search ↗
Co3Gesture: Towards Coherent Concurrent Co-speech 3D Gesture Generation with Interactive Diffusion
ICLR 2025
·
Xingqun Qi
DBLP profile ↗
ORCID search ↗
Decouple Distortion from Perception: Region Adaptive Diffusion for Extreme-low Bitrate Perception Image Compression
CVPR 2025
·
Jinchang Xu
DBLP profile ↗
ORCID search ↗
DesignEdit: Unify Spatial-Aware Image Editing via Training-free Inpainting with a Multi-Layered Latent Diffusion Framework
AAAI 2025
·
Yueru Jia
DBLP profile ↗
ORCID search ↗
Draw-and-Understand: Leveraging Visual Prompts to Enable MLLMs to Comprehend What You Want
ICLR 2025
·
Weifeng Lin
DBLP profile ↗
ORCID search ↗
EMD: Explicit Motion Modeling for High-Quality Street Gaussian Splatting
ICCV 2025
·
Xiaobao Wei
DBLP profile ↗
ORCID search ↗
EmbodiedOcc++: Boosting Embodied 3D Occupancy Prediction with Plane Regularization and Uncertainty Sampler
ACM MM 2025
·
Hao Wang
DBLP profile ↗
ORCID search ↗
Empowering World Models with Reflection for Embodied Video Prediction
ICML 2025
·
Xiaowei Chi
DBLP profile ↗
ORCID search ↗
Fast-in-Slow: A Dual-System VLA Model Unifying Fast Manipulation within Slow Reasoning
NeurIPS 2025
·
Hao Chen
DBLP profile ↗
ORCID search ↗
FreqMoE: Dynamic Frequency Enhancement for Neural PDE Solvers
IJCAI 2025
·
Tianyu Chen
DBLP profile ↗
ORCID search ↗
High-Quality 3D Creation From a Single Image Using Subject-Specific Knowledge Prior
ICRA 2025
·
Nan Huang
DBLP profile ↗
ORCID search ↗
LiDAR-LLM: Exploring the Potential of Large Language Models for 3D LiDAR Understanding
AAAI 2025
·
Senqiao Yang
DBLP profile ↗
ORCID search ↗
Lift3D Policy: Lifting 2D Foundation Models for Robust 3D Robotic Manipulation
CVPR 2025
·
Yueru Jia
DBLP profile ↗
ORCID search ↗
LongDPO: Unlock Better Long-form Generation Abilities for LLMs via Critique-augmented Stepwise Information
ACL 2025
·
Bowen Ping
DBLP profile ↗
ORCID search ↗
MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine
ICLR 2025
·
Renrui Zhang
DBLP profile ↗
ORCID search ↗
MapNav: A Novel Memory Representation via Annotated Semantic Maps for VLM-based Vision-and-Language Navigation
ACL 2025
·
Lingfeng Zhang
DBLP profile ↗
ORCID search ↗
MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders
CVPR 2025
·
Jiajun Cao
DBLP profile ↗
ORCID search ↗
Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation
CVPR 2025
·
Xiaoqi Li
DBLP profile ↗
ORCID search ↗
OmniArch: Building Foundation Model for Scientific Computing
ICML 2025
·
Tianyu Chen
DBLP profile ↗
ORCID search ↗
Orochi: Versatile Biomedical Image Processor
NeurIPS 2025
·
Gaole Dai
DBLP profile ↗
ORCID search ↗
PINNsAgent: Automated PDE Surrogation with Large Language Models
ICML 2025
·
Qingpo Wuwu
DBLP profile ↗
ORCID search ↗
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
NeurIPS 2025
·
Huajie Tan
DBLP profile ↗
ORCID search ↗
Research Challenges and Progress in the End-to-End V2X Cooperative Autonomous Driving Competition
ICCV 2025
·
Ruiyang Hao
DBLP profile ↗
ORCID search ↗
RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete
CVPR 2025
·
Yuheng Ji
DBLP profile ↗
ORCID search ↗
RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics
NeurIPS 2025
·
Enshen Zhou
DBLP profile ↗
ORCID search ↗
RwoR: Generating Robot Demonstrations from Human Hand Collection for Policy Learning without Robot
IROS 2025
·
Liang Heng
DBLP profile ↗
ORCID search ↗
SAN: Hypothesizing Long-Term Synaptic Development and Neural Engram Mechanism in Scalable Model's Parameter-Efficient Fine-Tuning
ICML 2025
·
Gaole Dai
DBLP profile ↗
ORCID search ↗
SEEA-R1: Tree-Structured Reinforcement Fine-Tuning for Self-Evolving Embodied Agents
NeurIPS 2025
·
Wanxin Tian
DBLP profile ↗
ORCID search ↗
Segment Any Motion in Videos
CVPR 2025
·
Nan Huang
DBLP profile ↗
ORCID search ↗
SliceOcc: Indoor 3D Semantic Occupancy Prediction with Vertical Slice Representation
ICRA 2025
·
Jianing Li
DBLP profile ↗
ORCID search ↗
SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference
ICML 2025
·
Yuan Zhang
DBLP profile ↗
ORCID search ↗
Subgraph Aggregation for Out-of-Distribution Generalization on Graphs
AAAI 2025
·
Bowen Liu
DBLP profile ↗
ORCID search ↗
URDF-Anything: Constructing Articulated Objects with 3D Multimodal Language Model
NeurIPS 2025
·
Zhe Li
DBLP profile ↗
ORCID search ↗
Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought
ACM MM 2025
·
Shuyi Zhang
DBLP profile ↗
ORCID search ↗
BEVUDA: Multi-geometric Space Alignments for Domain Adaptive BEV 3D Object Detection
ICRA 2024
·
Jiaming Liu
DBLP profile ↗
ORCID search ↗
ChatEval: Towards Better LLM-based Evaluators through Multi-Agent Debate
ICLR 2024
·
Chi-Min Chan
DBLP profile ↗
ORCID search ↗
Cloud-Device Collaborative Learning for Multimodal Large Language Models
CVPR 2024
·
Guanqun Wang
DBLP profile ↗
ORCID search ↗
Compositional Few-Shot Class-Incremental Learning
ICML 2024
·
Yixiong Zou
DBLP profile ↗
ORCID search ↗
Continual-MAE: Adaptive Distribution Masked Autoencoders for Continual Test-Time Adaptation
CVPR 2024
·
Jiaming Liu
DBLP profile ↗
ORCID search ↗
Distribution-Aware Continual Test-Time Adaptation for Semantic Segmentation
ICRA 2024
·
Jiayi Ni
DBLP profile ↗
ORCID search ↗
Efficient Deweahter Mixture-of-Experts with Uncertainty-Aware Feature-Wise Linear Modulation
AAAI 2024
·
Rongyu Zhang
DBLP profile ↗
ORCID search ↗
Era3D: High-Resolution Multiview Diffusion using Efficient Row-wise Attention
NeurIPS 2024
·
Peng Li
DBLP profile ↗
ORCID search ↗
Exploring Sparse Visual Prompt for Domain Adaptive Dense Prediction
AAAI 2024
·
Senqiao Yang
DBLP profile ↗
ORCID search ↗
FM-OV3D: Foundation Model-Based Cross-Modal Knowledge Blending for Open-Vocabulary 3D Detection
AAAI 2024
·
Dongmei Zhang
DBLP profile ↗
ORCID search ↗
FreeKD: Knowledge Distillation via Semantic Frequency Prompt
CVPR 2024
·
Yuan Zhang
DBLP profile ↗
ORCID search ↗
Gradient-based Parameter Selection for Efficient Fine-Tuning
CVPR 2024
·
Zhi Zhang
DBLP profile ↗
ORCID search ↗
I-MedSAM: Implicit Medical Image Segmentation with Segment Anything
ECCV 2024
·
Xiaobao Wei
DBLP profile ↗
ORCID search ↗
LLM as Dataset Analyst: Subpopulation Structure Discovery with Large Language Model
ECCV 2024
·
Yulin Luo
DBLP profile ↗
ORCID search ↗
Learning from Mistakes: Iterative Prompt Relabeling for Text-to-Image Diffusion Model Training
EMNLP 2024
·
Xinyan Chen
DBLP profile ↗
ORCID search ↗
Leveraging Imagery Data with Spatial Point Prior for Weakly Semi-supervised 3D Object Detection
AAAI 2024
·
Hongzhi Gao
DBLP profile ↗
ORCID search ↗
NTO3D: Neural Target Object 3D Reconstruction with Segment Anything
CVPR 2024
·
Xiaobao Wei
DBLP profile ↗
ORCID search ↗
PromptCoT: Align Prompt Distribution via Adapted Chain-of-Thought
CVPR 2024
·
Junyi Yao
DBLP profile ↗
ORCID search ↗
RenderOcc: Vision-Centric 3D Occupancy Prediction with 2D Rendering Supervision
ICRA 2024
·
Mingjie Pan
DBLP profile ↗
ORCID search ↗
RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation
NeurIPS 2024
·
Jiaming Liu
DBLP profile ↗
ORCID search ↗
Split-Ensemble: Efficient OOD-aware Ensemble via Task and Model Splitting
ICML 2024
·
Anthony Chen
DBLP profile ↗
ORCID search ↗
Unleashing the Potentials of Likelihood Composition for Multi-modal Language Models
EMNLP 2024
·
Shitian Zhao
DBLP profile ↗
ORCID search ↗
Unsupervised Spike Depth Estimation via Cross-modality Cross-domain Knowledge Transfer
ICRA 2024
·
Jiaming Liu
DBLP profile ↗
ORCID search ↗
Unveiling the Tapestry of Consistency in Large Vision-Language Models
NeurIPS 2024
·
Yuan Zhang
DBLP profile ↗
ORCID search ↗
VeCAF: Vision-language Collaborative Active Finetuning with Training Objective Awareness
ACM MM 2024
·
Rongyu Zhang
DBLP profile ↗
ORCID search ↗
ViDA: Homeostatic Visual Domain Adapter for Continual Test Time Adaptation
ICLR 2024
·
Jiaming Liu
DBLP profile ↗
ORCID search ↗
VoroNav: Voronoi-based Zero-shot Object Navigation with Large Language Model
ICML 2024
·
Pengying Wu
DBLP profile ↗
ORCID search ↗
Weakly-Supervised Emotion Transition Learning for Diverse 3D Co-Speech Gesture Generation
CVPR 2024
·
Xingqun Qi
DBLP profile ↗
ORCID search ↗