P
PaperPicks
Conferences
Wenqi Shao
46 papers at tracked venues · 43 at CORE A* · active 2024–2026
DBLP profile ↗
ORCID search ↗
Venues
ICLR
×8
CVPR
×7
ICCV
×7
ACL
×6
NeurIPS
×6
ICML
×5
AAAI
×3
ECCV
×2
ACM MM
×1
IJCAI
×1
Frequent coauthors
Mengkang Hu
DBLP profile ↗
ORCID search ↗
×3
Fanqing Meng
DBLP profile ↗
ORCID search ↗
×3
Pengfei Zhou
DBLP profile ↗
ORCID search ↗
×2
Yangyang Xu
DBLP profile ↗
ORCID search ↗
×2
Yingping Liang
DBLP profile ↗
ORCID search ↗
×2
Yue Yang
DBLP profile ↗
ORCID search ↗
×2
Junting Chen
DBLP profile ↗
ORCID search ↗
×2
Runjian Chen
DBLP profile ↗
ORCID search ↗
×2
Sen Chen
DBLP profile ↗
ORCID search ↗
×1
Zhiyao Cui
DBLP profile ↗
ORCID search ↗
×1
Zhixuan Liang
DBLP profile ↗
ORCID search ↗
×1
Mengzhao Chen
DBLP profile ↗
ORCID search ↗
×1
Papers
D-GARA: A Dynamic Benchmarking Framework for GUI Agent Robustness in Real-World Anomalies
AAAI 2026
·
Sen Chen
DBLP profile ↗
ORCID search ↗
Design First, Code Later: Aesthetically Pleasing Template-Free Slides Generation
ACL 2026
·
Zhiyao Cui
DBLP profile ↗
ORCID search ↗
MDK12-Bench: A Multi-Discipline Benchmark for Evaluating Reasoning in Multimodal Large Language Models
AAAI 2026
·
Pengfei Zhou
DBLP profile ↗
ORCID search ↗
Cross-Subject Mind Decoding from Inaccurate Representations
ICCV 2025
·
Yangyang Xu
DBLP profile ↗
ORCID search ↗
DexHandDiff: Interaction-aware Diffusion Planning for Adaptive Dexterous Manipulation
CVPR 2025
·
Zhixuan Liang
DBLP profile ↗
ORCID search ↗
DiffusionMat: Alpha Matting as Deterministic Sequential Refinement Learning
ACM MM 2025
·
Yangyang Xu
DBLP profile ↗
ORCID search ↗
Distilling Monocular Foundation Model for Fine-grained Depth Completion
CVPR 2025
·
Yingping Liang
DBLP profile ↗
ORCID search ↗
Dynamic Multimodal Evaluation with Flexible Complexity by Vision-Language Bootstrapping
ICLR 2025
·
Yue Yang
DBLP profile ↗
ORCID search ↗
EMOS: Embodiment-aware Heterogeneous Multi-robot Operating System with LLM Agents
ICLR 2025
·
Junting Chen
DBLP profile ↗
ORCID search ↗
EfficientQAT: Efficient Quantization-Aware Training for Large Language Models
ACL 2025
·
Mengzhao Chen
DBLP profile ↗
ORCID search ↗
Forensics-Bench: A Comprehensive Forgery Detection Benchmark Suite for Large Vision Language Models
CVPR 2025
·
Jin Wang
DBLP profile ↗
ORCID search ↗
GUIOdyssey: A Comprehensive Dataset for Cross-App GUI Navigation on Mobile Devices
ICCV 2025
·
Quanfeng Lu
DBLP profile ↗
ORCID search ↗
HiAgent: Hierarchical Working Memory Management for Solving Long-Horizon Agent Tasks with Large Language Model
ACL 2025
·
Mengkang Hu
DBLP profile ↗
ORCID search ↗
JiSAM: Alleviate Labeling Burden and Corner Case Problems in Autonomous Driving via Minimal Real-World Data
CVPR 2025
·
Runjian Chen
DBLP profile ↗
ORCID search ↗
Learning Dense Feature Matching via Lifting Single 2D Image to 3D Space
ICCV 2025
·
Yingping Liang
DBLP profile ↗
ORCID search ↗
LiT: Delving into a Simple Linear Diffusion Transformer for Image Generation
ICCV 2025
·
Jiahao Wang
DBLP profile ↗
ORCID search ↗
Lumina-T2X: Scalable Flow-based Large Diffusion Transformer for Flexible Resolution Generation
ICLR 2025
·
Peng Gao
DBLP profile ↗
ORCID search ↗
MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models
ICLR 2025
·
Fanqing Meng
DBLP profile ↗
ORCID search ↗
MPBench: A Comprehensive Multimodal Reasoning Benchmark for Process Errors Identification
ACL 2025
·
Xu Zhao Pan
DBLP profile ↗
ORCID search ↗
OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis
NeurIPS 2025
·
Junting Chen
DBLP profile ↗
ORCID search ↗
OpenING: A Comprehensive Benchmark for Judging Open-ended Interleaved Image-Text Generation
CVPR 2025
·
Pengfei Zhou
DBLP profile ↗
ORCID search ↗
Prompt-A-Video: Prompt your Video Diffusion Model via Preference-Aligned LLM
ICCV 2025
·
Yatai Ji
DBLP profile ↗
ORCID search ↗
SAMRefiner: Taming Segment Anything Model for Universal Mask Refinement
ICLR 2025
·
Yuqi Lin
DBLP profile ↗
ORCID search ↗
TP-Eval: Tap Multimodal LLMs' Potential in Evaluation by Customizing Prompts
IJCAI 2025
·
Yuxuan Xie
DBLP profile ↗
ORCID search ↗
TREND: Unsupervised 3D Representation Learning via Temporal Forecasting for LiDAR Perception
NeurIPS 2025
·
Runjian Chen
DBLP profile ↗
ORCID search ↗
Temporal Overlapping Prediction: A Self-Supervised Pre-Training Method for LiDAR Moving Object Segmentation
ICCV 2025
·
Ziliang Miao
DBLP profile ↗
ORCID search ↗
Text2World: Benchmarking Large Language Models for Symbolic World Model Generation
ACL 2025
·
Mengkang Hu
DBLP profile ↗
ORCID search ↗
Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation
ICML 2025
·
Fanqing Meng
DBLP profile ↗
ORCID search ↗
ZipVL: Accelerating Vision-Language Models Through Dynamic Token Sparsity
ICCV 2025
·
Yefei He
DBLP profile ↗
ORCID search ↗
BESA: Pruning Large Language Models with Blockwise Parameter-Efficient Sparsity Allocation
ICLR 2024
·
Peng Xu
DBLP profile ↗
ORCID search ↗
Cached Transformers: Improving Transformers with Differentiable Memory Cachde
AAAI 2024
·
Zhaoyang Zhang
DBLP profile ↗
ORCID search ↗
ChartAssistant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction Tuning
ACL 2024
·
Fanqing Meng
DBLP profile ↗
ORCID search ↗
ConvBench: A Multi-Turn Conversation Evaluation Benchmark with Hierarchical Ablation Capability for Large Vision-Language Models
NeurIPS 2024
·
Shuo Liu
DBLP profile ↗
ORCID search ↗
DiffAgent: Fast and Accurate Text-to-Image API Selection with Large Language Model
CVPR 2024
·
Lirui Zhao
DBLP profile ↗
ORCID search ↗
GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest
ECCV 2024
·
Shilong Zhang
DBLP profile ↗
ORCID search ↗
MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI
ICML 2024
·
Kaining Ying
DBLP profile ↗
ORCID search ↗
Needle In A Multimodal Haystack
NeurIPS 2024
·
Weiyun Wang
DBLP profile ↗
ORCID search ↗
OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLM
CVPR 2024
·
Yutao Hu
DBLP profile ↗
ORCID search ↗
OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models
ICLR 2024
·
Wenqi Shao
Position: Towards Implicit Prompt For Text-To-Image Models
ICML 2024
·
Yue Yang
DBLP profile ↗
ORCID search ↗
Rethinking Human Evaluation Protocol for Text-to-Video Models: Enhancing Reliability, Reproducibility, and Practicality
NeurIPS 2024
·
Tianle Zhang
DBLP profile ↗
ORCID search ↗
RoboCodeX: Multimodal Code Generation for Robotic Behavior Synthesis
ICML 2024
·
Yao Mu
DBLP profile ↗
ORCID search ↗
SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language Models
ICML 2024
·
Dongyang Liu
DBLP profile ↗
ORCID search ↗
SPHINX: A Mixer of Weights, Visual Embeddings and Image Scales for Multi-modal Large Language Models
ECCV 2024
·
Ziyi Lin
DBLP profile ↗
ORCID search ↗
SearchLVLMs: A Plug-and-Play Framework for Augmenting Large Vision-Language Models by Searching Up-to-Date Internet Knowledge
NeurIPS 2024
·
Chuanhao Li
DBLP profile ↗
ORCID search ↗
Tree-Planner: Efficient Close-loop Task Planning with Large Language Models
ICLR 2024
·
Mengkang Hu
DBLP profile ↗
ORCID search ↗