P
PaperPicks
Conferences
Lijuan Wang
46 papers at tracked venues · 37 at CORE A* · active 2024–2026
DBLP profile ↗
ORCID search ↗
Venues
CVPR
×9
ICLR
×8
NeurIPS
×8
ICML
×4
ECCV
×3
ICCV
×3
AAAI
×2
ACL
×2
EMNLP
×2
WACV
×2
ACM MM
×1
BMVC
×1
IJCAI
×1
Frequent coauthors
Xiyao Wang
DBLP profile ↗
ORCID search ↗
×3
Cheng-Han Chiang
DBLP profile ↗
ORCID search ↗
×2
Minheng Ni
DBLP profile ↗
ORCID search ↗
×2
Kevin Qinghong Lin
DBLP profile ↗
ORCID search ↗
×2
Zichen Miao
DBLP profile ↗
ORCID search ↗
×2
Jie An
DBLP profile ↗
ORCID search ↗
×2
Yuanhao Zhai
DBLP profile ↗
ORCID search ↗
×2
Taewook Kim
DBLP profile ↗
ORCID search ↗
×1
Huan Wang
DBLP profile ↗
ORCID search ↗
×1
Xiangxi Zheng
DBLP profile ↗
ORCID search ↗
×1
Yan-Bo Lin
DBLP profile ↗
ORCID search ↗
×1
Yifan Pu
DBLP profile ↗
ORCID search ↗
×1
Papers
Conditional Text-to-Image Generation with Reference Guidance
WACV 2026
·
Taewook Kim
DBLP profile ↗
ORCID search ↗
Shanks: Simultaneous Hearing and Thinking for Spoken Language Models
ACL 2026
·
Cheng-Han Chiang
DBLP profile ↗
ORCID search ↗
Towards Zero-Shot Diabetic Retinopathy Grading: Learning Generalized Knowledge via Prompt-Driven Matching and Emulating
AAAI 2026
·
Huan Wang
DBLP profile ↗
ORCID search ↗
V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models
ACL 2026
·
Xiangxi Zheng
DBLP profile ↗
ORCID search ↗
Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising
WACV 2026
·
Yan-Bo Lin
DBLP profile ↗
ORCID search ↗
ART: Anonymous Region Transformer for Variable Multi-Layer Transparent Image Generation
CVPR 2025
·
Yifan Pu
DBLP profile ↗
ORCID search ↗
Audio-Aware Large Language Models as Judges for Speaking Styles
EMNLP 2025
·
Cheng-Han Chiang
DBLP profile ↗
ORCID search ↗
Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
ICML 2025
·
Yunzhuo Hao
DBLP profile ↗
ORCID search ↗
CertainlyUncertain: A Benchmark and Metric for Multimodal Epistemic and Aleatoric Awareness
ICLR 2025
·
Khyathi Raghavi Chandu
DBLP profile ↗
ORCID search ↗
EditRoom: LLM-parameterized Graph Diffusion for Composable 3D Room Layout Editing
ICLR 2025
·
Kaizhi Zheng
DBLP profile ↗
ORCID search ↗
GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?
EMNLP 2025
·
Yiyang Zhou
DBLP profile ↗
ORCID search ↗
GenXD: Generating Any 3D and 4D Scenes
ICLR 2025
·
Yuyang Zhao
DBLP profile ↗
ORCID search ↗
ImageGen-CoT: Enhancing Text-to-Image in-context Learning with Chain-of-Thought Reasoning
ICCV 2025
·
Jiaqi Liao
DBLP profile ↗
ORCID search ↗
LiVOS: Light Video Object Segmentation with Gated Linear Matching
CVPR 2025
·
Qin Liu
DBLP profile ↗
ORCID search ↗
MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models
ICLR 2025
·
Peng Xia
DBLP profile ↗
ORCID search ↗
MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos
ICLR 2025
·
Xuehai He
DBLP profile ↗
ORCID search ↗
Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
NeurIPS 2025
·
Minheng Ni
DBLP profile ↗
ORCID search ↗
SITE: Towards Spatial Intelligence Thorough Evaluation
ICCV 2025
·
Wenqi Wang
DBLP profile ↗
ORCID search ↗
Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension
ICCV 2025
·
Xiyao Wang
DBLP profile ↗
ORCID search ↗
ShowUI: One Vision-Language-Action Model for GUI Visual Agent
CVPR 2025
·
Kevin Qinghong Lin
DBLP profile ↗
ORCID search ↗
SlowFast-VGen: Slow-Fast Learning for Action-Driven Long Video Generation
ICLR 2025
·
Yining Hong
DBLP profile ↗
ORCID search ↗
SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement
NeurIPS 2025
·
Xiyao Wang
DBLP profile ↗
ORCID search ↗
Tuning Timestep-Distilled Diffusion Model Using Pairwise Sample Optimization
ICLR 2025
·
Zichen Miao
DBLP profile ↗
ORCID search ↗
VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
NeurIPS 2025
·
Kangrui Wang
DBLP profile ↗
ORCID search ↗
ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs
NeurIPS 2025
·
Xiyao Wang
DBLP profile ↗
ORCID search ↗
APTPose: Anatomy-aware Pre-Training for 3D Human Pose Estimation
BMVC 2024
·
Qing-Wen Yang
DBLP profile ↗
ORCID search ↗
Bring Metric Functions into Diffusion Models
IJCAI 2024
·
Jie An
DBLP profile ↗
ORCID search ↗
Completing Visual Objects via Bridging Generation and Segmentation
ICML 2024
·
Xiang Li
DBLP profile ↗
ORCID search ↗
Diagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation
CVPR 2024
·
Jaemin Cho
DBLP profile ↗
ORCID search ↗
Disco: Disentangled Control for Realistic Human Dance Generation
CVPR 2024
·
Tan Wang
DBLP profile ↗
ORCID search ↗
GRiT: A Generative Region-to-Text Transformer for Object Understanding
ECCV 2024
·
Jialian Wu
DBLP profile ↗
ORCID search ↗
IDOL: Unified Dual-Modal Latent Diffusion for Human-Centric Joint Video-Depth Generation
ECCV 2024
·
Yuanhao Zhai
DBLP profile ↗
ORCID search ↗
Idea2Img: Iterative Self-refinement with GPT-4V for Automatic Image Design and Generation
ECCV 2024
·
Zhengyuan Yang
DBLP profile ↗
ORCID search ↗
Interfacing Foundation Models' Embeddings
NeurIPS 2024
·
Xueyan Zou
DBLP profile ↗
ORCID search ↗
Leveraging Visual Tokens for Extended Text Contexts in Multi-Modal Learning
NeurIPS 2024
·
Alex Jinpeng Wang
DBLP profile ↗
ORCID search ↗
MM-Narrator: Narrating Long-form Videos with Multimodal In-Context Learning
CVPR 2024
·
Chaoyi Zhang
DBLP profile ↗
ORCID search ↗
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
ICML 2024
·
Weihao Yu
DBLP profile ↗
ORCID search ↗
MMSum: A Dataset for Multimodal Summarization and Thumbnail Generation of Videos
CVPR 2024
·
Jielin Qiu
DBLP profile ↗
ORCID search ↗
Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning
ICLR 2024
·
Fuxiao Liu
DBLP profile ↗
ORCID search ↗
Motion Consistency Model: Accelerating Video Diffusion with Disentangled Motion-Appearance Distillation
NeurIPS 2024
·
Yuanhao Zhai
DBLP profile ↗
ORCID search ↗
ORES: Open-Vocabulary Responsible Visual Synthesis
AAAI 2024
·
Minheng Ni
DBLP profile ↗
ORCID search ↗
OpenLEAF: A Novel Benchmark for Open-Domain Interleaved Image-Text Generation
ACM MM 2024
·
Jie An
DBLP profile ↗
ORCID search ↗
Segment and Caption Anything
CVPR 2024
·
Xiaoke Huang
DBLP profile ↗
ORCID search ↗
StrokeNUWA - Tokenizing Strokes for Vector Graphic Synthesis
ICML 2024
·
Zecheng Tang
DBLP profile ↗
ORCID search ↗
Training Diffusion Models Towards Diverse Image Generation with Reinforcement Learning
CVPR 2024
·
Zichen Miao
DBLP profile ↗
ORCID search ↗
VideoGUI: A Benchmark for GUI Automation from Instructional Videos
NeurIPS 2024
·
Kevin Qinghong Lin
DBLP profile ↗
ORCID search ↗