P
PaperPicks
Conferences
Zhengyuan Yang
41 papers at tracked venues · 32 at CORE A* · active 2024–2026
DBLP profile ↗
ORCID search ↗
Venues
NeurIPS
×8
CVPR
×7
ICLR
×5
ICML
×4
ECCV
×3
ICCV
×3
AAAI
×2
ACL
×2
EMNLP
×2
WACV
×2
ACM MM
×1
IJCAI
×1
NAACL
×1
Frequent coauthors
Xiyao Wang
DBLP profile ↗
ORCID search ↗
×3
Cheng-Han Chiang
DBLP profile ↗
ORCID search ↗
×2
Kevin Qinghong Lin
DBLP profile ↗
ORCID search ↗
×2
Zichen Miao
DBLP profile ↗
ORCID search ↗
×2
Jie An
DBLP profile ↗
ORCID search ↗
×2
Yuanhao Zhai
DBLP profile ↗
ORCID search ↗
×2
Taewook Kim
DBLP profile ↗
ORCID search ↗
×1
Dongxing Mao
DBLP profile ↗
ORCID search ↗
×1
Xiangxi Zheng
DBLP profile ↗
ORCID search ↗
×1
Yan-Bo Lin
DBLP profile ↗
ORCID search ↗
×1
Yunzhuo Hao
DBLP profile ↗
ORCID search ↗
×1
Chenglei Si
DBLP profile ↗
ORCID search ↗
×1
Papers
Conditional Text-to-Image Generation with Reference Guidance
WACV 2026
·
Taewook Kim
DBLP profile ↗
ORCID search ↗
Shanks: Simultaneous Hearing and Thinking for Spoken Language Models
ACL 2026
·
Cheng-Han Chiang
DBLP profile ↗
ORCID search ↗
TextGround4M: A Prompt-Aligned Dataset for Layout-Aware Text Rendering
AAAI 2026
·
Dongxing Mao
DBLP profile ↗
ORCID search ↗
V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models
ACL 2026
·
Xiangxi Zheng
DBLP profile ↗
ORCID search ↗
Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising
WACV 2026
·
Yan-Bo Lin
DBLP profile ↗
ORCID search ↗
Audio-Aware Large Language Models as Judges for Speaking Styles
EMNLP 2025
·
Cheng-Han Chiang
DBLP profile ↗
ORCID search ↗
Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
ICML 2025
·
Yunzhuo Hao
DBLP profile ↗
ORCID search ↗
Design2Code: Benchmarking Multimodal Code Generation for Automated Front-End Engineering
NAACL 2025
·
Chenglei Si
DBLP profile ↗
ORCID search ↗
EditRoom: LLM-parameterized Graph Diffusion for Composable 3D Room Layout Editing
ICLR 2025
·
Kaizhi Zheng
DBLP profile ↗
ORCID search ↗
Elevating Visual Perception in Multimodal LLMs with Visual Embedding Distillation
NeurIPS 2025
·
Jitesh Jain
DBLP profile ↗
ORCID search ↗
GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?
EMNLP 2025
·
Yiyang Zhou
DBLP profile ↗
ORCID search ↗
GenXD: Generating Any 3D and 4D Scenes
ICLR 2025
·
Yuyang Zhao
DBLP profile ↗
ORCID search ↗
ImageGen-CoT: Enhancing Text-to-Image in-context Learning with Chain-of-Thought Reasoning
ICCV 2025
·
Jiaqi Liao
DBLP profile ↗
ORCID search ↗
LiVOS: Light Video Object Segmentation with Gated Linear Matching
CVPR 2025
·
Qin Liu
DBLP profile ↗
ORCID search ↗
MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos
ICLR 2025
·
Xuehai He
DBLP profile ↗
ORCID search ↗
Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
NeurIPS 2025
·
Minheng Ni
DBLP profile ↗
ORCID search ↗
ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding
ICML 2025
·
Xingyu Fu
DBLP profile ↗
ORCID search ↗
SITE: Towards Spatial Intelligence Thorough Evaluation
ICCV 2025
·
Wenqi Wang
DBLP profile ↗
ORCID search ↗
Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension
ICCV 2025
·
Xiyao Wang
DBLP profile ↗
ORCID search ↗
ShowUI: One Vision-Language-Action Model for GUI Visual Agent
CVPR 2025
·
Kevin Qinghong Lin
DBLP profile ↗
ORCID search ↗
SlowFast-VGen: Slow-Fast Learning for Action-Driven Long Video Generation
ICLR 2025
·
Yining Hong
DBLP profile ↗
ORCID search ↗
SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement
NeurIPS 2025
·
Xiyao Wang
DBLP profile ↗
ORCID search ↗
Tuning Timestep-Distilled Diffusion Model Using Pairwise Sample Optimization
ICLR 2025
·
Zichen Miao
DBLP profile ↗
ORCID search ↗
VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
NeurIPS 2025
·
Kangrui Wang
DBLP profile ↗
ORCID search ↗
ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs
NeurIPS 2025
·
Xiyao Wang
DBLP profile ↗
ORCID search ↗
Bring Metric Functions into Diffusion Models
IJCAI 2024
·
Jie An
DBLP profile ↗
ORCID search ↗
Diagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation
CVPR 2024
·
Jaemin Cho
DBLP profile ↗
ORCID search ↗
Disco: Disentangled Control for Realistic Human Dance Generation
CVPR 2024
·
Tan Wang
DBLP profile ↗
ORCID search ↗
GRiT: A Generative Region-to-Text Transformer for Object Understanding
ECCV 2024
·
Jialian Wu
DBLP profile ↗
ORCID search ↗
IDOL: Unified Dual-Modal Latent Diffusion for Human-Centric Joint Video-Depth Generation
ECCV 2024
·
Yuanhao Zhai
DBLP profile ↗
ORCID search ↗
Idea2Img: Iterative Self-refinement with GPT-4V for Automatic Image Design and Generation
ECCV 2024
·
Zhengyuan Yang
Interfacing Foundation Models' Embeddings
NeurIPS 2024
·
Xueyan Zou
DBLP profile ↗
ORCID search ↗
MM-Narrator: Narrating Long-form Videos with Multimodal In-Context Learning
CVPR 2024
·
Chaoyi Zhang
DBLP profile ↗
ORCID search ↗
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
ICML 2024
·
Weihao Yu
DBLP profile ↗
ORCID search ↗
MMSum: A Dataset for Multimodal Summarization and Thumbnail Generation of Videos
CVPR 2024
·
Jielin Qiu
DBLP profile ↗
ORCID search ↗
Motion Consistency Model: Accelerating Video Diffusion with Disentangled Motion-Appearance Distillation
NeurIPS 2024
·
Yuanhao Zhai
DBLP profile ↗
ORCID search ↗
OpenLEAF: A Novel Benchmark for Open-Domain Interleaved Image-Text Generation
ACM MM 2024
·
Jie An
DBLP profile ↗
ORCID search ↗
SGFormer: Semantic Graph Transformer for Point Cloud-Based 3D Scene Graph Generation
AAAI 2024
·
Changsheng Lv
DBLP profile ↗
ORCID search ↗
StrokeNUWA - Tokenizing Strokes for Vector Graphic Synthesis
ICML 2024
·
Zecheng Tang
DBLP profile ↗
ORCID search ↗
Training Diffusion Models Towards Diverse Image Generation with Reinforcement Learning
CVPR 2024
·
Zichen Miao
DBLP profile ↗
ORCID search ↗
VideoGUI: A Benchmark for GUI Automation from Instructional Videos
NeurIPS 2024
·
Kevin Qinghong Lin
DBLP profile ↗
ORCID search ↗