P
PaperPicks
Conferences
Xiangyu Zhang
Megvii Inc., Beijing, China
39 papers at tracked venues · 30 at CORE A* · active 2024–2026
DBLP profile ↗
ORCID 0000-0003-2138-4608 ↗
Google Scholar ↗
Homepage ↗
Venues
AAAI
×6
ACL
×6
NeurIPS
×6
ICLR
×5
ECCV
×3
ACM MM
×2
CVPR
×2
EMNLP
×2
ICCV
×2
InterSpeech
×2
BMVC
×1
ICML
×1
IJCAI
×1
Frequent coauthors
Jingcheng Hu
DBLP profile ↗
ORCID search ↗
×3
En Yu
DBLP profile ↗
ORCID search ↗
×3
Anlin Zheng
DBLP profile ↗
ORCID search ↗
×2
Yana Wei
DBLP profile ↗
ORCID search ↗
×2
Haochen Wang
DBLP profile ↗
ORCID search ↗
×2
Xiangfeng Wang
DBLP profile ↗
ORCID search ↗
×1
Hao Shi
DBLP profile ↗
ORCID search ↗
×1
Jiacheng Li
DBLP profile ↗
ORCID search ↗
×1
Yuang Peng
DBLP profile ↗
ORCID search ↗
×1
Haolong Yan
DBLP profile ↗
ORCID search ↗
×1
Bin Xie
DBLP profile ↗
ORCID search ↗
×1
Dongming Wu
DBLP profile ↗
ORCID search ↗
×1
Papers
PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering
ACL 2026
·
Xiangfeng Wang
DBLP profile ↗
ORCID search ↗
PaCoRe: Learning to Scale Test-Time Compute with Parallel Coordinated Reasoning
ACL 2026
·
Jingcheng Hu
DBLP profile ↗
ORCID search ↗
SpatialActor: Exploring Disentangled Spatial Representations for Robust Robotic Manipulation
AAAI 2026
·
Hao Shi
DBLP profile ↗
ORCID search ↗
WISCA: A Lightweight Model Transition Method to Improve LLM Training via Weight Scaling
ACL 2026
·
Jiacheng Li
DBLP profile ↗
ORCID search ↗
Auto-Landmark: Acoustic Landmark Dataset and Open-Source Toolkit for Landmark Extraction
InterSpeech 2025
·
Xiangyu Zhang
Beyond Sequences: Two-dimensional Representation and Dependency Encoding for Code Generation
ACL 2025
·
Xiangyu Zhang
DreamBench++: A Human-Aligned Benchmark for Personalized Image Generation
ICLR 2025
·
Yuang Peng
DBLP profile ↗
ORCID search ↗
GUI Exploration Lab: Enhancing Screen Navigation in Agents via Multi-Turn Reinforcement Learning
NeurIPS 2025
·
Haolong Yan
DBLP profile ↗
ORCID search ↗
Glad: A Streaming Scene Generator for Autonomous Driving
ICLR 2025
·
Bin Xie
DBLP profile ↗
ORCID search ↗
Holistic Tokenizer for Autoregressive Image Generation
ICCV 2025
·
Anlin Zheng
DBLP profile ↗
ORCID search ↗
Language Prompt for Autonomous Driving
AAAI 2025
·
Dongming Wu
DBLP profile ↗
ORCID search ↗
Multi-matrix Factorization Attention
ACL 2025
·
Jingcheng Hu
DBLP profile ↗
ORCID search ↗
Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
NeurIPS 2025
·
Yana Wei
DBLP profile ↗
ORCID search ↗
Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model
NeurIPS 2025
·
Jingcheng Hu
DBLP profile ↗
ORCID search ↗
Perception in Reflection
ICML 2025
·
Yana Wei
DBLP profile ↗
ORCID search ↗
Perception-R1: Pioneering Perception Policy with Reinforcement Learning
NeurIPS 2025
·
En Yu
DBLP profile ↗
ORCID search ↗
Predictable Scale (Part II) - Farseer: A Refined Scaling Law in LLMs
NeurIPS 2025
·
Houyi Li
DBLP profile ↗
ORCID search ↗
Reconstructive Visual Instruction Tuning
ICLR 2025
·
Haochen Wang
DBLP profile ↗
ORCID search ↗
Ross3d: Reconstructive Visual Instruction Tuning With 3D-Awareness
ICCV 2025
·
Haochen Wang
DBLP profile ↗
ORCID search ↗
SpeechT-RAG: Reliable Depression Detection in LLMs with Retrieval-Augmented Generation Using Speech Timing Information
ACL 2025
·
Xiangyu Zhang
SubjectDrive: Scaling Generative Data in Autonomous Driving via Subject Control
AAAI 2025
·
Binyuan Huang
DBLP profile ↗
ORCID search ↗
Taming Teacher Forcing for Masked Autoregressive Video Generation
CVPR 2025
·
Deyu Zhou
DBLP profile ↗
ORCID search ↗
Unhackable Temporal Reward for Scalable Video MLLMs
ICLR 2025
·
En Yu
DBLP profile ↗
ORCID search ↗
Vision Foundation Models as Effective Visual Tokenizers for Autoregressive Generation
NeurIPS 2025
·
Anlin Zheng
DBLP profile ↗
ORCID search ↗
Align-DETR: Enhancing End-to-end Object Detection with Aligned Loss
BMVC 2024
·
Zhi Cai
DBLP profile ↗
ORCID search ↗
Binaural Selective Attention Model for Target Speaker Extraction
InterSpeech 2024
·
Hanyu Meng
DBLP profile ↗
ORCID search ↗
ChatSpot: Bootstrapping Multimodal LLMs via Precise Referring Instruction Tuning
IJCAI 2024
·
Liang Zhao
DBLP profile ↗
ORCID search ↗
Compound Text-Guided Prompt Tuning via Image-Adaptive Cues
AAAI 2024
·
Hao Tan
DBLP profile ↗
ORCID search ↗
DDAE: Towards Deep Dynamic Vision BERT Pretraining
AAAI 2024
·
Honghao Chen
DBLP profile ↗
ORCID search ↗
DreamLLM: Synergistic Multimodal Comprehension and Creation
ICLR 2024
·
Runpei Dong
DBLP profile ↗
ORCID search ↗
Far3D: Expanding the Horizon for Surround-View 3D Object Detection
AAAI 2024
·
Xiaohui Jiang
DBLP profile ↗
ORCID search ↗
Merlin: Empowering Multimodal LLMs with Foresight Minds
ECCV 2024
·
En Yu
DBLP profile ↗
ORCID search ↗
OneChart: Purify the Chart Structural Extraction via One Auxiliary Token
ACM MM 2024
·
Jinyue Chen
DBLP profile ↗
ORCID search ↗
Panacea: Panoramic and Controllable Video Generation for Autonomous Driving
CVPR 2024
·
Yuqing Wen
DBLP profile ↗
ORCID search ↗
Self-Supervised Visual Preference Alignment
ACM MM 2024
·
Ke Zhu
DBLP profile ↗
ORCID search ↗
Speaking in Wavelet Domain: A Simple and Efficient Approach to Speed up Speech Diffusion Model
EMNLP 2024
·
Xiangyu Zhang
Stream Query Denoising for Vectorized HD-Map Construction
ECCV 2024
·
Shuo Wang
DBLP profile ↗
ORCID search ↗
Vary: Scaling up the Vision Vocabulary for Large Vision-Language Model
ECCV 2024
·
Haoran Wei
DBLP profile ↗
ORCID search ↗
When LLMs Meets Acoustic Landmarks: An Efficient Approach to Integrate Speech into Large Language Models for Depression Detection
EMNLP 2024
·
Xiangyu Zhang