P
PaperPicks
Conferences
Qichao Zhang
16 papers at tracked venues · 10 at CORE A* · active 2024–2026
DBLP profile ↗
ORCID search ↗
Venues
ACL
×4
AAMAS
×3
AAAI
×2
ICRA
×2
EMNLP
×1
ICCV
×1
ICLR
×1
NeurIPS
×1
WWW
×1
Frequent coauthors
Jingbo Sun
DBLP profile ↗
ORCID search ↗
×3
Songjun Tu
DBLP profile ↗
ORCID search ↗
×3
Pengxuan Yang
DBLP profile ↗
ORCID search ↗
×2
Yupeng Zheng
DBLP profile ↗
ORCID search ↗
×2
Bo Lv
DBLP profile ↗
ORCID search ↗
×1
Yaocheng Zhang
DBLP profile ↗
ORCID search ↗
×1
Minghui Jia
DBLP profile ↗
ORCID search ↗
×1
Xing Fang
DBLP profile ↗
ORCID search ↗
×1
Yuqian Fu
DBLP profile ↗
ORCID search ↗
×1
Zhiyuan Zhang
DBLP profile ↗
ORCID search ↗
×1
Papers
AutoSearch: Adaptive Search Depth for Efficient Agentic RAG via Reinforcement Learning
ACL 2026
·
Jingbo Sun
DBLP profile ↗
ORCID search ↗
Beyond Query Memorization: Large Language Model Routing with Query Decomposition and Historical Matching
ACL 2026
·
Bo Lv
DBLP profile ↗
ORCID search ↗
CriticSearch: Fine-Grained Credit Assignment for Search Agents via a Retrospective Critic
ACL 2026
·
Yaocheng Zhang
DBLP profile ↗
ORCID search ↗
Spec-o3: A Tool-Augmented Vision-Language Agent for Rare Celestial Object Candidate Vetting via Automated Spectral Inspection
ACL 2026
·
Minghui Jia
DBLP profile ↗
ORCID search ↗
WorldRFT: Latent World Model Planning with Reinforcement Fine-Tuning for Autonomous Driving
AAAI 2026
·
Pengxuan Yang
DBLP profile ↗
ORCID search ↗
Consistency Policy with Categorical Critic for Autonomous Driving
AAMAS 2025
·
Xing Fang
DBLP profile ↗
ORCID search ↗
In-Dataset Trajectory Return Regularization for Offline Preference-based Reinforcement Learning
AAAI 2025
·
Songjun Tu
DBLP profile ↗
ORCID search ↗
Learning When to Think: Shaping Adaptive Reasoning in R1-Style Models via Multi-Stage RL
NeurIPS 2025
·
Songjun Tu
DBLP profile ↗
ORCID search ↗
Online Preference-based Reinforcement Learning with Self-augmented Feedback from Large Language Model
AAMAS 2025
·
Songjun Tu
DBLP profile ↗
ORCID search ↗
RLAE: Reinforcement Learning-Assisted Ensemble for LLMs
EMNLP 2025
·
Yuqian Fu
DBLP profile ↗
ORCID search ↗
Salience-Invariant Consistent Policy Learning for Generalization in Visual Reinforcement Learning
AAMAS 2025
·
Jingbo Sun
DBLP profile ↗
ORCID search ↗
UncAD: Towards Safe End-to-end Autonomous Driving via Online Map Uncertainty
ICRA 2025
·
Pengxuan Yang
DBLP profile ↗
ORCID search ↗
Unsupervised Zero-Shot Reinforcement Learning via Dual-Value Forward-Backward Representation
ICLR 2025
·
Jingbo Sun
DBLP profile ↗
ORCID search ↗
World4Drive: End-to-End Autonomous Driving via Intention-Aware Physical Latent World Model
ICCV 2025
·
Yupeng Zheng
DBLP profile ↗
ORCID search ↗
MonoOcc: Digging into Monocular Semantic Occupancy Prediction
ICRA 2024
·
Yupeng Zheng
DBLP profile ↗
ORCID search ↗
User Response Modeling in Reinforcement Learning for Ads Allocation
WWW 2024
·
Zhiyuan Zhang
DBLP profile ↗
ORCID search ↗