P
PaperPicks
Conferences
Dongbin Zhao
28 papers at tracked venues · 19 at CORE A* · active 2024–2026
DBLP profile ↗
ORCID 0000-0001-8218-9633 ↗
Homepage ↗
Venues
AAMAS
×6
NeurIPS
×6
ACL
×4
ICLR
×4
ICML
×2
AAAI
×1
EMNLP
×1
ICCV
×1
ICRA
×1
IROS
×1
WWW
×1
Frequent coauthors
Jingbo Sun
DBLP profile ↗
ORCID search ↗
×3
Runyu Lu
DBLP profile ↗
ORCID search ↗
×3
Songjun Tu
DBLP profile ↗
ORCID search ↗
×3
Yaocheng Zhang
DBLP profile ↗
ORCID search ↗
×2
Jiajun Chai
DBLP profile ↗
ORCID search ↗
×2
Yuqian Fu
DBLP profile ↗
ORCID search ↗
×2
Bo Lv
DBLP profile ↗
ORCID search ↗
×1
Minghui Jia
DBLP profile ↗
ORCID search ↗
×1
Mengying Lin
DBLP profile ↗
ORCID search ↗
×1
Xing Fang
DBLP profile ↗
ORCID search ↗
×1
Kaixuan Xu
DBLP profile ↗
ORCID search ↗
×1
Zijie Zhao
DBLP profile ↗
ORCID search ↗
×1
Papers
AutoSearch: Adaptive Search Depth for Efficient Agentic RAG via Reinforcement Learning
ACL 2026
·
Jingbo Sun
DBLP profile ↗
ORCID search ↗
Beyond Query Memorization: Large Language Model Routing with Query Decomposition and Historical Matching
ACL 2026
·
Bo Lv
DBLP profile ↗
ORCID search ↗
CriticSearch: Fine-Grained Credit Assignment for Search Agents via a Retrospective Critic
ACL 2026
·
Yaocheng Zhang
DBLP profile ↗
ORCID search ↗
Spec-o3: A Tool-Augmented Vision-Language Agent for Rare Celestial Object Candidate Vetting via Automated Spectral Inspection
ACL 2026
·
Minghui Jia
DBLP profile ↗
ORCID search ↗
Advancing Object-Goal Navigation through LLM-enhanced Object Affinities Transfer
IROS 2025
·
Mengying Lin
DBLP profile ↗
ORCID search ↗
Consistency Policy with Categorical Critic for Autonomous Driving
AAMAS 2025
·
Xing Fang
DBLP profile ↗
ORCID search ↗
Constrained Exploitability Descent: An Offline Reinforcement Learning Method for Finding Mixed-Strategy Nash Equilibrium
ICML 2025
·
Runyu Lu
DBLP profile ↗
ORCID search ↗
DipLLM: Fine-Tuning LLM for Strategic Decision-making in Diplomacy
ICML 2025
·
Kaixuan Xu
DBLP profile ↗
ORCID search ↗
Divergence-Regularized Discounted Aggregation: Equilibrium Finding in Multiplayer Partially Observable Stochastic Games
ICLR 2025
·
Runyu Lu
DBLP profile ↗
ORCID search ↗
Empowering LLM Agents with Zero-Shot Optimal Decision-Making through Q-learning
ICLR 2025
·
Jiajun Chai
DBLP profile ↗
ORCID search ↗
Equilibrium Policy Generalization: A Reinforcement Learning Framework for Cross-Graph Zero-Shot Generalization in Pursuit-Evasion Games
NeurIPS 2025
·
Runyu Lu
DBLP profile ↗
ORCID search ↗
INS: Interaction-aware Synthesis to Enhance Offline Multi-agent Reinforcement Learning
ICLR 2025
·
Yuqian Fu
DBLP profile ↗
ORCID search ↗
In-Dataset Trajectory Return Regularization for Offline Preference-based Reinforcement Learning
AAAI 2025
·
Songjun Tu
DBLP profile ↗
ORCID search ↗
Learning When to Think: Shaping Adaptive Reasoning in R1-Style Models via Multi-Stage RL
NeurIPS 2025
·
Songjun Tu
DBLP profile ↗
ORCID search ↗
Learning and Planning Multi-Agent Tasks via an MoE-based World Model
NeurIPS 2025
·
Zijie Zhao
DBLP profile ↗
ORCID search ↗
Offline Goal-Conditioned Reinforcement Learning with Elastic-Subgoal Diffused Policy Learning
AAMAS 2025
·
Yaocheng Zhang
DBLP profile ↗
ORCID search ↗
Online Preference-based Reinforcement Learning with Self-augmented Feedback from Large Language Model
AAMAS 2025
·
Songjun Tu
DBLP profile ↗
ORCID search ↗
RLAE: Reinforcement Learning-Assisted Ensemble for LLMs
EMNLP 2025
·
Yuqian Fu
DBLP profile ↗
ORCID search ↗
Salience-Invariant Consistent Policy Learning for Generalization in Visual Reinforcement Learning
AAMAS 2025
·
Jingbo Sun
DBLP profile ↗
ORCID search ↗
UncAD: Towards Safe End-to-end Autonomous Driving via Online Map Uncertainty
ICRA 2025
·
Pengxuan Yang
DBLP profile ↗
ORCID search ↗
Unsupervised Zero-Shot Reinforcement Learning via Dual-Value Forward-Backward Representation
ICLR 2025
·
Jingbo Sun
DBLP profile ↗
ORCID search ↗
Videos are Sample-Efficient Supervisions: Behavior Cloning from Videos via Latent Representations
NeurIPS 2025
·
Xin Liu
DBLP profile ↗
ORCID search ↗
World4Drive: End-to-End Autonomous Driving via Intention-Aware Physical Latent World Model
ICCV 2025
·
Yupeng Zheng
DBLP profile ↗
ORCID search ↗
Aligning Credit for Multi-Agent Cooperation via Model-based Counterfactual Imagination
AAMAS 2024
·
Jiajun Chai
DBLP profile ↗
ORCID search ↗
Boosting Continuous Control with Consistency Policy
AAMAS 2024
·
Yuhui Chen
DBLP profile ↗
ORCID search ↗
Generalizing Consistency Policy to Visual RL with Prioritized Proximal Experience Regularization
NeurIPS 2024
·
Haoran Li
DBLP profile ↗
ORCID search ↗
Meta-DT: Offline Meta-RL as Conditional Sequence Modeling with World Model Disentanglement
NeurIPS 2024
·
Zhi Wang
DBLP profile ↗
ORCID search ↗
User Response Modeling in Reinforcement Learning for Ads Allocation
WWW 2024
·
Zhiyuan Zhang
DBLP profile ↗
ORCID search ↗