PPaperPicks

Dongbin Zhao

28 papers at tracked venues · 19 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. AutoSearch: Adaptive Search Depth for Efficient Agentic RAG via Reinforcement Learning
  2. Beyond Query Memorization: Large Language Model Routing with Query Decomposition and Historical Matching
  3. CriticSearch: Fine-Grained Credit Assignment for Search Agents via a Retrospective Critic
  4. Spec-o3: A Tool-Augmented Vision-Language Agent for Rare Celestial Object Candidate Vetting via Automated Spectral Inspection
  5. Advancing Object-Goal Navigation through LLM-enhanced Object Affinities Transfer
  6. Consistency Policy with Categorical Critic for Autonomous Driving
  7. Constrained Exploitability Descent: An Offline Reinforcement Learning Method for Finding Mixed-Strategy Nash Equilibrium
  8. DipLLM: Fine-Tuning LLM for Strategic Decision-making in Diplomacy
  9. Divergence-Regularized Discounted Aggregation: Equilibrium Finding in Multiplayer Partially Observable Stochastic Games
  10. Empowering LLM Agents with Zero-Shot Optimal Decision-Making through Q-learning
  11. Equilibrium Policy Generalization: A Reinforcement Learning Framework for Cross-Graph Zero-Shot Generalization in Pursuit-Evasion Games
  12. INS: Interaction-aware Synthesis to Enhance Offline Multi-agent Reinforcement Learning
  13. In-Dataset Trajectory Return Regularization for Offline Preference-based Reinforcement Learning
  14. Learning When to Think: Shaping Adaptive Reasoning in R1-Style Models via Multi-Stage RL
  15. Learning and Planning Multi-Agent Tasks via an MoE-based World Model
  16. Offline Goal-Conditioned Reinforcement Learning with Elastic-Subgoal Diffused Policy Learning
  17. Online Preference-based Reinforcement Learning with Self-augmented Feedback from Large Language Model
  18. RLAE: Reinforcement Learning-Assisted Ensemble for LLMs
  19. Salience-Invariant Consistent Policy Learning for Generalization in Visual Reinforcement Learning
  20. UncAD: Towards Safe End-to-end Autonomous Driving via Online Map Uncertainty
  21. Unsupervised Zero-Shot Reinforcement Learning via Dual-Value Forward-Backward Representation
  22. Videos are Sample-Efficient Supervisions: Behavior Cloning from Videos via Latent Representations
  23. World4Drive: End-to-End Autonomous Driving via Intention-Aware Physical Latent World Model
  24. Aligning Credit for Multi-Agent Cooperation via Model-based Counterfactual Imagination
  25. Boosting Continuous Control with Consistency Policy
  26. Generalizing Consistency Policy to Visual RL with Prioritized Proximal Experience Regularization
  27. Meta-DT: Offline Meta-RL as Conditional Sequence Modeling with World Model Disentanglement
  28. User Response Modeling in Reinforcement Learning for Ads Allocation