PPaperPicks

Zongzhang Zhang

Nanjing University, National Key Laboratory for Novel Software Technology, Nanjing, China

27 papers at tracked venues · 22 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Efficient Preference Alignment via Pareto Exploration (Student Abstract)
  2. Meta-Normalizing Flow for Data-Limited Offline Meta-Reinforcement Learning (Student Abstract)
  3. Multi-agent In-context Coordination via Decentralized Memory Retrieval
  4. Reward Model Evaluation via Automatically-Ranked Policy Alignment
  5. Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning
  6. EvaLearn: Quantifying the Learning Capability and Efficiency of LLMs via Sequential Problem Solving
  7. Focus-Then-Reuse: Fast Adaptation in Visual Perturbation Environments
  8. Lost in the Context: Insufficient and Distracted Attention to Contexts in Preference Modeling
  9. Multi-Agent Imitation by Learning and Sampling from Factorized Soft Q-Function
  10. Q-Adapter: Customizing Pre-trained LLMs to New Preferences with Forgetting Mitigation
  11. Reinforced In-Context Black-Box Optimization
  12. Reward Models in Deep Reinforcement Learning: A Survey
  13. ACT: Empowering Decision Transformer with Dynamic Programming via Advantage Conditioning
  14. Attention-Guided Contrastive Role Representations for Multi-agent Reinforcement Learning
  15. Debiased Offline Representation Learning for Fast Online Adaptation in Non-stationary Dynamics
  16. Deep Anomaly Detection via Active Anomaly Search
  17. Deep Demonstration Tracing: Learning Generalizable Imitator Policy for Runtime Imitation from a Single Demonstration
  18. Disentangling Policy from Offline Task Representation Learning via Adversarial Data Augmentation
  19. Efficient and Stable Offline-to-online Reinforcement Learning via Continual Policy Revitalization
  20. Focus-Then-Decide: Segmentation-Assisted Reinforcement Learning
  21. Generalizable Policy Improvement via Reinforcement Sampling (Student Abstract)
  22. Generalizable Task Representation Learning for Offline Meta-Reinforcement Learning with Data Limitations
  23. Language Model Self-improvement by Reinforcement Learning Contemplation
  24. Multi-Agent Domain Calibration with a Handful of Offline Data
  25. Multi-Expert Distillation for Few-Shot Coordination (Student Abstract)
  26. ODRL: A Benchmark for Off-Dynamics Reinforcement Learning
  27. Policy Rehearsing: Training Generalizable Policies for Reinforcement Learning