PPaperPicks

Yang Yu

Nanjing University, State Key Laboratory for Novel Software Technology, China

45 papers at tracked venues · 39 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Multi-agent In-context Coordination via Decentralized Memory Retrieval
  2. Reward Model Evaluation via Automatically-Ranked Policy Alignment
  3. Adaptable Safe Policy Learning from Multi-task Data with Constraint Prioritized Decision Transformer
  4. Any-step Dynamics Model Improves Future Predictions for Online and Offline Reinforcement Learning
  5. Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning
  6. Controlling Large Language Model with Latent Action
  7. Efficient Multi-agent Offline Coordination via Diffusion-based Trajectory Stitching
  8. Focus-Then-Reuse: Fast Adaptation in Visual Perturbation Environments
  9. Improving Reward Model Generalization from Adversarial Process Enhanced Preferences
  10. LLM-Assisted Semantically Diverse Teammate Generation for Efficient Multi-agent Coordination
  11. Learning View-invariant World Models for Visual Robotic Manipulation
  12. Learning to Reuse Policies in State Evolvable Environments
  13. Multi-Agent Imitation by Learning and Sampling from Factorized Soft Q-Function
  14. On the Optimization Landscape of Low Rank Adaptation Methods for Large Language Models
  15. Q-Adapter: Customizing Pre-trained LLMs to New Preferences with Forgetting Mitigation
  16. SOO-Bench: Benchmarks for Evaluating the Stability of Offline Black-Box Optimization
  17. Semantic Temporal Abstraction via Vision-Language Model Guidance for Efficient Reinforcement Learning
  18. Uncertainty-Sensitive Privileged Learning
  19. ACT: Empowering Decision Transformer with Dynamic Programming via Advantage Conditioning
  20. Beimingwu: A Learnware Dock System
  21. Continual Multi-Objective Reinforcement Learning via Reward Model Rehearsal
  22. Cost-aware Offline Safe Meta Reinforcement Learning with Robust In-Distribution Online Task Adaptation
  23. Debiased Offline Representation Learning for Fast Online Adaptation in Non-stationary Dynamics
  24. Deep Anomaly Detection via Active Anomaly Search
  25. Deep Demonstration Tracing: Learning Generalizable Imitator Policy for Runtime Imitation from a Single Demonstration
  26. Disentangling Policy from Offline Task Representation Learning via Adversarial Data Augmentation
  27. Dynamics Adaptive Safe Reinforcement Learning with a Misspecified Simulator
  28. Efficient Recurrent Off-Policy RL Requires a Context-Encoder-Specific Learning Rate
  29. Energy-Guided Diffusion Sampling for Offline-to-Online Reinforcement Learning
  30. Episodic Return Decomposition by Difference of Implicitly Assigned Sub-trajectory Reward
  31. Flow to Better: Offline Preference-based Reinforcement Learning via Preferred Trajectory Generation
  32. Focus-Then-Decide: Segmentation-Assisted Reinforcement Learning
  33. Foresight Distribution Adjustment for Off-policy Reinforcement Learning
  34. Generalizable Task Representation Learning for Offline Meta-Reinforcement Learning with Data Limitations
  35. KALM: Knowledgeable Agents by Offline Reinforcement Learning from Large Language Model Rollouts
  36. Language Model Self-improvement by Reinforcement Learning Contemplation
  37. Limited Preference Aided Imitation Learning from Imperfect Demonstrations
  38. Multi-Agent Domain Calibration with a Handful of Offline Data
  39. Offline Transition Modeling via Contrastive Energy Learning
  40. Policy Learning from Tutorial Books via Understanding, Rehearsing and Introspecting
  41. Policy Rehearsing: Training Generalizable Policies for Reinforcement Learning
  42. Policy-conditioned Environment Models are More Generalizable
  43. ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models
  44. Reward-Consistent Dynamics Models are Strongly Generalizable for Offline Reinforcement Learning
  45. When is RL better than DPO in RLHF? A Representation and Optimization Perspective