PPaperPicks

Anca D. Dragan

UC Berkeley, CA, USA

21 papers at tracked venues · 18 at CORE A* · active 20242025

Venues

Frequent coauthors

Papers

  1. Adversaries Can Misuse Combinations of Safe Models
  2. AssistanceZero: Scalably Solving Assistance Games
  3. Context Steering: Controllable Personalization at Inference Time
  4. Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking
  5. On Targeted Manipulation and Deception when Optimizing LLMs for User Feedback
  6. Planning without Search: Refining Frontier LLMs with Offline Goal-Conditioned RL
  7. Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning
  8. Temporal Representation Alignment: Successor Features Enable Emergent Compositionality in Robot Instruction Following
  9. A Generalized Acquisition Function for Preference-based Reward Learning
  10. AI Alignment with Changing and Influenceable Reward Functions
  11. Confronting Reward Model Overoptimization with Constrained RLHF
  12. Coprocessor Actor Critic: A Model-Based Reinforcement Learning Approach For Adaptive Brain Stimulation
  13. Defining Deception in Decision Making
  14. Learning Optimal Advantage from Preferences and Mistaking It for Reward
  15. Learning Temporal Distances: Contrastive Successor Features Can Provide a Metric Structure for Decision-Making
  16. Learning to Assist Humans without Inferring Rewards
  17. Learning to Model the World With Language
  18. Offline RL with Observation Histories: Analyzing and Improving Sample Complexity
  19. The Effective Horizon Explains Deep RL Performance in Stochastic Environments
  20. Toward Grounded Commonsense Reasoning
  21. When Your AIs Deceive You: Challenges of Partial Observability in Reinforcement Learning from Human Feedback