PPaperPicks

Olivier Pietquin

9 papers at tracked venues · 7 at CORE A* · active 20242025

Venues

Frequent coauthors

Papers

  1. NatureLM-audio: an Audio-Language Foundation Model for Bioacoustics
  2. Self-Improving Robust Preference Optimization
  3. ShiQ: Bringing back Bellman to LLMs
  4. Back to Basics: Revisiting REINFORCE-Style Optimization for Learning from Human Feedback in LLMs
  5. Contrastive Policy Gradient: Aligning LLMs on sequence-level scores in a supervised-friendly fashion
  6. Countering Reward Over-Optimization in LLM with Demonstration-Guided Reinforcement Learning
  7. Learning Discrete-Time Major-Minor Mean Field Games
  8. MusicRL: Aligning Music Generation to Human Preferences
  9. Population-aware Online Mirror Descent for Mean-Field Games by Deep Reinforcement Learning