P
PaperPicks
Conferences
Olivier Pietquin
9 papers at tracked venues · 7 at CORE A* · active 2024–2025
DBLP profile ↗
ORCID search ↗
Venues
ACL
×2
ICLR
×2
AAAI
×1
AAMAS
×1
EMNLP
×1
ICML
×1
NeurIPS
×1
Frequent coauthors
David Robinson
DBLP profile ↗
ORCID search ↗
×1
Eugene Choi
DBLP profile ↗
ORCID search ↗
×1
Pierre Clavier
DBLP profile ↗
ORCID search ↗
×1
Arash Ahmadian
DBLP profile ↗
ORCID search ↗
×1
Yannis Flet-Berliac
DBLP profile ↗
ORCID search ↗
×1
Mathieu Rita
DBLP profile ↗
ORCID search ↗
×1
Kai Cui
DBLP profile ↗
ORCID search ↗
×1
Geoffrey Cideron
DBLP profile ↗
ORCID search ↗
×1
Zida Wu
DBLP profile ↗
ORCID search ↗
×1
Papers
NatureLM-audio: an Audio-Language Foundation Model for Bioacoustics
ICLR 2025
·
David Robinson
DBLP profile ↗
ORCID search ↗
Self-Improving Robust Preference Optimization
ICLR 2025
·
Eugene Choi
DBLP profile ↗
ORCID search ↗
ShiQ: Bringing back Bellman to LLMs
NeurIPS 2025
·
Pierre Clavier
DBLP profile ↗
ORCID search ↗
Back to Basics: Revisiting REINFORCE-Style Optimization for Learning from Human Feedback in LLMs
ACL 2024
·
Arash Ahmadian
DBLP profile ↗
ORCID search ↗
Contrastive Policy Gradient: Aligning LLMs on sequence-level scores in a supervised-friendly fashion
EMNLP 2024
·
Yannis Flet-Berliac
DBLP profile ↗
ORCID search ↗
Countering Reward Over-Optimization in LLM with Demonstration-Guided Reinforcement Learning
ACL 2024
·
Mathieu Rita
DBLP profile ↗
ORCID search ↗
Learning Discrete-Time Major-Minor Mean Field Games
AAAI 2024
·
Kai Cui
DBLP profile ↗
ORCID search ↗
MusicRL: Aligning Music Generation to Human Preferences
ICML 2024
·
Geoffrey Cideron
DBLP profile ↗
ORCID search ↗
Population-aware Online Mirror Descent for Mean-Field Games by Deep Reinforcement Learning
AAMAS 2024
·
Zida Wu
DBLP profile ↗
ORCID search ↗