P
PaperPicks
Conferences
Matthieu Geist
16 papers at tracked venues · 12 at CORE A* · active 2024–2025
DBLP profile ↗
ORCID search ↗
Venues
NeurIPS
×6
ICLR
×3
ICML
×2
AAAI
×1
AAMAS
×1
EMNLP
×1
IROS
×1
UAI
×1
Frequent coauthors
Pierre Clavier
DBLP profile ↗
ORCID search ↗
×3
Till Freihaut
DBLP profile ↗
ORCID search ↗
×1
Eugene Choi
DBLP profile ↗
ORCID search ↗
×1
Raj Ghugare
DBLP profile ↗
ORCID search ↗
×1
Yannis Flet-Berliac
DBLP profile ↗
ORCID search ↗
×1
Matteo El Hariry
DBLP profile ↗
ORCID search ↗
×1
Markus Wulfmeier
DBLP profile ↗
ORCID search ↗
×1
Kai Cui
DBLP profile ↗
ORCID search ↗
×1
Geoffrey Cideron
DBLP profile ↗
ORCID search ↗
×1
Rémi Munos
DBLP profile ↗
ORCID search ↗
×1
Rishabh Agarwal
DBLP profile ↗
ORCID search ↗
×1
Amit Sinha
DBLP profile ↗
ORCID search ↗
×1
Papers
Learning Equilibria from Data: Provably Efficient Multi-Agent Imitation Learning
NeurIPS 2025
·
Till Freihaut
DBLP profile ↗
ORCID search ↗
Self-Improving Robust Preference Optimization
ICLR 2025
·
Eugene Choi
DBLP profile ↗
ORCID search ↗
ShiQ: Bringing back Bellman to LLMs
NeurIPS 2025
·
Pierre Clavier
DBLP profile ↗
ORCID search ↗
Closing the Gap between TD Learning and Supervised Learning - A Generalisation Point of View
ICLR 2024
·
Raj Ghugare
DBLP profile ↗
ORCID search ↗
Contrastive Policy Gradient: Aligning LLMs on sequence-level scores in a supervised-friendly fashion
EMNLP 2024
·
Yannis Flet-Berliac
DBLP profile ↗
ORCID search ↗
DRIFT: Deep Reinforcement Learning for Intelligent Floating Platforms Trajectories
IROS 2024
·
Matteo El Hariry
DBLP profile ↗
ORCID search ↗
Imitating Language via Scalable Inverse Reinforcement Learning
NeurIPS 2024
·
Markus Wulfmeier
DBLP profile ↗
ORCID search ↗
Learning Discrete-Time Major-Minor Mean Field Games
AAAI 2024
·
Kai Cui
DBLP profile ↗
ORCID search ↗
MusicRL: Aligning Music Generation to Human Preferences
ICML 2024
·
Geoffrey Cideron
DBLP profile ↗
ORCID search ↗
Nash Learning from Human Feedback
ICML 2024
·
Rémi Munos
DBLP profile ↗
ORCID search ↗
Near-Optimal Distributionally Robust Reinforcement Learning with General $L_p$ Norms
NeurIPS 2024
·
Pierre Clavier
DBLP profile ↗
ORCID search ↗
On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes
ICLR 2024
·
Rishabh Agarwal
DBLP profile ↗
ORCID search ↗
Periodic agent-state based Q-learning for POMDPs
NeurIPS 2024
·
Amit Sinha
DBLP profile ↗
ORCID search ↗
Population-aware Online Mirror Descent for Mean-Field Games by Deep Reinforcement Learning
AAMAS 2024
·
Zida Wu
DBLP profile ↗
ORCID search ↗
Time-Constrained Robust MDPs
NeurIPS 2024
·
Adil Zouitine
DBLP profile ↗
ORCID search ↗
Towards Minimax Optimality of Model-based Robust Reinforcement Learning
UAI 2024
·
Pierre Clavier
DBLP profile ↗
ORCID search ↗