P
PaperPicks
Conferences
Yunhao Tang
12 papers at tracked venues · 11 at CORE A* · active 2024–2025
DBLP profile ↗
ORCID search ↗
Venues
ICML
×6
NeurIPS
×4
AAAI
×1
AISTATS
×1
Frequent coauthors
Khimya Khetarpal
DBLP profile ↗
ORCID search ↗
×1
Charles Arnal
DBLP profile ↗
ORCID search ↗
×1
Tyler Kastner
DBLP profile ↗
ORCID search ↗
×1
Harley Wiltzer
DBLP profile ↗
ORCID search ↗
×1
Daniele Calandriello
DBLP profile ↗
ORCID search ↗
×1
Joongkyu Lee
DBLP profile ↗
ORCID search ↗
×1
Rémi Munos
DBLP profile ↗
ORCID search ↗
×1
Mark Rowland
DBLP profile ↗
ORCID search ↗
×1
Zachary Kenton
DBLP profile ↗
ORCID search ↗
×1
Papers
A Unifying Framework for Action-Conditional Self-Predictive Reinforcement Learning
AISTATS 2025
·
Khimya Khetarpal
DBLP profile ↗
ORCID search ↗
Asymmetric REINFORCE for off-Policy Reinforcement Learning: Balancing positive and negative rewards
NeurIPS 2025
·
Charles Arnal
DBLP profile ↗
ORCID search ↗
Beyond Verifiable Rewards: Scaling Reinforcement Learning in Language Models to Unverifiable Data
NeurIPS 2025
·
Yunhao Tang
Categorical Distributional Reinforcement Learning with Kullback-Leibler Divergence: Convergence and Asymptotics
ICML 2025
·
Tyler Kastner
DBLP profile ↗
ORCID search ↗
Optimizing Language Models for Inference Time Objectives using Reinforcement Learning
ICML 2025
·
Yunhao Tang
A Distributional Analogue to the Successor Representation
ICML 2024
·
Harley Wiltzer
DBLP profile ↗
ORCID search ↗
Generalized Preference Optimization: A Unified Approach to Offline Alignment
ICML 2024
·
Yunhao Tang
Human Alignment of Large Language Models through Online Preference Optimisation
ICML 2024
·
Daniele Calandriello
DBLP profile ↗
ORCID search ↗
Learning Uncertainty-Aware Temporally-Extended Actions
AAAI 2024
·
Joongkyu Lee
DBLP profile ↗
ORCID search ↗
Nash Learning from Human Feedback
ICML 2024
·
Rémi Munos
DBLP profile ↗
ORCID search ↗
Near-Minimax-Optimal Distributional Reinforcement Learning with a Generative Model
NeurIPS 2024
·
Mark Rowland
DBLP profile ↗
ORCID search ↗
On scalable oversight with weak LLMs judging strong LLMs
NeurIPS 2024
·
Zachary Kenton
DBLP profile ↗
ORCID search ↗