PPaperPicks

Mohammad Ghavamzadeh

7 papers at tracked venues · 6 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Preference Optimization via Contrastive Divergence: Your Policy Is Secretly an NLL Estimator
  2. Conservative Contextual Bandits: Beyond Linear Representations
  3. Does Thinking More Always Help? Mirage of Test-Time Scaling in Reasoning Models
  4. Q-learning for Quantile MDPs: A Decomposition, Performance, and Convergence Analysis
  5. Bayesian Regret Minimization in Offline Bandits
  6. Confidence-aware Reward Optimization for Fine-tuning Text-to-Image Models
  7. Maximum Entropy Model Correction in Reinforcement Learning