PPaperPicks

Min-hwan Oh

32 papers at tracked venues · 29 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Unified Framework of Distributional Regret in Multi-Armed Bandits and Reinforcement Learning
  2. ADAM Optimization with Adaptive Batch Selection
  3. Adversarial Policy Optimization for Offline Preference-based Reinforcement Learning
  4. Combinatorial Reinforcement Learning with Preference Feedback
  5. Dynamic Assortment Selection and Pricing with Censored Preference Feedback
  6. EUGens: Efficient, Unified and General Dense Layers
  7. Experimental Design for Semiparametric Bandits
  8. Exploration via Feature Perturbation in Contextual Bandits
  9. Improved Online Confidence Bounds for Multinomial Logistic Bandits
  10. Infrequent Exploration in Linear Bandits
  11. Lasso Bandit with Compatibility Condition on Optimal Arm
  12. Linear Bandits with Partially Observable Features
  13. Minimax Optimal Reinforcement Learning with Quasi-Optimism
  14. Optimal and Practical Batched Linear Bandit Algorithm
  15. Oracle-Efficient Combinatorial Semi-Bandits
  16. Position: AI Should Sense Better, Not Just Scale Bigger: Adaptive Sensing as a Paradigm Shift
  17. Preference-based Reinforcement Learning beyond Pairwise Comparisons: Benefits of Multiple Options
  18. Revisiting Follow-the-Perturbed-Leader with Unbounded Perturbations in Bandit Problems
  19. Symmetry-Aware GFlowNets
  20. Thompson Sampling for Multi-Objective Linear Contextual Bandit
  21. Tractable Multinomial Logit Contextual Bandits with Non-Linear Utilities
  22. True Impact of Cascade Length in Contextual Cascading Bandits
  23. Demystifying Linear MDPs and Novel Dynamics Aggregation Framework
  24. Doubly Perturbed Task Free Continual Learning
  25. Follow-the-Perturbed-Leader with Fréchet-type Tail Distributions: Optimality in Adversarial Bandits and Best-of-Both-Worlds
  26. Improved Regret of Linear Ensemble Sampling
  27. Learning Uncertainty-Aware Temporally-Extended Actions
  28. Local Anti-Concentration Class: Logarithmic Regret for Greedy Linear Contextual Bandit
  29. Mixed-Effects Contextual Bandits
  30. Nearly Minimax Optimal Regret for Multinomial Logistic Bandit
  31. Queueing Matching Bandits with Preference Feedback
  32. Randomized Exploration for Reinforcement Learning with Multinomial Logistic Function Approximation