PPaperPicks

Shuai Li

Shanghai Jiao Tong University, John Hopcroft Center for Computer Science, Shanghai, China

26 papers at tracked venues · 18 at CORE A* · active 20242025

Venues

Frequent coauthors

Papers

  1. Adaptive Offline Data Replay in Offline-to-Online Reinforcement Learning
  2. Bandit Learning in Matching Markets with Indifference
  3. Fast Second-Order Online Kernel Learning Through Incremental Matrix Sketching and Decomposition
  4. Improved Discretization Complexity Analysis of Consistency Models: Variance Exploding Forward Process and Decay Discretization Scheme
  5. Interactive Visualization Recommendation with Hier-SUCB
  6. Learning Imperfect Information Extensive-form Games with Last-iterate Convergence under Bandit Feedback
  7. Logarithmic Regret for Linear Markov Decision Processes with Adversarial Corruptions
  8. Offline-to-Online Reinforcement Learning with Classifier-Free Diffusion Generation
  9. Optimal Algorithm for Max-Min Fair Bandit
  10. The Polynomial Iteration Complexity for Variance Exploding Diffusion Models: Elucidating SDE and ODE Samplers
  11. Towards Provably Efficient Learning of Imperfect Information Extensive-Form Games with Linear Function Approximation
  12. Aligning as Debiasing: Causality-Aware Alignment via Reinforcement Learning with Interventional Feedback
  13. Calibrating Reasoning in Language Models with Internal Consistency
  14. Combinatorial Multivariant Multi-Armed Bandits with Applications to Episodic Reinforcement Learning and Beyond
  15. Few-Shot Diffusion Models Escape the Curse of Dimensionality
  16. Hallucination Diversity-Aware Active Learning for Text Summarization
  17. Improved Analysis for Bandit Learning in Matching Markets
  18. Improved Bandits in Many-to-One Matching Markets with Incentive Compatibility
  19. In-context Learning on Function Classes Unveiled for Transformers
  20. Interact with the Explanations: Causal Debiased Explainable Recommendation System
  21. Learning Versatile Skills with Curriculum Masking
  22. Leveraging Drift to Improve Sample Complexity of Variance Exploding Diffusion Models
  23. On Stationary Point Convergence of PPO-Clip
  24. Sequential Optimum Test with Multi-armed Bandits for Online Experimentation
  25. The Closeness of In-Context Learning and Weight Shifting for Softmax Regression
    NeurIPS 2024 · Shuai Li
  26. Which LLM to Play? Convergence-Aware Online Model Selection with Time-Increasing Bandits