PPaperPicks

Shuang Qiu

10 papers at tracked venues · 10 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Self-Reflective Generation at Test Time
  2. Forward KL Regularized Preference Optimization for Aligning Diffusion Policies
  3. Online Preference Alignment for Language Models via Count-based Exploration
  4. ROPO: Robust Preference Optimization for Large Language Models
  5. Revisiting Multi-Agent World Modeling from a Diffusion-Inspired Perspective
  6. Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language Models
  7. Tackling Data Corruption in Offline Reinforcement Learning via Sequence Modeling
  8. Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards
  9. Pessimism Meets Risk: Risk-Sensitive Offline Reinforcement Learning
  10. Rewards-in-Context: Multi-objective Alignment of Foundation Models with Dynamic Preference Adjustment