PPaperPicks

Rong Bao

5 papers at tracked venues · 5 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Time-Frequency Token Advantage Clipping for Training Efficient Large Reasoning Model
    AAAI 2026 · Rong Bao
  2. Fixing Distribution Shifts of LLM Self-Critique via On-Policy Self-Play Training
    ACL 2025 · Rong Bao
  3. Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections
  4. RMB: Comprehensively benchmarking reward models in LLM alignment
  5. InfoRM: Mitigating Reward Hacking in RLHF via Information-Theoretic Reward Modeling