PPaperPicks

Josef Dai

6 papers at tracked venues · 6 at CORE A* · active 20242025

Venues

Frequent coauthors

Papers

  1. Language Models Resist Alignment: Evidence From Data Compression
  2. PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
  3. Reward Generalization in RLHF: A Topological Perspective
  4. SafeLawBench: Towards Safe Alignment of Large Language Models
  5. Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback
  6. Safe RLHF: Safe Reinforcement Learning from Human Feedback
    ICLR 2024 · Josef Dai