P
PaperPicks
Conferences
Josef Dai
6 papers at tracked venues · 6 at CORE A* · active 2024–2025
DBLP profile ↗
ORCID search ↗
Venues
ACL
×4
AAAI
×1
ICLR
×1
Frequent coauthors
Jiaming Ji
DBLP profile ↗
ORCID search ↗
×2
Tianyi Alex Qiu
DBLP profile ↗
ORCID search ↗
×1
Chuxue Cao
DBLP profile ↗
ORCID search ↗
×1
Jiayi Zhou
DBLP profile ↗
ORCID search ↗
×1
Papers
Language Models Resist Alignment: Evidence From Data Compression
ACL 2025
·
Jiaming Ji
DBLP profile ↗
ORCID search ↗
PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
ACL 2025
·
Jiaming Ji
DBLP profile ↗
ORCID search ↗
Reward Generalization in RLHF: A Topological Perspective
ACL 2025
·
Tianyi Alex Qiu
DBLP profile ↗
ORCID search ↗
SafeLawBench: Towards Safe Alignment of Large Language Models
ACL 2025
·
Chuxue Cao
DBLP profile ↗
ORCID search ↗
Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback
AAAI 2025
·
Jiayi Zhou
DBLP profile ↗
ORCID search ↗
Safe RLHF: Safe Reinforcement Learning from Human Feedback
ICLR 2024
·
Josef Dai