P
PaperPicks
Conferences
Shuang Qiu
10 papers at tracked venues · 10 at CORE A* · active 2024–2026
DBLP profile ↗
ORCID search ↗
Venues
ICML
×3
ACL
×2
ICLR
×2
NeurIPS
×2
AAAI
×1
Frequent coauthors
Jian Mu
DBLP profile ↗
ORCID search ↗
×1
Zhao Shan
DBLP profile ↗
ORCID search ↗
×1
Chenjia Bai
DBLP profile ↗
ORCID search ↗
×1
Xize Liang
DBLP profile ↗
ORCID search ↗
×1
Yang Zhang
DBLP profile ↗
ORCID search ↗
×1
Yiran Guo
DBLP profile ↗
ORCID search ↗
×1
Jiawei Xu
DBLP profile ↗
ORCID search ↗
×1
Haoxiang Wang
DBLP profile ↗
ORCID search ↗
×1
Dake Zhang
DBLP profile ↗
ORCID search ↗
×1
Rui Yang
DBLP profile ↗
ORCID search ↗
×1
Papers
Self-Reflective Generation at Test Time
ACL 2026
·
Jian Mu
DBLP profile ↗
ORCID search ↗
Forward KL Regularized Preference Optimization for Aligning Diffusion Policies
AAAI 2025
·
Zhao Shan
DBLP profile ↗
ORCID search ↗
Online Preference Alignment for Language Models via Count-based Exploration
ICLR 2025
·
Chenjia Bai
DBLP profile ↗
ORCID search ↗
ROPO: Robust Preference Optimization for Large Language Models
ICML 2025
·
Xize Liang
DBLP profile ↗
ORCID search ↗
Revisiting Multi-Agent World Modeling from a Diffusion-Inspired Perspective
NeurIPS 2025
·
Yang Zhang
DBLP profile ↗
ORCID search ↗
Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language Models
NeurIPS 2025
·
Yiran Guo
DBLP profile ↗
ORCID search ↗
Tackling Data Corruption in Offline Reinforcement Learning via Sequence Modeling
ICLR 2025
·
Jiawei Xu
DBLP profile ↗
ORCID search ↗
Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards
ACL 2024
·
Haoxiang Wang
DBLP profile ↗
ORCID search ↗
Pessimism Meets Risk: Risk-Sensitive Offline Reinforcement Learning
ICML 2024
·
Dake Zhang
DBLP profile ↗
ORCID search ↗
Rewards-in-Context: Multi-objective Alignment of Foundation Models with Dynamic Preference Adjustment
ICML 2024
·
Rui Yang
DBLP profile ↗
ORCID search ↗