P
PaperPicks
Conferences
Wei Shen
19 papers at tracked venues · 14 at CORE A* · active 2024–2026
DBLP profile ↗
ORCID search ↗
Venues
EMNLP
×4
ACL
×3
ICLR
×3
ICML
×3
NeurIPS
×3
AAAI
×2
AISTATS
×1
Frequent coauthors
Junshu Pan
DBLP profile ↗
ORCID search ↗
×1
Zhenyu He
DBLP profile ↗
ORCID search ↗
×1
Zhirui Chen
DBLP profile ↗
ORCID search ↗
×1
Ziyi Ye
DBLP profile ↗
ORCID search ↗
×1
Yingxue Zhou
DBLP profile ↗
ORCID search ↗
×1
Zikai Xiao
DBLP profile ↗
ORCID search ↗
×1
Jian Hu
DBLP profile ↗
ORCID search ↗
×1
Enyu Zhou
DBLP profile ↗
ORCID search ↗
×1
Rui Zheng
DBLP profile ↗
ORCID search ↗
×1
Songyang Gao
DBLP profile ↗
ORCID search ↗
×1
Shihan Dou
DBLP profile ↗
ORCID search ↗
×1
Xiaoying Zhang
DBLP profile ↗
ORCID search ↗
×1
Papers
Pre-DPO: Improving Data Utilization in Direct Preference Optimization Using a Guiding Reference Model
AAAI 2026
·
Junshu Pan
DBLP profile ↗
ORCID search ↗
SWE-Swiss: A Multi-Task Fine-Tuning and RL Recipe for High-Performance Issue Resolution
ACL 2026
·
Zhenyu He
DBLP profile ↗
ORCID search ↗
A Single-Loop First-Order Algorithm for Linearly Constrained Bilevel Optimization
NeurIPS 2025
·
Wei Shen
Exploring Data Scaling Trends and Effects in Reinforcement Learning from Human Feedback
NeurIPS 2025
·
Wei Shen
Joint Enhancement of Relational Reasoning for Long-Context LLMs
EMNLP 2025
·
Zhirui Chen
DBLP profile ↗
ORCID search ↗
Learning LLM-as-a-Judge for Preference Alignment
ICLR 2025
·
Ziyi Ye
DBLP profile ↗
ORCID search ↗
Learning from LLM Agents: In-Context Generative Models for Text Casing in E-Commerce Ads
EMNLP 2025
·
Yingxue Zhou
DBLP profile ↗
ORCID search ↗
Mitigating Posterior Salience Attenuation in Long-Context LLMs with Positional Contrastive Decoding
ACL 2025
·
Zikai Xiao
DBLP profile ↗
ORCID search ↗
On the Training Convergence of Transformers for In-Context Classification of Gaussian Mixtures
ICML 2025
·
Wei Shen
OpenRLHF: A Ray-based Easy-to-use, Scalable and High-performance RLHF Framework
EMNLP 2025
·
Jian Hu
DBLP profile ↗
ORCID search ↗
RMB: Comprehensively benchmarking reward models in LLM alignment
ICLR 2025
·
Enyu Zhou
DBLP profile ↗
ORCID search ↗
Improving Generalization of Alignment with Human Preferences through Group Invariant Learning
ICLR 2024
·
Rui Zheng
DBLP profile ↗
ORCID search ↗
Linear Alignment: A Closed-form Solution for Aligning Human Preferences without Tuning and Feedback
ICML 2024
·
Songyang Gao
DBLP profile ↗
ORCID search ↗
LoRAMoE: Alleviating World Knowledge Forgetting in Large Language Models via MoE-Style Plugin
ACL 2024
·
Shihan Dou
DBLP profile ↗
ORCID search ↗
Mitigating Reward Overoptimization via Lightweight Uncertainty Estimation
NeurIPS 2024
·
Xiaoying Zhang
DBLP profile ↗
ORCID search ↗
Reward Modeling Requires Automatic Adjustment Based on Data Quality
EMNLP 2024
·
Binghai Wang
DBLP profile ↗
ORCID search ↗
Stochastic Smoothed Gradient Descent Ascent for Federated Minimax Optimization
AISTATS 2024
·
Wei Shen
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
ICML 2024
·
Zhiheng Xi
DBLP profile ↗
ORCID search ↗
ViTree: Single-Path Neural Tree for Step-Wise Interpretable Fine-Grained Visual Categorization
AAAI 2024
·
Danning Lao
DBLP profile ↗
ORCID search ↗