P
PaperPicks
Conferences
Songyang Gao
13 papers at tracked venues · 10 at CORE A* · active 2024–2025
DBLP profile ↗
ORCID search ↗
Venues
ACL
×6
EMNLP
×3
NeurIPS
×2
AAAI
×1
ICML
×1
Frequent coauthors
Shihan Dou
DBLP profile ↗
ORCID search ↗
×3
Junjie Ye
DBLP profile ↗
ORCID search ↗
×2
Zhiheng Xi
DBLP profile ↗
ORCID search ↗
×1
Junnan Liu
DBLP profile ↗
ORCID search ↗
×1
Qiming Ge
DBLP profile ↗
ORCID search ↗
×1
Shudong Liu
DBLP profile ↗
ORCID search ↗
×1
Junhao Shen
DBLP profile ↗
ORCID search ↗
×1
Han Xia
DBLP profile ↗
ORCID search ↗
×1
Chenyu Shi
DBLP profile ↗
ORCID search ↗
×1
Papers
AgentGym: Evaluating and Training Large Language Model-based Agents across Diverse Environments
ACL 2025
·
Zhiheng Xi
DBLP profile ↗
ORCID search ↗
Alleviating Shifted Distribution in Human Preference Alignment through Meta-Learning
AAAI 2025
·
Shihan Dou
DBLP profile ↗
ORCID search ↗
Are Your LLMs Capable of Stable Reasoning?
ACL 2025
·
Junnan Liu
DBLP profile ↗
ORCID search ↗
Capability Salience Vector: Fine-grained Alignment of Loss and Capabilities for Downstream Task Scaling Law
ACL 2025
·
Qiming Ge
DBLP profile ↗
ORCID search ↗
CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward
EMNLP 2025
·
Shudong Liu
DBLP profile ↗
ORCID search ↗
Pre-Trained Policy Discriminators are General Reward Models
NeurIPS 2025
·
Shihan Dou
DBLP profile ↗
ORCID search ↗
Semi-off-Policy Reinforcement Learning for Vision-Language Slow-Thinking Reasoning
NeurIPS 2025
·
Junhao Shen
DBLP profile ↗
ORCID search ↗
Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data
EMNLP 2024
·
Han Xia
DBLP profile ↗
ORCID search ↗
Linear Alignment: A Closed-form Solution for Aligning Human Preferences without Tuning and Feedback
ICML 2024
·
Songyang Gao
LoRAMoE: Alleviating World Knowledge Forgetting in Large Language Models via MoE-Style Plugin
ACL 2024
·
Shihan Dou
DBLP profile ↗
ORCID search ↗
Navigating the OverKill in Large Language Models
ACL 2024
·
Chenyu Shi
DBLP profile ↗
ORCID search ↗
RoTBench: A Multi-Level Benchmark for Evaluating the Robustness of Large Language Models in Tool Learning
EMNLP 2024
·
Junjie Ye
DBLP profile ↗
ORCID search ↗
ToolSword: Unveiling Safety Issues of Large Language Models in Tool Learning Across Three Stages
ACL 2024
·
Junjie Ye
DBLP profile ↗
ORCID search ↗