P
PaperPicks
Conferences
Zhiheng Xi
44 papers at tracked venues · 32 at CORE A* · active 2024–2026
DBLP profile ↗
ORCID search ↗
Venues
ACL
×22
EMNLP
×10
AAAI
×3
ICLR
×3
NAACL
×2
NeurIPS
×2
ICML
×1
WWW
×1
Frequent coauthors
Shihan Dou
DBLP profile ↗
ORCID search ↗
×4
Junjie Ye
DBLP profile ↗
ORCID search ↗
×3
Ming Zhang
DBLP profile ↗
ORCID search ↗
×3
Wei He
DBLP profile ↗
ORCID search ↗
×2
Shuo Li
DBLP profile ↗
ORCID search ↗
×2
Rui Zheng
DBLP profile ↗
ORCID search ↗
×2
Jie Yang
DBLP profile ↗
ORCID search ↗
×1
Jiazheng Zhang
DBLP profile ↗
ORCID search ↗
×1
Changhao Jiang
DBLP profile ↗
ORCID search ↗
×1
Xin Guo
DBLP profile ↗
ORCID search ↗
×1
Junzhe Wang
DBLP profile ↗
ORCID search ↗
×1
Yifei Cao
DBLP profile ↗
ORCID search ↗
×1
Papers
ABC-Bench: Benchmarking Agentic Backend Coding in Real-World Development
ACL 2026
·
Jie Yang
DBLP profile ↗
ORCID search ↗
AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments
ACL 2026
·
Zhiheng Xi
AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
WWW 2026
·
Zhiheng Xi
AgentV-RL: Scaling Reward Modeling with Agentic Verifier
ACL 2026
·
Jiazheng Zhang
DBLP profile ↗
ORCID search ↗
Beyond Scaling: Measuring and Predicting the Upper Bound of Knowledge Retention in Language Model Pre-Training
ACL 2026
·
Changhao Jiang
DBLP profile ↗
ORCID search ↗
Counteracting the Matthew Effect in Self-Improvement of LVLMs through Head-Tail Re-balancing
ACL 2026
·
Xin Guo
DBLP profile ↗
ORCID search ↗
Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization
ACL 2026
·
Junzhe Wang
DBLP profile ↗
ORCID search ↗
Feedback-Driven Tool-Use Improvements in Large Language Models via Automated Build Environments
ACL 2026
·
Junjie Ye
DBLP profile ↗
ORCID search ↗
From Scores to Preferences: Redefining Evaluation Paradigm for Speech Quality Reward Modeling
ACL 2026
·
Yifei Cao
DBLP profile ↗
ORCID search ↗
LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models
ACL 2026
·
Ming Zhang
DBLP profile ↗
ORCID search ↗
Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models
ACL 2026
·
Hengyuan Zhang
DBLP profile ↗
ORCID search ↗
MM-Doc-R1: Training Agents for Long Document Visual Question Answering through Multi-turn Reinforcement Learning
ACL 2026
·
Jiahang Lin
DBLP profile ↗
ORCID search ↗
MetaAct-RL: Training Language Models for Reasoning Through Meta-Action-Based Reinforcement Learning
AAAI 2026
·
Zhiheng Xi
Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination
AAAI 2026
·
Mingqi Wu
DBLP profile ↗
ORCID search ↗
VRPO: Rethinking Value Modeling for Robust RL under Noisy Supervision in LLM Post-Training
ACL 2026
·
Dingwei Zhu
DBLP profile ↗
ORCID search ↗
What Makes a Good Speech Tokenizer for LLM-Centric Speech Generation? A Systematic Study
AAAI 2026
·
Xiaoran Fan
DBLP profile ↗
ORCID search ↗
Which Reasoning Trajectories Teach Students to Reason Better? A Simple Metric of Informative Alignment
ACL 2026
·
Yuming Yang
DBLP profile ↗
ORCID search ↗
AgentGym: Evaluating and Training Large Language Model-based Agents across Diverse Environments
ACL 2025
·
Zhiheng Xi
Are LLMs Rational Investors? A Study on the Financial Bias in LLMs
ACL 2025
·
Yuhang Zhou
DBLP profile ↗
ORCID search ↗
BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset
NeurIPS 2025
·
Zhiheng Xi
Better Process Supervision with Bi-directional Rewarding Signals
ACL 2025
·
Wenxiang Chen
DBLP profile ↗
ORCID search ↗
CritiQ: Mining Data Quality Criteria from Human Preferences
ACL 2025
·
Honglin Guo
DBLP profile ↗
ORCID search ↗
Distill Visual Chart Reasoning Ability from LLMs to MLLMs
EMNLP 2025
·
Wei He
DBLP profile ↗
ORCID search ↗
Have the VLMs Lost Confidence? A Study of Sycophancy in VLMs
ICLR 2025
·
Shuo Li
DBLP profile ↗
ORCID search ↗
LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation
EMNLP 2025
·
Ming Zhang
DBLP profile ↗
ORCID search ↗
LoRACoE: Improving Large Language Model via Composition-based LoRA Expert
EMNLP 2025
·
Guanyu Li
DBLP profile ↗
ORCID search ↗
Mitigating Object Hallucinations in MLLMs via Multi-Frequency Perturbations
EMNLP 2025
·
Shuo Li
DBLP profile ↗
ORCID search ↗
Mitigating Tail Narrowing in LLM Self-Improvement via Socratic-Guided Sampling
NAACL 2025
·
Yiwen Ding
DBLP profile ↗
ORCID search ↗
Multi-Programming Language Sandbox for LLMs
ACL 2025
·
Shihan Dou
DBLP profile ↗
ORCID search ↗
PFDial: A Structured Dialogue Instruction Fine-tuning Method Based on UML Flowcharts
ACL 2025
·
Ming Zhang
DBLP profile ↗
ORCID search ↗
Parrot: A Training Pipeline Enhances Both Program CoT and Natural Language CoT for Reasoning
EMNLP 2025
·
Senjie Jin
DBLP profile ↗
ORCID search ↗
Pre-Trained Policy Discriminators are General Reward Models
NeurIPS 2025
·
Shihan Dou
DBLP profile ↗
ORCID search ↗
RMB: Comprehensively benchmarking reward models in LLM alignment
ICLR 2025
·
Enyu Zhou
DBLP profile ↗
ORCID search ↗
TL-Training: A Task-Feature-Based Framework for Training Large Language Models in Tool Use
EMNLP 2025
·
Junjie Ye
DBLP profile ↗
ORCID search ↗
ToolHop: A Query-Driven Benchmark for Evaluating Large Language Models in Multi-Hop Tool Use
ACL 2025
·
Junjie Ye
DBLP profile ↗
ORCID search ↗
Toward Optimal LLM Alignments Using Two-Player Games
EMNLP 2025
·
Rui Zheng
DBLP profile ↗
ORCID search ↗
Improving Discriminative Capability of Reward Models in RLHF Using Contrastive Learning
EMNLP 2024
·
Lu Chen
DBLP profile ↗
ORCID search ↗
Improving Generalization of Alignment with Human Preferences through Group Invariant Learning
ICLR 2024
·
Rui Zheng
DBLP profile ↗
ORCID search ↗
Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data
EMNLP 2024
·
Han Xia
DBLP profile ↗
ORCID search ↗
LoRAMoE: Alleviating World Knowledge Forgetting in Large Language Models via MoE-Style Plugin
ACL 2024
·
Shihan Dou
DBLP profile ↗
ORCID search ↗
Reward Modeling Requires Automatic Adjustment Based on Data Quality
EMNLP 2024
·
Binghai Wang
DBLP profile ↗
ORCID search ↗
Self-Demos: Eliciting Out-of-Demonstration Generalizability in Large Language Models
NAACL 2024
·
Wei He
DBLP profile ↗
ORCID search ↗
StepCoder: Improving Code Generation with Reinforcement Learning from Compiler Feedback
ACL 2024
·
Shihan Dou
DBLP profile ↗
ORCID search ↗
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
ICML 2024
·
Zhiheng Xi