P
PaperPicks
Conferences
Haitao Mi
32 papers at tracked venues · 27 at CORE A* · active 2024–2026
DBLP profile ↗
ORCID search ↗
Venues
ACL
×14
NeurIPS
×8
EMNLP
×4
ICLR
×3
AAAI
×1
EACL
×1
ICML
×1
Frequent coauthors
Ante Wang
DBLP profile ↗
ORCID search ↗
×4
Zhenwen Liang
DBLP profile ↗
ORCID search ↗
×3
Mukai Li
DBLP profile ↗
ORCID search ↗
×2
Yuheng Zhang
DBLP profile ↗
ORCID search ↗
×2
Xiaoying Zhang
DBLP profile ↗
ORCID search ↗
×2
Yi Su
DBLP profile ↗
ORCID search ↗
×1
Yuxuan Wan
DBLP profile ↗
ORCID search ↗
×1
Wenkai Wang
DBLP profile ↗
ORCID search ↗
×1
Haolin Liu
DBLP profile ↗
ORCID search ↗
×1
Rui Wang
DBLP profile ↗
ORCID search ↗
×1
Zhisong Zhang
DBLP profile ↗
ORCID search ↗
×1
Murong Yue
DBLP profile ↗
ORCID search ↗
×1
Papers
Crossing the Reward Bridge: Expanding Reinforcement Learning with Verifiable Rewards Across Diverse Domains
ACL 2026
·
Yi Su
DBLP profile ↗
ORCID search ↗
EconProver: Towards More Economical Test-Time Scaling for Automated Theorem Proving
ACL 2026
·
Mukai Li
DBLP profile ↗
ORCID search ↗
Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification
ACL 2026
·
Yuxuan Wan
DBLP profile ↗
ORCID search ↗
Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding
ACL 2026
·
Wenkai Wang
DBLP profile ↗
ORCID search ↗
Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning
ACL 2026
·
Haolin Liu
DBLP profile ↗
ORCID search ↗
Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data
ACL 2026
·
Zhenwen Liang
DBLP profile ↗
ORCID search ↗
Verified Critical Step Optimization for LLM Agents
ACL 2026
·
Mukai Li
DBLP profile ↗
ORCID search ↗
WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation Models
ACL 2026
·
Rui Wang
DBLP profile ↗
ORCID search ↗
WebRollback: Enhancing Web Agents with Explicit Rollback Mechanisms
EACL 2026
·
Zhisong Zhang
DBLP profile ↗
ORCID search ↗
Your Reasoning Model is Secretly a Reward Model - Optimization-Free Verification from Experience
ACL 2026
·
Zhenwen Liang
DBLP profile ↗
ORCID search ↗
DOTS: Learning to Reason Dynamically in LLMs via Optimal Reasoning Trajectories Search
ICLR 2025
·
Murong Yue
DBLP profile ↗
ORCID search ↗
Do NOT Think That Much for 2+3=? On the Overthinking of Long Reasoning Models
ICML 2025
·
Xingyu Chen
DBLP profile ↗
ORCID search ↗
Don't Get Lost in the Trees: Streamlining LLM Reasoning by Overcoming Tree Search Exploration Pitfalls
ACL 2025
·
Ante Wang
DBLP profile ↗
ORCID search ↗
Improving LLM General Preference Alignment via Optimistic Online Mirror Descent
NeurIPS 2025
·
Yuheng Zhang
DBLP profile ↗
ORCID search ↗
Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning
ICLR 2025
·
Yuheng Zhang
DBLP profile ↗
ORCID search ↗
LiteSearch: Efficient Tree Search with Dynamic Exploration Budget for Math Reasoning
AAAI 2025
·
Ante Wang
DBLP profile ↗
ORCID search ↗
Low-Bit Quantization Favors Undertrained LLMs
ACL 2025
·
Xu Ouyang
DBLP profile ↗
ORCID search ↗
MPS-Prover: Advancing Stepwise Theorem Proving by Multi-Perspective Search and Data Curation
NeurIPS 2025
·
Zhenwen Liang
DBLP profile ↗
ORCID search ↗
Recall with Reasoning: Chain-of-Thought Distillation for Mamba's Long-Context Memory and Extrapolation
EMNLP 2025
·
Jun-Yu Ma
DBLP profile ↗
ORCID search ↗
Self-Tuning: Instructing LLMs to Effectively Acquire New Knowledge through Self-Teaching
ACL 2025
·
Xiaoying Zhang
DBLP profile ↗
ORCID search ↗
The First Few Tokens Are All You Need: An Efficient and Effective Unsupervised Prefix Fine-Tuning Method for Reasoning Models
NeurIPS 2025
·
Ke Ji
DBLP profile ↗
ORCID search ↗
Thoughts Are All Over the Place: On the Underthinking of Long Reasoning Models
NeurIPS 2025
·
Yue Wang
DBLP profile ↗
ORCID search ↗
Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards
NeurIPS 2025
·
Xiaoyuan Liu
DBLP profile ↗
ORCID search ↗
Two Experts Are All You Need for Steering Thinking: Reinforcing Cognitive Effort in MoE Reasoning Models Without Additional Training
NeurIPS 2025
·
Mengru Wang
DBLP profile ↗
ORCID search ↗
UniGist: Towards General and Hardware-aligned Sequence-level Long Context Compression
NeurIPS 2025
·
Chenlong Deng
DBLP profile ↗
ORCID search ↗
WebCoT: Enhancing Web Agent Reasoning by Reconstructing Chain-of-Thought in Reflection, Branching, and Rollback
EMNLP 2025
·
Minda Hu
DBLP profile ↗
ORCID search ↗
WebEvolver: Enhancing Web Agent Self-Improvement with Co-evolving World Model
EMNLP 2025
·
Tianqing Fang
DBLP profile ↗
ORCID search ↗
Improving LLM Generations via Fine-Grained Self-Endorsement
ACL 2024
·
Ante Wang
DBLP profile ↗
ORCID search ↗
Self-Alignment for Factuality: Mitigating Hallucinations in LLMs via Self-Evaluation
ACL 2024
·
Xiaoying Zhang
DBLP profile ↗
ORCID search ↗
Self-Consistency Boosts Calibration for Math Reasoning
EMNLP 2024
·
Ante Wang
DBLP profile ↗
ORCID search ↗
The Trickle-down Impact of Reward Inconsistency on RLHF
ICLR 2024
·
Lingfeng Shen
DBLP profile ↗
ORCID search ↗
Toward Self-Improvement of LLMs via Imagination, Searching, and Criticizing
NeurIPS 2024
·
Ye Tian
DBLP profile ↗
ORCID search ↗