P
PaperPicks
Conferences
Dian Yu
15 papers at tracked venues · 11 at CORE A* · active 2024–2026
DBLP profile ↗
ORCID search ↗
Venues
ACL
×4
NeurIPS
×3
EMNLP
×2
ICLR
×2
AAAI
×1
ECCV
×1
ICML
×1
NAACL
×1
Frequent coauthors
Ante Wang
DBLP profile ↗
ORCID search ↗
×2
Yuheng Zhang
DBLP profile ↗
ORCID search ↗
×2
Yi Su
DBLP profile ↗
ORCID search ↗
×1
Haolin Liu
DBLP profile ↗
ORCID search ↗
×1
Zhenwen Liang
DBLP profile ↗
ORCID search ↗
×1
Murong Yue
DBLP profile ↗
ORCID search ↗
×1
Xingyu Chen
DBLP profile ↗
ORCID search ↗
×1
Yue Wang
DBLP profile ↗
ORCID search ↗
×1
Zhen Zhao
DBLP profile ↗
ORCID search ↗
×1
Zhihan Zhang
DBLP profile ↗
ORCID search ↗
×1
Jiaao Chen
DBLP profile ↗
ORCID search ↗
×1
Sihao Chen
DBLP profile ↗
ORCID search ↗
×1
Papers
Crossing the Reward Bridge: Expanding Reinforcement Learning with Verifiable Rewards Across Diverse Domains
ACL 2026
·
Yi Su
DBLP profile ↗
ORCID search ↗
Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning
ACL 2026
·
Haolin Liu
DBLP profile ↗
ORCID search ↗
Your Reasoning Model is Secretly a Reward Model - Optimization-Free Verification from Experience
ACL 2026
·
Zhenwen Liang
DBLP profile ↗
ORCID search ↗
DOTS: Learning to Reason Dynamically in LLMs via Optimal Reasoning Trajectories Search
ICLR 2025
·
Murong Yue
DBLP profile ↗
ORCID search ↗
Do NOT Think That Much for 2+3=? On the Overthinking of Long Reasoning Models
ICML 2025
·
Xingyu Chen
DBLP profile ↗
ORCID search ↗
Don't Get Lost in the Trees: Streamlining LLM Reasoning by Overcoming Tree Search Exploration Pitfalls
ACL 2025
·
Ante Wang
DBLP profile ↗
ORCID search ↗
Improving LLM General Preference Alignment via Optimistic Online Mirror Descent
NeurIPS 2025
·
Yuheng Zhang
DBLP profile ↗
ORCID search ↗
Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning
ICLR 2025
·
Yuheng Zhang
DBLP profile ↗
ORCID search ↗
LiteSearch: Efficient Tree Search with Dynamic Exploration Budget for Math Reasoning
AAAI 2025
·
Ante Wang
DBLP profile ↗
ORCID search ↗
Thoughts Are All Over the Place: On the Underthinking of Long Reasoning Models
NeurIPS 2025
·
Yue Wang
DBLP profile ↗
ORCID search ↗
Alternate Diverse Teaching for Semi-supervised Medical Image Segmentation
ECCV 2024
·
Zhen Zhao
DBLP profile ↗
ORCID search ↗
Learn Beyond The Answer: Training Language Models with Reflection for Mathematical Reasoning
EMNLP 2024
·
Zhihan Zhang
DBLP profile ↗
ORCID search ↗
Skills-in-Context: Unlocking Compositionality in Large Language Models
EMNLP 2024
·
Jiaao Chen
DBLP profile ↗
ORCID search ↗
Sub-Sentence Encoder: Contrastive Learning of Propositional Semantic Representations
NAACL 2024
·
Sihao Chen
DBLP profile ↗
ORCID search ↗
Toward Self-Improvement of LLMs via Imagination, Searching, and Criticizing
NeurIPS 2024
·
Ye Tian
DBLP profile ↗
ORCID search ↗