P
PaperPicks
Conferences
Senjie Jin
10 papers at tracked venues · 8 at CORE A* · active 2024–2026
DBLP profile ↗
ORCID search ↗
Venues
AAAI
×3
ACL
×2
EMNLP
×2
CVPR
×1
ICML
×1
WWW
×1
Frequent coauthors
Zhiheng Xi
DBLP profile ↗
ORCID search ↗
×3
Hengyuan Zhang
DBLP profile ↗
ORCID search ↗
×1
Mingqi Wu
DBLP profile ↗
ORCID search ↗
×1
Dingwei Zhu
DBLP profile ↗
ORCID search ↗
×1
Xiaoran Fan
DBLP profile ↗
ORCID search ↗
×1
Yongting Zhang
DBLP profile ↗
ORCID search ↗
×1
Lu Chen
DBLP profile ↗
ORCID search ↗
×1
Papers
AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
WWW 2026
·
Zhiheng Xi
DBLP profile ↗
ORCID search ↗
Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models
ACL 2026
·
Hengyuan Zhang
DBLP profile ↗
ORCID search ↗
MetaAct-RL: Training Language Models for Reasoning Through Meta-Action-Based Reinforcement Learning
AAAI 2026
·
Zhiheng Xi
DBLP profile ↗
ORCID search ↗
Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination
AAAI 2026
·
Mingqi Wu
DBLP profile ↗
ORCID search ↗
VRPO: Rethinking Value Modeling for Robust RL under Noisy Supervision in LLM Post-Training
ACL 2026
·
Dingwei Zhu
DBLP profile ↗
ORCID search ↗
What Makes a Good Speech Tokenizer for LLM-Centric Speech Generation? A Systematic Study
AAAI 2026
·
Xiaoran Fan
DBLP profile ↗
ORCID search ↗
Parrot: A Training Pipeline Enhances Both Program CoT and Natural Language CoT for Reasoning
EMNLP 2025
·
Senjie Jin
SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Models
CVPR 2025
·
Yongting Zhang
DBLP profile ↗
ORCID search ↗
Improving Discriminative Capability of Reward Models in RLHF Using Contrastive Learning
EMNLP 2024
·
Lu Chen
DBLP profile ↗
ORCID search ↗
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
ICML 2024
·
Zhiheng Xi
DBLP profile ↗
ORCID search ↗