PPaperPicks

Yuhao Zhou

14 papers at tracked venues · 11 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
  2. FlowSearch: Advancing Deep Research with Dynamic Structured Knowledge Flow
  3. MM-Doc-R1: Training Agents for Long Document Visual Question Answering through Multi-turn Reinforcement Learning
  4. MSEarth: A Multimodal Benchmark for Earth Science Phenomenon Discovery with MLLMs
  5. Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination
  6. What Makes a Good Speech Tokenizer for LLM-Centric Speech Generation? A Systematic Study
  7. Parrot: A Training Pipeline Enhances Both Program CoT and Natural Language CoT for Reasoning
  8. Scientists' First Exam: Probing Cognitive Abilities of MLLM via Perception, Understanding, and Reasoning
    NeurIPS 2025 · Yuhao Zhou
  9. Improving Discriminative Capability of Reward Models in RLHF Using Contrastive Learning
  10. Improving Generalization of Alignment with Human Preferences through Group Invariant Learning
  11. LoRAMoE: Alleviating World Knowledge Forgetting in Large Language Models via MoE-Style Plugin
  12. Reward Modeling Requires Automatic Adjustment Based on Data Quality
  13. StepCoder: Improving Code Generation with Reinforcement Learning from Compiler Feedback
  14. Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning