PPaperPicks

Pengfei Liu

Shanghai Jiao Tong University, Generative AI Research Lab (GAIR), China

35 papers at tracked venues · 24 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. AgencyBench: Benchmarking the Frontiers of Autonomous Agents in 1M-Token Real-World Contexts
  2. DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models
  3. Interaction as Intelligence: A Transparent, Fine-Grained Multi-Agent Deep Research System for Human-Agent Collaboration
  4. LongCLI-Bench: A Preliminary Benchmark and Study for Long-horizon Agentic Programming in Command-Line Interfaces
  5. SCALE: Selective Resource Allocation for Overcoming Performance Bottlenecks in Mathematical Test-time Scaling
  6. SepSeq: A Training-Free Framework for Long Numerical Sequence Processing in LLMs
  7. DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments
  8. Evaluating Mathematical Reasoning Beyond Accuracy
  9. LIMOPro: Reasoning Refinement for Efficient and Effective Test-time Scaling
  10. Libra-Leaderboard: Towards Responsible AI through a Balanced Leaderboard of Safety and Capability
  11. OmniBal: Towards Fast Instruction-Tuning for Vision-Language Models via Omniverse Computation Balance
  12. On Evaluating LLM Alignment by Evaluating LLMs as Judges
  13. Programming Every Example: Lifting Pre-training Data Quality Like Experts at Scale
  14. Progress or Regress? Self-Improvement Reversal in Post-training
  15. Towards Dynamic Theory of Mind: Evaluating LLM Adaptation to Temporal Evolution of Human States
  16. Understanding Reference Policies in Direct Preference Optimization
  17. Alignment for Honesty
  18. Benchmarking Generation and Evaluation Capabilities of Large Language Models for Instruction Controllable Summarization
  19. Dissecting Human and LLM Preferences
  20. ECON: On the Detection and Resolution of Evidence Conflicts
  21. FRoG: Evaluating Fuzzy Reasoning of Generalized Quantifiers in LLMs
  22. GPTScore: Evaluate as You Desire
  23. Generative Judge for Evaluating Alignment
  24. InFoBench: Evaluating Instruction Following Ability in Large Language Models
  25. LLMCrit: Teaching Large Language Models to Use Criteria
  26. MathPile: A Billion-Token-Scale Pretraining Corpus for Math
  27. MoPS: Modular Story Premise Synthesis for Open-Ended Automatic Story Generation
  28. OlympicArena: Benchmarking Multi-discipline Cognitive Reasoning for Superintelligent AI
  29. On Learning to Summarize with Large Language Models as References
  30. OpenResearcher: Unleashing AI for Accelerated Scientific Research
  31. Prompt Chaining or Stepwise Prompt? Refinement in Text Summarization
  32. RAGChecker: A Fine-grained Framework for Diagnosing Retrieval-Augmented Generation
  33. Reformatted Alignment
  34. The Critique of Critique
  35. Weak-to-Strong Reasoning