PPaperPicks

Yixin Liu

Yale University, Department of Computer Science, New Haven, CT, USA

20 papers at tracked venues · 8 at CORE A* · active 20242025

Venues

Frequent coauthors

Papers

  1. AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research
  2. CourtReasoner: Can LLM Agents Reason Like Judges?
  3. Evaluating Mathematical Reasoning Beyond Accuracy
  4. MMVU: Measuring Expert-Level Multi-Discipline Video Understanding
  5. On Evaluating LLM Alignment by Evaluating LLMs as Judges
    NeurIPS 2025 · Yixin Liu
  6. Physics: Benchmarking Foundation Models on University-Level Physics Problem Solving
  7. Re-evaluating Automatic LLM System Ranking for Alignment with Human Preference
  8. ReIFE: Re-evaluating Instruction-Following Evaluation
    NAACL 2025 · Yixin Liu
  9. SCIURus: Shared Circuits for Interpretable Uncertainty Representations in Language Models
  10. SciArena: An Open Evaluation Platform for Non-Verifiable Scientific Literature-Grounded Tasks
  11. Understanding Reference Policies in Direct Preference Optimization
    NAACL 2025 · Yixin Liu
  12. Benchmarking Generation and Evaluation Capabilities of Large Language Models for Instruction Controllable Summarization
    NAACL 2024 · Yixin Liu
  13. Calibrating Long-form Generations From Large Language Models
  14. DocMath-Eval: Evaluating Math Reasoning Capabilities of LLMs in Understanding Financial Documents
  15. FOLIO: Natural Language Reasoning with First-Order Logic
  16. Fair Abstractive Summarization of Diverse Perspectives
  17. M3SciQA: A Multi-Modal Multi-Document Scientific QA Benchmark for Evaluating Foundation Models
  18. On Learning to Summarize with Large Language Models as References
    NAACL 2024 · Yixin Liu
  19. On the Role of Summary Content Units in Text Summarization Evaluation
  20. Rethinking Efficient Multilingual Text Summarization Meta-Evaluation