PPaperPicks

Arman Cohan

82 papers at tracked venues · 42 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. A Survey of Multimodal Mathematical Reasoning: From Perception, Alignment to Reasoning
  2. A Survey on Evaluation of LLM-based Agents
  3. Anchor: Branch-Point Data Generation for GUI Agents
  4. CPTCoder: A Reliable LLM System for Medical Procedure Code Prediction
  5. Can AI Be a Good Peer Reviewer? A Survey of Peer Review Process, Evaluation, and the Future
  6. Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics
  7. Investigating Retrieval-Augmented Generation Systems on Unanswerable, Uncheatable, Realistic, Multi-hop Queries
  8. MMSciCode: Real-world Evaluation of Multilingual Multi-Discipline Scientific Research Coding
  9. MultiFinBen: Benchmarking Large Language Models for Multilingual and Multimodal Financial Application
  10. Patient-Similarity Cohort Reasoning in Clinical Text-to-SQL
  11. RbtAct: Rebuttal as Supervision for Actionable Review Feedback Generation
  12. Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search Systems
  13. SciMDR: Advancing Scientific Multimodal Document Reasoning
  14. SciRAG: Adaptive, Citation-Aware, and Outline-Guided Retrieval and Synthesis for Scientific Literature
  15. A Large-Scale Study of Reranker Relevance Feedback at Inference
  16. AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research
  17. Are Multimodal LLMs Robust Against Adversarial Perturbations? RoMMath: A Systematic Evaluation on Multimodal Math Reasoning
  18. Can LLMs Identify Critical Limitations within Scientific Research? A Systematic Evaluation on AI Research Papers
  19. Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers
  20. ChemAgent: Self-updating Memories in Large Language Models Improves Chemical Reasoning
  21. CourtReasoner: Can LLM Agents Reason Like Judges?
  22. Diffusion vs. Autoregressive Language Models: A Text Embedding Perspective
  23. DyFlow: Dynamic Workflow Framework for Agentic Reasoning
  24. FinLFQA: Evaluating Attributed Text Generation of LLMs in Financial Long-Form Question Answering
  25. FinTrust: A Comprehensive Benchmark of Trustworthiness Evaluation in Finance Domain
  26. FollowIR: Evaluating and Teaching Information Retrieval Models to Follow Instructions
  27. From Scores to Steps: Diagnosing and Improving LLM Performance in Evidence-Based Medical Calculations
  28. HumanEval Pro and MBPP Pro: Evaluating Large Language Models on Self-invoking Code Generation Task
  29. IRIS: Interactive Research Ideation System for Accelerating Scientific Discovery
  30. Judging with Many Minds: Do More Perspectives Mean Less Prejudice? On Bias Amplification and Resistance in Multi-Agent Based LLM-as-Judge
  31. LimRank: Less is More for Reasoning-Intensive Information Reranking
  32. LocAgent: Graph-Guided LLM Agents for Code Localization
  33. MCTS-RAG: Enhancing Retrieval-Augmented Generation with Monte Carlo Tree Search
  34. MDCure: A Scalable Pipeline for Multi-Document Instruction-Following
    ACL 2025 ·
    Gabrielle Kaili-May Liu
  35. MIR: Methodology Inspiration Retrieval for Scientific Research Problems
  36. MMVU: Measuring Expert-Level Multi-Discipline Video Understanding
  37. Measuring what Matters: Construct Validity in Large Language Model Benchmarks
  38. MedTutor: A Retrieval-Augmented LLM System for Case-Based Medical Education
  39. MetaFaith: Faithful Natural Language Uncertainty Expression in LLMs
  40. On Evaluating LLM Alignment by Evaluating LLMs as Judges
  41. Physics: Benchmarking Foundation Models on University-Level Physics Problem Solving
  42. Re-evaluating Automatic LLM System Ranking for Alignment with Human Preference
  43. ReIFE: Re-evaluating Instruction-Following Evaluation
  44. Ref-Long: Benchmarking the Long-context Referencing Capability of Long-context Language Models
  45. RouterRetriever: Routing over a Mixture of Expert Embedding Models
  46. SCIURus: Shared Circuits for Interpretable Uncertainty Representations in Language Models
  47. SciArena: An Open Evaluation Platform for Non-Verifiable Scientific Literature-Grounded Tasks
  48. SciRIFF: A Resource to Enhance Language Model Instruction-Following over Scientific Literature
  49. SciSketch: An Open-source Framework for Automated Schematic Diagram Generation in Scientific Papers
  50. SciVer: Evaluating Foundation Models for Multimodal Scientific Claim Verification
  51. TESS 2: A Large-Scale Generalist Diffusion Language Model
  52. TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models
  53. Table-R1: Inference-Time Scaling for Table Reasoning Tasks
  54. Understanding Reference Policies in Direct Preference Optimization
  55. Z1: Efficient Test-time Scaling with Code
  56. mFollowIR: A Multilingual Benchmark for Instruction Following in Retrieval
  57. Bayesian Calibration of Win Rate Estimation with LLM Evaluators
  58. Benchmarking Generation and Evaluation Capabilities of Large Language Models for Instruction Controllable Summarization
  59. Calibrating Long-form Generations From Large Language Models
  60. DocMath-Eval: Evaluating Math Reasoning Capabilities of LLMs in Understanding Financial Documents
  61. FOLIO: Natural Language Reasoning with First-Order Logic
  62. FinDVer: Explainable Claim Verification over Long and Hybrid-content Financial Documents
  63. Investigating Data Contamination in Modern Benchmarks for Large Language Models
  64. KnowledgeFMath: A Knowledge-Intensive Math Reasoning Dataset in Finance Domains
  65. M3SciQA: A Multi-Modal Multi-Document Scientific QA Benchmark for Evaluating Foundation Models
  66. MIMIR: A Customizable Agent Tuning Platform for Enhanced Scientific Applications
  67. MedAgents: Large Language Models as Collaborators for Zero-shot Medical Reasoning
  68. NExT: Teaching Large Language Models to Reason about Code Execution
  69. OLMo: Accelerating the Science of Language Models
  70. OMG-QA: Building Open-Domain Multi-Modal Generative Question Answering Systems
  71. Observable Propagation: Uncovering Feature Vectors in Transformers
  72. On Evaluating the Integration of Reasoning and Action in LLM Agents with Database Question Answering
  73. On Learning to Summarize with Large Language Models as References
  74. OpenT2T: An Open-Source Toolkit for Table-to-Text Generation
  75. P-FOLIO: Evaluating and Improving Logical Reasoning with Abundant Human-Written Reasoning Chains
  76. Quantifying Contamination in Evaluating Code Generation Capabilities of Language Models
  77. Rethinking Efficient Multilingual Text Summarization Meta-Evaluation
  78. SciDQA: A Deep Reading Comprehension Dataset over Scientific Papers
  79. Struc-Bench: Are Large Language Models Good at Generating Complex Structured Tabular Data?
  80. TAIL: A Toolkit for Automatic and Realistic Long-Context Large Language Model Evaluation
  81. TaPERA: Enhancing Faithfulness and Interpretability in Long-Form Table QA by Content Planning and Execution-based Reasoning
  82. Unveiling the Spectrum of Data Contamination in Language Model: A Survey from Detection to Remediation