PPaperPicks

Caiming Xiong

74 papers at tracked venues · 50 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Beyond 'Aha!': Toward Systematic Meta-Abilities Alignment in Large Reasoning Models
  2. From Passive Metric to Active Signal: The Evolving Role of Uncertainty Quantification in Large Language Models
  3. Hard2Verify: A Step-Level Verification Benchmark for Open-Ended Frontier Math
  4. J4R: Learning to Judge with Equivalent Initial State Group Relative Policy Optimization
  5. APIGen-MT: Agentic Pipeline for Multi-Turn Data Generation via Simulated Agent-Human Interplay
  6. ActionStudio: A Lightweight Framework for Data and Training of Large Action Models
  7. AgentTrek: Agent Trajectory Synthesis via Guiding Replay with Web Tutorials
  8. Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction
  9. Automatic Curriculum Expert Iteration for Reliable LLM Reasoning
  10. BLIP-3: A Family of Open Large Multimodal Models
  11. Benchmarking Deep Search over Heterogeneous Enterprise Data
  12. Beyond Accuracy: Dissecting Mathematical Reasoning for LLMs Under Reinforcement Learning
  13. BingoGuard: LLM Content Moderation Tools with Risk Levels
  14. CRMArena: Understanding the Capacity of LLM Agents to Perform Professional CRM Tasks in Realistic Environments
  15. CodeTree: Agent-guided Tree Search for Code Generation with Large Language Models
  16. Contra4: Evaluating Contrastive Cross-Modal Reasoning in Audio, Video, Image, and 3D
  17. Demystifying Domain-adaptive Post-training for Financial LLMs
  18. Direct Judgement Preference Optimization
  19. Diversity Empowers Intelligence: Integrating Expertise of Software Engineering Agents
  20. Do RAG Systems Cover What Matters? Evaluating and Optimizing Responses with Sub-Question Coverage
  21. DyMU: Dynamic Merging and Virtual Unmerging for Efficient Variable-Length VLMs
  22. Evaluating Judges as Evaluators: The JETTS Benchmark of LLM-as-Judges as Test-Time Scaling Evaluators
  23. FaithEval: Can Your Language Model Stay Faithful to Context, Even If "The Moon is Made of Marshmallows"
  24. GReaTer: Gradients Over Reasoning Makes Smaller Language Models Strong Prompt Optimizers
    ICLR 2025 ·
    Sarkar Snigdha Sarathi Das
  25. Generative Frame Sampler for Long Video Understanding
  26. LAM SIMULATOR: Advancing Data Generation for Large Action Model Training via Online Exploration and Trajectory Feedback
  27. LATTE: Learning to Think with Vision Specialists
  28. MCPEval: Automatic MCP-based Deep Evaluation for AI Agent Models
  29. Moirai-MoE: Empowering Time Series Foundation Models with Sparse Mixture of Experts
  30. PersonaBench: Evaluating AI Models on Understanding Personal Information through Accessing (Synthetic) Private User Data
  31. ReGenesis: LLMs can Grow into Reasoning Generalists via Self-Improvement
  32. Reward-Guided Speculative Decoding for Efficient LLM Reasoning
  33. Scaling Computer-Use Grounding via User Interface Decomposition and Synthesis
  34. SiReRAG: Indexing Similar and Related Information for Multihop Reasoning
  35. SlackAgents: Scalable Collaboration of AI Agents in Workspaces
  36. Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows
  37. Strefer: Empowering Video LLMs with Space-Time Referring and Reasoning via Synthetic Instruction Data
  38. Text2Data: Low-Resource Data Generation with Textual Control
  39. ThinK: Thinner Key Cache by Query-Driven Pruning
  40. Trust but Verify: Programmatic VLM Evaluation in the Wild
  41. Turning Conversations into Workflows: A Framework to Extract and Evaluate Dialog Workflows for Service AI Agents
  42. Unanswerability Evaluation for Retrieval Augmented Generation
  43. ViUniT: Visual Unit Tests for More Robust Visual Programming
  44. Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding
  45. xLAM: A Family of Large Action Models to Empower AI Agent Systems
  46. APIGen: Automated PIpeline for Generating Verifiable and Diverse Function-Calling Datasets
  47. ARM: Alignment with Residual Energy-Based Model
  48. Beyond the Chat: Executable and Verifiable Text-Editing with LLMs
  49. Consent in Crisis: The Rapid Decline of the AI Data Commons
  50. Diffusion Model Alignment Using Direct Preference Optimization
  51. Embrace Divergence for Richer Insights: A Multi-document Summarization Benchmark and a Case Study on Summarizing Diverse Information from News Articles
  52. FOFO: A Benchmark to Evaluate LLMs' Format-Following Capability
  53. FOLIO: Natural Language Reasoning with First-Order Logic
  54. Fair Abstractive Summarization of Diverse Perspectives
  55. HIVE: Harnessing Human Feedback for Instructional Visual Editing
  56. Hierarchical Point Attention for Indoor 3D Object Detection
  57. How Do Transformers Learn In-Context Beyond Simple Functions? A Case Study on Learning with Representations
  58. INDICT: Code Generation with Internal Dialogues of Critiques for Both Security and Helpfulness
  59. LayoutDETR: Detection Transformer Is a Good Multimodal Layout Designer
  60. Lemur: Harmonizing Natural Language and Code for Language Agents
  61. MINT-1T: Scaling Open-Source Multimodal Data by 10x: A Multimodal Dataset with One Trillion Tokens
  62. OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
  63. P-FOLIO: Evaluating and Improving Logical Reasoning with Abundant Human-Written Reasoning Chains
  64. Position: TrustLLM: Trustworthiness in Large Language Models
  65. Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization
  66. Sample-Efficient Learning of POMDPs with Multiple Observations In Hindsight
  67. Spider2-V: How Far Are Multimodal Agents From Automating Data Science and Engineering Workflows?
  68. Summary of a Haystack: A Challenge to Long-Context LLMs and RAG Systems
  69. ULIP-2: Towards Scalable Multimodal Pre-Training for 3D Understanding
  70. Unified Training of Universal Time Series Forecasting Transformers
  71. Unlocking Anticipatory Text Generation: A Constrained Approach for Large Language Models Decoding
  72. What Are We Measuring When We Evaluate Large Vision-Language Models? An Analysis of Latent Factors and Biases
  73. X-InstructBLIP: A Framework for Aligning Image, 3D, Audio, Video to LLMs and its Emergent Cross-Modal Reasoning
  74. xGen-VideoSyn-1: High-Fidelity Text-to-Video Synthesis with Compressed Representations