PPaperPicks

Lifeng Shang

36 papers at tracked venues · 29 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Discover and Prove: An Open-source Agentic Framework for Hard Mode Automated Theorem Proving in Lean 4
  2. EssayBench: Evaluating Large Language Models in Multi-Genre Chinese Essay Writing
  3. How Should We Enhance the Safety of Large Reasoning Models: An Empirical Study
  4. Improved Policy Optimization for Mixture-of-Experts Models: Importance Sampling and Rewarding from an Expert-Centric Perspective
  5. MATCH: Modulating Attention via In-Context Retrieval for Long-Context Transformers
  6. Process Evaluation for Agentic Systems
  7. Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning
  8. ToolACE-R: Model-aware Iterative Training and Adaptive Refinement for Tool learning
  9. Bridging and Modeling Correlations in Pairwise Data for Direct Preference Optimization
  10. Chain-of-Probe: Examining the Necessity and Accuracy of CoT Step-by-Step
  11. Crowd Comparative Reasoning: Unlocking Comprehensive Evaluations for LLM-as-a-Judge
  12. DeepDiver: Adaptive Web-Search Intensity Scaling via Reinforcement Learning
  13. Flat-LoRA: Low-Rank Adaptation over a Flat Loss Landscape
  14. Instruction-Tuning Data Synthesis from Scratch via Web Reconstruction
  15. Learning to Align Multi-Faceted Evaluation: A Unified and Robust Framework
  16. More Tokens, Lower Precision: Towards the Optimal Token-Precision Trade-off in KV Cache Compression
  17. QFFT, Question-Free Fine-Tuning for Adaptive Reasoning
  18. RevisEval: Improving LLM-as-a-Judge via Response-Adapted References
  19. RidgeLoRA: Matrix Ridge Enhanced Low-Rank Adaptation of Large Language Models
  20. Safe: Enhancing Mathematical Reasoning in Large Language Models via Retrospective Step-aware Formal Verification
  21. Self-Error-Instruct: Generalizing from Errors for LLMs Mathematical Reasoning
  22. Stepwise Reasoning Checkpoint Analysis: A Test Time Scaling Method to Enhance LLMs' Reasoning
  23. Subtle Errors in Reasoning: Preference Learning via Error-injected Self-editing
  24. ToolACE: Winning the Points of LLM Function Calling
  25. ToolFlow: Boosting LLM Tool-Calling Through Natural and Coherent Dialogue Synthesis
  26. FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language Models
  27. Gaining Wisdom from Setbacks: Aligning Large Language Models via Mistake Analysis
  28. Learning to Edit: Aligning LLMs with Knowledge Editing
  29. M4LE: A Multi-Ability Multi-Range Multi-Task Multi-Domain Long-Context Evaluation Benchmark for Large Language Models
  30. MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language Models
  31. Planning, Creation, Usage: Benchmarking LLMs for Comprehensive Tool Utilization in Real-World Complex Scenarios
  32. Preparing Lessons for Progressive Training on Language Models
  33. Prompt-Based Length Controlled Generation with Multiple Control Types
  34. ProxyQA: An Alternative Framework for Evaluating Long-Form Text Generation with Large Language Models
  35. Retrieval-based Disentangled Representation Learning with Natural Language Supervision
  36. Visually Guided Generative Text-Layout Pre-training for Document Intelligence