PPaperPicks

Qi Zhang

Fudan University, School of Computer Science, Shanghai Key Laboratory of Data Science, China

83 papers at tracked venues · 57 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments
  2. AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
  3. AgentV-RL: Scaling Reward Modeling with Agentic Verifier
  4. Beyond Scaling: Measuring and Predicting the Upper Bound of Knowledge Retention in Language Model Pre-Training
  5. Counteracting the Matthew Effect in Self-Improvement of LVLMs through Head-Tail Re-balancing
  6. DARM: Distribution-Aware Reward Modeling by Alleviating Biases from Low Preference-Context Dependency Data
  7. Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization
  8. Feedback-Driven Tool-Use Improvements in Large Language Models via Automated Build Environments
  9. FinToolSyn: A forward synthesis Framework for Financial Tool-Use Dialogue Data with Dynamic Tool Retrieval
  10. From Scores to Preferences: Redefining Evaluation Paradigm for Speech Quality Reward Modeling
  11. LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models
  12. Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models
  13. MM-Doc-R1: Training Agents for Long Document Visual Question Answering through Multi-turn Reinforcement Learning
  14. MetaAct-RL: Training Language Models for Reasoning Through Meta-Action-Based Reinforcement Learning
  15. MulDimIF: A Multi-Dimensional Constraint Framework for Evaluating and Improving Instruction Following in Large Language Models
  16. Muse: Towards Reproducible Long-Form Song Generation with Fine-Grained Style Control
  17. OctoBench: Benchmarking Scaffold-Aware Instruction Following in Repository-Grounded Agentic Coding
  18. Outcome Accuracy is Not Enough: Aligning the Reasoning Process of Reward Models
  19. RLSeek: Evidence-Grounded Reasoning for RAG Hallucination Detection
  20. Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination
  21. Time-Frequency Token Advantage Clipping for Training Efficient Large Reasoning Model
  22. Unveiling the Deficiencies of Pre-trained Text-and-Layout Models in Real-world Visually-rich Document Information Extraction
  23. VRPO: Rethinking Value Modeling for Robust RL under Noisy Supervision in LLM Post-Training
  24. Which Reasoning Trajectories Teach Students to Reason Better? A Simple Metric of Informative Alignment
  25. AgentGym: Evaluating and Training Large Language Model-based Agents across Diverse Environments
  26. Alleviating Shifted Distribution in Human Preference Alignment through Meta-Learning
  27. Analyzing the Effects of Supervised Fine-Tuning on Model Knowledge from Token and Parameter Levels
  28. BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset
  29. Better Process Supervision with Bi-directional Rewarding Signals
  30. Capability Salience Vector: Fine-grained Alignment of Loss and Capabilities for Downstream Task Scaling Law
  31. Distill Visual Chart Reasoning Ability from LLMs to MLLMs
  32. DocFusion: A Unified Framework for Document Parsing Tasks
  33. EvaLearn: Quantifying the Learning Capability and Efficiency of LLMs via Sequential Problem Solving
  34. EvoWiki: Evaluating LLMs on Evolving Knowledge
  35. Governance in Motion: Co-evolution of Constitutions and AI models for Scalable Safety
  36. Have the VLMs Lost Confidence? A Study of Sycophancy in VLMs
  37. LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation
  38. LoRACoE: Improving Large Language Model via Composition-based LoRA Expert
  39. Lost in the Context: Insufficient and Distracted Attention to Contexts in Preference Modeling
  40. Measuring Data Diversity for Instruction Tuning: A Systematic Analysis and A Reliable Metric
  41. Mitigating Object Hallucinations in MLLMs via Multi-Frequency Perturbations
  42. Mitigating Tail Narrowing in LLM Self-Improvement via Socratic-Guided Sampling
  43. Multi-Programming Language Sandbox for LLMs
  44. PFDial: A Structured Dialogue Instruction Fine-tuning Method Based on UML Flowcharts
  45. Parrot: A Training Pipeline Enhances Both Program CoT and Natural Language CoT for Reasoning
  46. Pre-Trained Policy Discriminators are General Reward Models
  47. RMB: Comprehensively benchmarking reward models in LLM alignment
  48. TASO: Task-Aligned Sparse Optimization for Parameter-Efficient Model Adaptation
  49. TL-Training: A Task-Feature-Based Framework for Training Large Language Models in Tool Use
  50. ToolHop: A Query-Driven Benchmark for Evaluating Large Language Models in Multi-Hop Tool Use
  51. Toward Optimal LLM Alignments Using Two-Player Games
  52. Towards Economical Inference: Enabling DeepSeek's Multi-Head Latent Attention in Any Transformer-based LLMs
  53. Understanding Parametric and Contextual Knowledge Reconciliation within Large Language Models
  54. A Low-Texture Robust Hybrid Feature Based Visual Odometry
  55. Enhancing Contrastive Learning with Noise-Guided Attack: Towards Continual Relation Extraction in the Wild
  56. Enhancing News Recommendation with Real-Time Feedback and Generative Sequence Modeling
    RecSys 2024 · Qi Zhang
  57. Exploring the Compositional Deficiency of Large Language Models in Mathematical Reasoning Through Trap Problems
  58. Improving Discriminative Capability of Reward Models in RLHF Using Contrastive Learning
  59. Improving Generalization of Alignment with Human Preferences through Group Invariant Learning
  60. Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data
  61. LLMEval: A Preliminary Study on How to Evaluate Large Language Models
  62. LONGAGENT: Achieving Question Answering for 128k-Token-Long Documents through Multi-Agent Collaboration
  63. Length Generalization of Causal Transformers without Position Encoding
  64. Linear Alignment: A Closed-form Solution for Aligning Human Preferences without Tuning and Feedback
  65. LoRAMoE: Alleviating World Knowledge Forgetting in Large Language Models via MoE-Style Plugin
  66. LongHeads: Multi-Head Attention is Secretly a Long Context Processor
  67. Making Harmful Behaviors Unlearnable for Large Language Models
  68. Modeling Layout Reading Order as Ordering Relations for Visually-rich Document Understanding
  69. Navigating the OverKill in Large Language Models
  70. P4: Plug-and-Play Discrete Prompting for Large Language Models Personalization
  71. PDF-to-Tree: Parsing PDF Text Blocks into a Tree
  72. Rescue: Ranking LLM Responses with Partial Ordering to Improve Response Generation
  73. Reward Modeling Requires Automatic Adjustment Based on Data Quality
  74. RoTBench: A Multi-Level Benchmark for Evaluating the Robustness of Large Language Models in Tool Learning
  75. Self-Demos: Eliciting Out-of-Demonstration Generalizability in Large Language Models
  76. StepCoder: Improving Code Generation with Reinforcement Learning from Compiler Feedback
  77. ToolSword: Unveiling Safety Issues of Large Language Models in Tool Learning Across Three Stages
  78. Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
  79. TransferTOD: A Generalizable Chinese Multi-Domain Task-Oriented Dialogue System with Transfer Capabilities
  80. UNER: A Unified Prediction Head for Named Entity Recognition in Visually-rich Documents
  81. Uncertainty Aware Learning for Language Model Alignment
  82. Unveiling Linguistic Regions in Large Language Models
  83. Unveiling and Consulting Core Experts in Retrieval-Augmented MoE-based LLMs