PPaperPicks

Xuanjing Huang

Fudan University, School of Computer Science, Shanghai Key Laboratory of Intelligent Information Processing, Shanghai, China

121 papers at tracked venues · 81 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. ARISE: An Adaptive Resolution-Aware Metric for Test-Time Scaling Evaluation in Large Reasoning Models
  2. AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments
  3. AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
  4. AgentV-RL: Scaling Reward Modeling with Agentic Verifier
  5. Beyond Scaling: Measuring and Predicting the Upper Bound of Knowledge Retention in Language Model Pre-Training
  6. Counteracting the Matthew Effect in Self-Improvement of LVLMs through Head-Tail Re-balancing
  7. DARM: Distribution-Aware Reward Modeling by Alleviating Biases from Low Preference-Context Dependency Data
  8. Explainable Synthetic Image Detection Through Diffusion Timestep Ensembling
  9. Feedback-Driven Tool-Use Improvements in Large Language Models via Automated Build Environments
  10. FinToolSyn: A forward synthesis Framework for Financial Tool-Use Dialogue Data with Dynamic Tool Retrieval
  11. From Scores to Preferences: Redefining Evaluation Paradigm for Speech Quality Reward Modeling
  12. LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models
  13. LLMs Deceive Unintentionally: Emergent Misalignment in Dishonesty from Misaligned Samples to Biased Human-AI Interactions
  14. LifeSim: Long-Horizon User Life Simulator for Personalized Assistant Evaluation
  15. Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models
  16. MM-Doc-R1: Training Agents for Long Document Visual Question Answering through Multi-turn Reinforcement Learning
  17. MetaAct-RL: Training Language Models for Reasoning Through Meta-Action-Based Reinforcement Learning
  18. Mitigating Hallucinations in VLMs: Enhancing Visual Attention via Head-Wise Perturbation
  19. Mitigating Position Bias in Transformers via Layer-Specific Positional Embedding Scaling
  20. MulDimIF: A Multi-Dimensional Constraint Framework for Evaluating and Improving Instruction Following in Large Language Models
  21. Muse: Towards Reproducible Long-Form Song Generation with Fine-Grained Style Control
  22. OctoBench: Benchmarking Scaffold-Aware Instruction Following in Repository-Grounded Agentic Coding
  23. Outcome Accuracy is Not Enough: Aligning the Reasoning Process of Reward Models
  24. VIB-Probe: Detecting and Mitigating Hallucinations in Vision-Language Models via Variational Information Bottleneck
  25. VRPO: Rethinking Value Modeling for Robust RL under Noisy Supervision in LLM Post-Training
  26. Which Reasoning Trajectories Teach Students to Reason Better? A Simple Metric of Informative Alignment
  27. Activating Distributed Visual Region within LLMs for Efficient and Effective Vision-Language Training and Inference
  28. AgentGym: Evaluating and Training Large Language Model-based Agents across Diverse Environments
  29. AgentSense: Benchmarking Social Intelligence of Language Agents through Interactive Scenarios
  30. Alleviating Shifted Distribution in Human Preference Alignment through Meta-Learning
  31. Analyzing the Effects of Supervised Fine-Tuning on Model Knowledge from Token and Parameter Levels
  32. BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset
  33. Better Process Supervision with Bi-directional Rewarding Signals
  34. COSEE: Consistency-Oriented Signal-Based Early Exiting via Calibrated Sample Weighting Mechanism
  35. Dendritic Localized Learning: Toward Biologically Plausible Algorithm
  36. Distill Visual Chart Reasoning Ability from LLMs to MLLMs
  37. Domain-RAG: Retrieval-Guided Compositional Image Generation for Cross-Domain Few-Shot Object Detection
  38. Dynamic and Generalizable Process Reward Modeling
  39. EcoLANG: Efficient and Effective Agent Communication Language Induction for Social Simulation
  40. Enhancing Model Privacy in Federated Learning with Random Masking and Quantization
  41. Error Classification of Large Language Models on Math Word Problems: A Dynamically Adaptive Framework
  42. EvaLearn: Quantifying the Learning Capability and Efficiency of LLMs via Sequential Problem Solving
  43. EvoWiki: Evaluating LLMs on Evolving Knowledge
  44. Governance in Motion: Co-evolution of Constitutions and AI models for Scalable Safety
  45. HAF-RM: A Hybrid Alignment Framework for Reward Model Training
  46. Have the VLMs Lost Confidence? A Study of Sycophancy in VLMs
  47. Improving Continual Pre-training Through Seamless Data Packing
  48. LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation
  49. LoRACoE: Improving Large Language Model via Composition-based LoRA Expert
  50. Lost in the Context: Insufficient and Distracted Attention to Contexts in Preference Modeling
  51. Measuring Data Diversity for Instruction Tuning: A Systematic Analysis and A Reliable Metric
  52. Mitigating Object Hallucinations in MLLMs via Multi-Frequency Perturbations
  53. Mitigating Tail Narrowing in LLM Self-Improvement via Socratic-Guided Sampling
  54. Multi-Agent Simulator Drives Language Models for Legal Intensive Interaction
  55. Multi-Programming Language Sandbox for LLMs
  56. ObjectRelator: Enabling Cross-View Object Relation Understanding Across Ego-Centric and Exo-Centric Perspectives
  57. PFDial: A Structured Dialogue Instruction Fine-tuning Method Based on UML Flowcharts
  58. Parrot: A Training Pipeline Enhances Both Program CoT and Natural Language CoT for Reasoning
  59. Pre-Trained Policy Discriminators are General Reward Models
  60. Prior-Fitted Networks Scale to Larger Datasets When Treated as Weak Learners
  61. RIVAL: Reinforcement Learning with Iterative and Adversarial Optimization for Machine Translation
  62. RMB: Comprehensively benchmarking reward models in LLM alignment
  63. SATER: A Self-Aware and Token-Efficient Approach to Routing and Cascading
  64. SFMSS: Service Flow aware Medical Scenario Simulation for Conversational Data Generation
  65. SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Models
  66. Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Models
  67. Synergistic Multi-Agent Framework with Trajectory Learning for Knowledge-Intensive Tasks
  68. TL-Training: A Task-Feature-Based Framework for Training Large Language Models in Tool Use
  69. Tell Me What You Don't Know: Enhancing Refusal Capabilities of Role-Playing Agents via Representation Space Analysis and Editing
  70. ToolHop: A Query-Driven Benchmark for Evaluating Large Language Models in Multi-Hop Tool Use
  71. Toward Optimal LLM Alignments Using Two-Player Games
  72. Toward Relative Positional Encoding in Spiking Transformers
  73. TripTailor: A Real-World Benchmark for Personalized Travel Planning
  74. UPLex: Fine-Grained Personality Control in Large Language Models via Unsupervised Lexical Modulation
  75. Understanding Parametric and Contextual Knowledge Reconciliation within Large Language Models
  76. VLSBench: Unveiling Visual Leakage in Multimodal Safety
  77. VehicleWorld: A Highly Integrated Multi-Device Environment for Intelligent Vehicle Interaction
  78. VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models
  79. ALaRM: Align Language Models via Hierarchical Rewards Modeling
  80. Advancing Parameter Efficiency in Fine-tuning via Representation Editing
  81. Advancing Spiking Neural Networks for Sequential Modeling with Central Pattern Generators
  82. Aligning Large Language Models with Human Preferences through Representation Engineering
  83. Automating Dataset Updates Towards Reliable and Timely Evaluation of Large Language Models
  84. Debatrix: Multi-dimensional Debate Judge with Iterative Chronological Analysis Based on LLM
  85. Efficient and Effective Time-Series Forecasting with Spiking Neural Networks
  86. EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models
  87. Enhancing Contrastive Learning with Noise-Guided Attack: Towards Continual Relation Extraction in the Wild
  88. Explicit Memory Learning with Expectation Maximization
  89. Exploring the Compositional Deficiency of Large Language Models in Mathematical Reasoning Through Trap Problems
  90. F-Eval: Asssessing Fundamental Abilities with Refined Evaluation Methods
  91. Improving Discriminative Capability of Reward Models in RLHF Using Contrastive Learning
  92. Improving Generalization of Alignment with Human Preferences through Group Invariant Learning
  93. Infer Induced Sentiment of Comment Response to Video: A New Task, Dataset and Baseline
  94. Inference-Time Decontamination: Reusing Leaked Benchmarks for Large Language Model Evaluation
  95. Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data
  96. LLM can Achieve Self-Regulation via Hyperparameter Aware Generation
  97. LLMEval: A Preliminary Study on How to Evaluate Large Language Models
  98. LLMs-as-Instructors: Learning from Errors Toward Automating Model Improvement
  99. LONGAGENT: Achieving Question Answering for 128k-Token-Long Documents through Multi-Agent Collaboration
  100. Length Generalization of Causal Transformers without Position Encoding
  101. LoRAMoE: Alleviating World Knowledge Forgetting in Large Language Models via MoE-Style Plugin
  102. LongHeads: Multi-Head Attention is Secretly a Long Context Processor
  103. Making Harmful Behaviors Unlearnable for Large Language Models
  104. Navigating the OverKill in Large Language Models
  105. PDF-to-Tree: Parsing PDF Text Blocks into a Tree
  106. Promoting Data and Model Privacy in Federated Learning through Quantized LoRA
  107. ReForm-Eval: Evaluating Large Vision Language Models via Unified Re-Formulation of Task-Oriented Benchmarks
  108. Reasoning in Flux: Enhancing Large Language Models Reasoning through Uncertainty-aware Adaptive Guidance
  109. Reward Modeling Requires Automatic Adjustment Based on Data Quality
  110. RoTBench: A Multi-Level Benchmark for Evaluating the Robustness of Large Language Models in Tool Learning
  111. Scaling Laws for Fact Memorization of Large Language Models
  112. Searching for Best Practices in Retrieval-Augmented Generation
  113. Self-Demos: Eliciting Out-of-Demonstration Generalizability in Large Language Models
  114. SoMeLVLM: A Large Vision Language Model for Social Media Processing
  115. StepCoder: Improving Code Generation with Reinforcement Learning from Compiler Feedback
  116. ToolSword: Unveiling Safety Issues of Large Language Models in Tool Learning Across Three Stages
  117. Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
  118. TransferTOD: A Generalizable Chinese Multi-Domain Task-Oriented Dialogue System with Transfer Capabilities
  119. Unveiling Linguistic Regions in Large Language Models
  120. Unveiling and Consulting Core Experts in Retrieval-Augmented MoE-based LLMs
  121. Unveiling the Truth and Facilitating Change: Towards Agent-based Large-scale Social Movement Simulation