PPaperPicks

Jiaheng Liu

69 papers at tracked venues · 59 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. COIG-P: A High-Quality and Large-Scale Chinese Preference Dataset for Alignment with Human Values
  2. CoTJudger: A Graph-Driven Framework for Automatic Evaluation of Chain-of-Thought Efficiency and Redundancy in LRMs
  3. CriticLean: Critic-Guided Reinforcement Learning for Mathematical Formalization
  4. Enhancing Multilingual Reasoning via Steerable Model Merging
  5. Long-form RewardBench: Evaluating Reward Models for Long-form Generation
  6. M3TQA: Massively Multilingual Multitask Table Question Answering
  7. MMRA: A Benchmark for Evaluating Multi-Granularity and Multi-Image Relational Association Capabilities in Large Visual Language Models
  8. MMTableBench: A Multi-level Multimodal Benchmark for Reasoning and Layout Complexity in Table QA
  9. MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues
  10. MdEval: Massively Multilingual Code Debugging
  11. Multi-Docker-Eval: A 'Shovel of the Gold Rush' Benchmark on Automatic Environment Building for Software Engineering
  12. ReLook: Vision-Grounded RL with a Multimodal LLM Critic for Agentic Web Coding
  13. Table-R1: Region-based Reinforcement Learning for Table Understanding
  14. Think-J: Learning to Think for Generative LLM-as-a-Judge
  15. Thinking-Based Non-Thinking: Solving the Reward Hacking Problem in Training Hybrid Reasoning Models via Reinforcement Learning
  16. USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models
  17. When Agents Look the Same: Quantifying Distillation-Induced Similarity in Tool-Use Behaviors
  18. 2D-DPO: Scaling Direct Preference Optimization with 2-Dimensional Supervision
  19. AIR: Complex Instruction Generation via Automatic Iterative Refinement
  20. Can Large Language Models Detect Errors in Long Chain-of-Thought Reasoning?
  21. Can MLLMs Understand the Deep Implication Behind Chinese Images?
  22. Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models
  23. Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language Models
  24. DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models
  25. Flow-GRPO: Training Flow Matching Models via Online RL
  26. KOR-Bench: Benchmarking Language Models on Knowledge-Orthogonal Reasoning Tasks
  27. KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation
  28. LIME: Less Is More for MLLM Evaluation
  29. M2RC-EVAL: Massively Multilingual Repository-level Code Completion Evaluation
    ACL 2025 · Jiaheng Liu
  30. MIO: A Foundation Model on Multimodal Tokens
  31. MTU-Bench: A Multi-granularity Tool-Use Benchmark for Large Language Models
  32. MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs
  33. Mavors: Multi-granularity Video Representation for Multimodal Large Language Model
  34. McEval: Massively Multilingual Code Evaluation
  35. MuPT: A Generative Symbolic Music Pretrained Transformer
  36. MuSC: Improving Complex Instruction Following with Multi-granularity Self-Contrastive Training
  37. OAgents: An Empirical Study of Building Effective Agents
  38. OmniBench: Towards The Future of Universal Omni-Language Models
  39. OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models
  40. PopAlign: Diversifying Contrasting Patterns for a More Comprehensive Alignment
  41. ProgCo: Program Helps Self-Correction of Large Language Models
  42. Quantification of Large Language Model Distillation
  43. See the World, Discover Knowledge: A Chinese Factuality Evaluation for Large Vision Language Models
  44. SimpleVQA: Multimodal Factuality Evaluation for Multimodal Large Language Models
  45. TableBench: A Comprehensive and Complex Benchmark for Table Question Answering
  46. Towards Visualization-of-Thought Jailbreak Attack against Large Visual Language Models
  47. VidCapBench: A Comprehensive Benchmark of Video Captioning for Controllable Text-to-Video Generation
  48. XCOT: Cross-lingual Instruction Tuning for Cross-lingual Chain-of-Thought Reasoning
  49. Compressing Large Language Models by Joint Sparsification and Quantization
  50. ConceptMath: A Bilingual Concept-wise Benchmark for Measuring Mathematical Reasoning of Large Language Models
  51. D-CPT Law: Domain-specific Continual Pre-Training Scaling Law for Large Language Models
  52. DDK: Distilling Domain Knowledge for Efficient Large Language Models
    NeurIPS 2024 · Jiaheng Liu
  53. E2-LLM: Efficient and Extreme Length Extension of Large Language Models
    ACL 2024 · Jiaheng Liu
  54. Emulated Disalignment: Safety Alignment for Large Language Models May Backfire!
  55. GraphReader: Building Graph-based Agent to Enhance Long-Context Abilities of Large Language Models
  56. II-Bench: An Image Implication Understanding Benchmark for Multimodal Large Language Models
  57. LTA-PCS: Learnable Task-Agnostic Point Cloud Sampling
    CVPR 2024 · Jiaheng Liu
  58. LogFormer: A Pre-train and Tuning Pipeline for Log Anomaly Detection
  59. MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
  60. MaterialSeg3D: Segmenting Dense Materials from 2D Priors for 3D Assets
  61. NC2D: Novel Class Discovery for Node Classification
  62. OWL: A Large Language Model for IT Operations
  63. PTSBench: A Comprehensive Post-Training Sparsity Benchmark Towards Algorithms and Models
  64. RoleAgent: Building, Interacting, and Benchmarking High-quality Role-Playing Agents from Scripts
    NeurIPS 2024 · Jiaheng Liu
  65. RoleLLM: Benchmarking, Eliciting, and Enhancing Role-Playing Abilities of Large Language Models
  66. Segment, Lift and Fit: Automatic 3D Shape Labeling from 2D Prompts
  67. Towards Real-world Scenario: Imbalanced New Intent Discovery
  68. UniCoder: Scaling Code Large Language Model via Universal Code
  69. VRDistill: Vote Refinement Distillation for Efficient Indoor 3D Object Detection