P
PaperPicks
Conferences
Jiaheng Liu
69 papers at tracked venues · 59 at CORE A* · active 2024–2026
DBLP profile ↗
ORCID search ↗
Venues
ACL
×32
NeurIPS
×9
AAAI
×5
ICLR
×5
ACM MM
×4
EMNLP
×4
EACL
×2
NAACL
×2
CIKM
×1
CVPR
×1
ECCV
×1
ICCV
×1
ICML
×1
WWW
×1
Frequent coauthors
Hui Huang
DBLP profile ↗
ORCID search ↗
×3
Siwei Wu
DBLP profile ↗
ORCID search ↗
×2
Xianjie Wu
DBLP profile ↗
ORCID search ↗
×2
Shilong Li
DBLP profile ↗
ORCID search ↗
×2
Yancheng He
DBLP profile ↗
ORCID search ↗
×2
Zekun Moore Wang
DBLP profile ↗
ORCID search ↗
×2
Linzheng Chai
DBLP profile ↗
ORCID search ↗
×2
Hongcheng Guo
DBLP profile ↗
ORCID search ↗
×2
Siyi Li
DBLP profile ↗
ORCID search ↗
×1
Zhongyuan Peng
DBLP profile ↗
ORCID search ↗
×1
Zhuoran Li
DBLP profile ↗
ORCID search ↗
×1
Daixin Shu
DBLP profile ↗
ORCID search ↗
×1
Papers
COIG-P: A High-Quality and Large-Scale Chinese Preference Dataset for Alignment with Human Values
EACL 2026
·
Siwei Wu
DBLP profile ↗
ORCID search ↗
CoTJudger: A Graph-Driven Framework for Automatic Evaluation of Chain-of-Thought Efficiency and Redundancy in LRMs
ACL 2026
·
Siyi Li
DBLP profile ↗
ORCID search ↗
CriticLean: Critic-Guided Reinforcement Learning for Mathematical Formalization
ACL 2026
·
Zhongyuan Peng
DBLP profile ↗
ORCID search ↗
Enhancing Multilingual Reasoning via Steerable Model Merging
ACL 2026
·
Zhuoran Li
DBLP profile ↗
ORCID search ↗
Long-form RewardBench: Evaluating Reward Models for Long-form Generation
AAAI 2026
·
Hui Huang
DBLP profile ↗
ORCID search ↗
M3TQA: Massively Multilingual Multitask Table Question Answering
ACL 2026
·
Daixin Shu
DBLP profile ↗
ORCID search ↗
MMRA: A Benchmark for Evaluating Multi-Granularity and Multi-Image Relational Association Capabilities in Large Visual Language Models
EACL 2026
·
Siwei Wu
DBLP profile ↗
ORCID search ↗
MMTableBench: A Multi-level Multimodal Benchmark for Reasoning and Layout Complexity in Table QA
WWW 2026
·
Xianjie Wu
DBLP profile ↗
ORCID search ↗
MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues
ACL 2026
·
Yaning Pan
DBLP profile ↗
ORCID search ↗
MdEval: Massively Multilingual Code Debugging
ACL 2026
·
Shukai Liu
DBLP profile ↗
ORCID search ↗
Multi-Docker-Eval: A 'Shovel of the Gold Rush' Benchmark on Automatic Environment Building for Software Engineering
ACL 2026
·
Kelin Fu
DBLP profile ↗
ORCID search ↗
ReLook: Vision-Grounded RL with a Multimodal LLM Critic for Agentic Web Coding
ACL 2026
·
Yuhang Li
DBLP profile ↗
ORCID search ↗
Table-R1: Region-based Reinforcement Learning for Table Understanding
ACL 2026
·
Zhenhe Wu
DBLP profile ↗
ORCID search ↗
Think-J: Learning to Think for Generative LLM-as-a-Judge
AAAI 2026
·
Hui Huang
DBLP profile ↗
ORCID search ↗
Thinking-Based Non-Thinking: Solving the Reward Hacking Problem in Training Hybrid Reasoning Models via Reinforcement Learning
ACL 2026
·
Siyuan Gan
DBLP profile ↗
ORCID search ↗
USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models
ACL 2026
·
Baolin Zheng
DBLP profile ↗
ORCID search ↗
When Agents Look the Same: Quantifying Distillation-Induced Similarity in Tool-Use Behaviors
ACL 2026
·
Chenghao Yang
DBLP profile ↗
ORCID search ↗
2D-DPO: Scaling Direct Preference Optimization with 2-Dimensional Supervision
NAACL 2025
·
Shilong Li
DBLP profile ↗
ORCID search ↗
AIR: Complex Instruction Generation via Automatic Iterative Refinement
EMNLP 2025
·
Wei Liu
DBLP profile ↗
ORCID search ↗
Can Large Language Models Detect Errors in Long Chain-of-Thought Reasoning?
ACL 2025
·
Yancheng He
DBLP profile ↗
ORCID search ↗
Can MLLMs Understand the Deep Implication Behind Chinese Images?
ACL 2025
·
Chenhao Zhang
DBLP profile ↗
ORCID search ↗
Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models
ACL 2025
·
Yingshui Tan
DBLP profile ↗
ORCID search ↗
Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language Models
ACL 2025
·
Yancheng He
DBLP profile ↗
ORCID search ↗
DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models
NAACL 2025
·
Jianyu Liu
DBLP profile ↗
ORCID search ↗
Flow-GRPO: Training Flow Matching Models via Online RL
NeurIPS 2025
·
Jie Liu
DBLP profile ↗
ORCID search ↗
KOR-Bench: Benchmarking Language Models on Knowledge-Orthogonal Reasoning Tasks
ICLR 2025
·
Kaijing Ma
DBLP profile ↗
ORCID search ↗
KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation
NeurIPS 2025
·
Jiajun Shi
DBLP profile ↗
ORCID search ↗
LIME: Less Is More for MLLM Evaluation
ACL 2025
·
King Zhu
DBLP profile ↗
ORCID search ↗
M2RC-EVAL: Massively Multilingual Repository-level Code Completion Evaluation
ACL 2025
·
Jiaheng Liu
MIO: A Foundation Model on Multimodal Tokens
EMNLP 2025
·
Zekun Moore Wang
DBLP profile ↗
ORCID search ↗
MTU-Bench: A Multi-granularity Tool-Use Benchmark for Large Language Models
ICLR 2025
·
Pei Wang
DBLP profile ↗
ORCID search ↗
MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs
NeurIPS 2025
·
Tianhao Peng
DBLP profile ↗
ORCID search ↗
Mavors: Multi-granularity Video Representation for Multimodal Large Language Model
ACM MM 2025
·
Yang Shi
DBLP profile ↗
ORCID search ↗
McEval: Massively Multilingual Code Evaluation
ICLR 2025
·
Linzheng Chai
DBLP profile ↗
ORCID search ↗
MuPT: A Generative Symbolic Music Pretrained Transformer
ICLR 2025
·
Xingwei Qu
DBLP profile ↗
ORCID search ↗
MuSC: Improving Complex Instruction Following with Multi-granularity Self-Contrastive Training
ACL 2025
·
Hui Huang
DBLP profile ↗
ORCID search ↗
OAgents: An Empirical Study of Building Effective Agents
EMNLP 2025
·
He Zhu
DBLP profile ↗
ORCID search ↗
OmniBench: Towards The Future of Universal Omni-Language Models
NeurIPS 2025
·
Yizhi Li
DBLP profile ↗
ORCID search ↗
OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models
ACL 2025
·
Siming Huang
DBLP profile ↗
ORCID search ↗
PopAlign: Diversifying Contrasting Patterns for a More Comprehensive Alignment
ACL 2025
·
Zekun Moore Wang
DBLP profile ↗
ORCID search ↗
ProgCo: Program Helps Self-Correction of Large Language Models
ACL 2025
·
Xiaoshuai Song
DBLP profile ↗
ORCID search ↗
Quantification of Large Language Model Distillation
ACL 2025
·
Sunbowen Lee
DBLP profile ↗
ORCID search ↗
See the World, Discover Knowledge: A Chinese Factuality Evaluation for Large Vision Language Models
ACL 2025
·
Jihao Gu
DBLP profile ↗
ORCID search ↗
SimpleVQA: Multimodal Factuality Evaluation for Multimodal Large Language Models
ICCV 2025
·
Xianfu Cheng
DBLP profile ↗
ORCID search ↗
TableBench: A Comprehensive and Complex Benchmark for Table Question Answering
AAAI 2025
·
Xianjie Wu
DBLP profile ↗
ORCID search ↗
Towards Visualization-of-Thought Jailbreak Attack against Large Visual Language Models
NeurIPS 2025
·
Hongqiong Zhong
DBLP profile ↗
ORCID search ↗
VidCapBench: A Comprehensive Benchmark of Video Captioning for Controllable Text-to-Video Generation
ACL 2025
·
Xinlong Chen
DBLP profile ↗
ORCID search ↗
XCOT: Cross-lingual Instruction Tuning for Cross-lingual Chain-of-Thought Reasoning
AAAI 2025
·
Linzheng Chai
DBLP profile ↗
ORCID search ↗
Compressing Large Language Models by Joint Sparsification and Quantization
ICML 2024
·
Jinyang Guo
DBLP profile ↗
ORCID search ↗
ConceptMath: A Bilingual Concept-wise Benchmark for Measuring Mathematical Reasoning of Large Language Models
ACL 2024
·
Yanan Wu
DBLP profile ↗
ORCID search ↗
D-CPT Law: Domain-specific Continual Pre-Training Scaling Law for Large Language Models
NeurIPS 2024
·
Haoran Que
DBLP profile ↗
ORCID search ↗
DDK: Distilling Domain Knowledge for Efficient Large Language Models
NeurIPS 2024
·
Jiaheng Liu
E2-LLM: Efficient and Extreme Length Extension of Large Language Models
ACL 2024
·
Jiaheng Liu
Emulated Disalignment: Safety Alignment for Large Language Models May Backfire!
ACL 2024
·
Zhanhui Zhou
DBLP profile ↗
ORCID search ↗
GraphReader: Building Graph-based Agent to Enhance Long-Context Abilities of Large Language Models
EMNLP 2024
·
Shilong Li
DBLP profile ↗
ORCID search ↗
II-Bench: An Image Implication Understanding Benchmark for Multimodal Large Language Models
NeurIPS 2024
·
Ziqiang Liu
DBLP profile ↗
ORCID search ↗
LTA-PCS: Learnable Task-Agnostic Point Cloud Sampling
CVPR 2024
·
Jiaheng Liu
LogFormer: A Pre-train and Tuning Pipeline for Log Anomaly Detection
AAAI 2024
·
Hongcheng Guo
DBLP profile ↗
ORCID search ↗
MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
ACL 2024
·
Ge Bai
DBLP profile ↗
ORCID search ↗
MaterialSeg3D: Segmenting Dense Materials from 2D Priors for 3D Assets
ACM MM 2024
·
Zeyu Li
DBLP profile ↗
ORCID search ↗
NC2D: Novel Class Discovery for Node Classification
CIKM 2024
·
Yue Hou
DBLP profile ↗
ORCID search ↗
OWL: A Large Language Model for IT Operations
ICLR 2024
·
Hongcheng Guo
DBLP profile ↗
ORCID search ↗
PTSBench: A Comprehensive Post-Training Sparsity Benchmark Towards Algorithms and Models
ACM MM 2024
·
Zining Wang
DBLP profile ↗
ORCID search ↗
RoleAgent: Building, Interacting, and Benchmarking High-quality Role-Playing Agents from Scripts
NeurIPS 2024
·
Jiaheng Liu
RoleLLM: Benchmarking, Eliciting, and Enhancing Role-Playing Abilities of Large Language Models
ACL 2024
·
Noah Wang
DBLP profile ↗
ORCID search ↗
Segment, Lift and Fit: Automatic 3D Shape Labeling from 2D Prompts
ECCV 2024
·
Jianhao Li
DBLP profile ↗
ORCID search ↗
Towards Real-world Scenario: Imbalanced New Intent Discovery
ACL 2024
·
Shun Zhang
DBLP profile ↗
ORCID search ↗
UniCoder: Scaling Code Large Language Model via Universal Code
ACL 2024
·
Tao Sun
DBLP profile ↗
ORCID search ↗
VRDistill: Vote Refinement Distillation for Efficient Indoor 3D Object Detection
ACM MM 2024
·
Ze Yuan
DBLP profile ↗
ORCID search ↗