P
PaperPicks
Conferences
Xunliang Cai
63 papers at tracked venues · 48 at CORE A* · active 2024–2026
DBLP profile ↗
ORCID search ↗
Venues
ACL
×35
EMNLP
×13
AAAI
×6
NeurIPS
×4
ICLR
×2
NAACL
×2
ACM MM
×1
Frequent coauthors
Xuemiao Zhang
DBLP profile ↗
ORCID search ↗
×4
Xiaoyun Zhang
DBLP profile ↗
ORCID search ↗
×2
Peng Ding
DBLP profile ↗
ORCID search ↗
×2
Yejie Wang
DBLP profile ↗
ORCID search ↗
×2
Zhuocheng Gong
DBLP profile ↗
ORCID search ↗
×2
Wentao Shi
DBLP profile ↗
ORCID search ↗
×1
Junlin Liu
DBLP profile ↗
ORCID search ↗
×1
Yingxuan Yang
DBLP profile ↗
ORCID search ↗
×1
Shiyu Liu
DBLP profile ↗
ORCID search ↗
×1
Lingyue Fu
DBLP profile ↗
ORCID search ↗
×1
Xin Guo
DBLP profile ↗
ORCID search ↗
×1
Jiaming Zhou
DBLP profile ↗
ORCID search ↗
×1
Papers
AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation
ACL 2026
·
Wentao Shi
DBLP profile ↗
ORCID search ↗
AMO-Bench: Large Language Models Still Struggle in High School Math Competitions
ACL 2026
·
Junlin Liu
DBLP profile ↗
ORCID search ↗
Attribution-Based Analysis and Optimization of Modular Agentic Workflows
ACL 2026
·
Yingxuan Yang
DBLP profile ↗
ORCID search ↗
BAPO: Boundary-Aware Policy Optimization for Reliable Agentic Search
ACL 2026
·
Shiyu Liu
DBLP profile ↗
ORCID search ↗
CoreCodeBench: Decoupling Code Intelligence via Fine-Grained Repository-Level Tasks
ACL 2026
·
Lingyue Fu
DBLP profile ↗
ORCID search ↗
Counteracting the Matthew Effect in Self-Improvement of LVLMs through Head-Tail Re-balancing
ACL 2026
·
Xin Guo
DBLP profile ↗
ORCID search ↗
DIFFA-2: A Practical Diffusion Large Language Model for General Audio Understanding
ACL 2026
·
Jiaming Zhou
DBLP profile ↗
ORCID search ↗
Harmonizing Dense and Sparse Signals in Multi-turn RL: Dual-Horizon Credit Assignment for Industrial Sales Agents
ACL 2026
·
Haojin Yang
DBLP profile ↗
ORCID search ↗
How to Allocate, How to Learn? Dynamic Rollout Allocation and Advantage Modulation for Policy Optimization
ACL 2026
·
Yangyi Fang
DBLP profile ↗
ORCID search ↗
LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance
ACL 2026
·
Yuchun Fan
DBLP profile ↗
ORCID search ↗
Large-Scale Diverse Synthesis for Mid-Training
ACL 2026
·
Xuemiao Zhang
DBLP profile ↗
ORCID search ↗
LinkQA: Synthesizing Diverse QA from Multiple Seeds Strongly Linked by Knowledge Points
ACL 2026
·
Xuemiao Zhang
DBLP profile ↗
ORCID search ↗
MASPO: Unifying Gradient Utilization, Probability Mass, and Signal Reliability for Robust and Sample-Efficient LLM Reasoning
ACL 2026
·
Xiaoliang Fu
DBLP profile ↗
ORCID search ↗
MTR-Suite: A Framework for Evaluating and Synthesizing Conversational Retrieval Benchmarks
ACL 2026
·
Junhao Ruan
DBLP profile ↗
ORCID search ↗
Optimizing Native Sparse Attention with Latent Attention and Local Global Alternating Strategies
ACL 2026
·
Yuxuan Hu
DBLP profile ↗
ORCID search ↗
PaTaRM: Bridging Pairwise and Pointwise Signals via Preference-Aware Task-Adaptive Reward Modeling
ACL 2026
·
Ai Jian
DBLP profile ↗
ORCID search ↗
Rethinking the Sampling Criteria in Reinforcement Learning for LLM Reasoning: A Competence-Difficulty Alignment Perspective
AAAI 2026
·
Deyang Kong
DBLP profile ↗
ORCID search ↗
Scaling and Transferability of Annealing Strategies in Large Language Model Training
AAAI 2026
·
Siqi Wang
DBLP profile ↗
ORCID search ↗
Turning Failures into Value: Negative Experience Replay for RLVR via Confidence Gating and Boundary Failure Sampling
ACL 2026
·
Jialiang Guo
DBLP profile ↗
ORCID search ↗
Unlocking Implicit Experience: Synthesizing Tool-Use Trajectories from Text
ACL 2026
·
Zhihao Xu
DBLP profile ↗
ORCID search ↗
VANE: Guiding High-Value Exploration in RLVR via Outcome-Process Novelty Shaping
ACL 2026
·
Xu He
DBLP profile ↗
ORCID search ↗
WISCA: A Lightweight Model Transition Method to Improve LLM Training via Weight Scaling
ACL 2026
·
Jiacheng Li
DBLP profile ↗
ORCID search ↗
A Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy
EMNLP 2025
·
Xiaoyun Zhang
DBLP profile ↗
ORCID search ↗
AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models
ACL 2025
·
Qi Liu
DBLP profile ↗
ORCID search ↗
AgentRefine: Enhancing Agent Generalization through Refinement Tuning
ICLR 2025
·
Dayuan Fu
DBLP profile ↗
ORCID search ↗
Don't Half-listen: Capturing Key-part Information in Continual Instruction Tuning
ACL 2025
·
Yongquan He
DBLP profile ↗
ORCID search ↗
Dynamic Fisher-weighted Model Merging via Bayesian Optimization
NAACL 2025
·
Sanwoo Lee
DBLP profile ↗
ORCID search ↗
Earlier Tokens Contribute More: Learning Direct Preference Optimization From Temporal Decay Perspective
ICLR 2025
·
Ruichen Shao
DBLP profile ↗
ORCID search ↗
Enhancing LLMs via High-Knowledge Data Selection
AAAI 2025
·
Feiyu Duan
DBLP profile ↗
ORCID search ↗
FIRE: Flexible Integration of Data Quality Ratings for Effective Pretraining
EMNLP 2025
·
Liangyu Xu
DBLP profile ↗
ORCID search ↗
FRAME: Boosting LLMs with A Four-Quadrant Multi-Stage Pretraining Strategy
ACL 2025
·
Xuemiao Zhang
DBLP profile ↗
ORCID search ↗
Instance-level Randomization: Toward More Stable LLM Evaluations
EMNLP 2025
·
Yiyang Li
DBLP profile ↗
ORCID search ↗
Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation
NeurIPS 2025
·
Zhe Kong
DBLP profile ↗
ORCID search ↗
Leveraging Dual Process Theory in Language Agent Framework for Real-time Simultaneous Human-AI Collaboration
ACL 2025
·
Shao Zhang
DBLP profile ↗
ORCID search ↗
Leveraging Unpaired Feedback for Long-Term LLM-based Recommendation Tuning
EMNLP 2025
·
Jizhi Zhang
DBLP profile ↗
ORCID search ↗
LogicPro: Improving Complex Logical Reasoning via Program-Guided Learning
ACL 2025
·
Jin Jiang
DBLP profile ↗
ORCID search ↗
MUSE: MCTS-Driven Red Teaming Framework for Enhanced Multi-Turn Dialogue Safety in Large Language Models
EMNLP 2025
·
Siyu Yan
DBLP profile ↗
ORCID search ↗
Mitigating Tail Narrowing in LLM Self-Improvement via Socratic-Guided Sampling
NAACL 2025
·
Yiwen Ding
DBLP profile ↗
ORCID search ↗
Multi-Programming Language Sandbox for LLMs
ACL 2025
·
Shihan Dou
DBLP profile ↗
ORCID search ↗
NeedleInATable: Exploring Long-Context Capability of Large Language Models towards Long-Structured Tables
NeurIPS 2025
·
Lanrui Wang
DBLP profile ↗
ORCID search ↗
Preference Curriculum: LLMs Should Always Be Pretrained on Their Preferred Data
ACL 2025
·
Xuemiao Zhang
DBLP profile ↗
ORCID search ↗
PrefixKV: Adaptive Prefix KV Cache is What Vision Instruction-Following Models Need for Efficient Generation
NeurIPS 2025
·
Ao Wang
DBLP profile ↗
ORCID search ↗
Prejudge-Before-Think: Enhancing Large Language Models at Test-Time by Process Prejudge Reasoning
EMNLP 2025
·
Jianing Wang
DBLP profile ↗
ORCID search ↗
ReMamba: Equip Mamba with Effective Long-Sequence Modeling
EMNLP 2025
·
Danlong Yuan
DBLP profile ↗
ORCID search ↗
Revisit Self-Debugging with Self-Generated Tests for Code Generation
ACL 2025
·
Xiancai Chen
DBLP profile ↗
ORCID search ↗
Revisiting Scaling Laws for Language Models: The Role of Data Quality and Training Strategies
ACL 2025
·
Zhengyu Chen
DBLP profile ↗
ORCID search ↗
S3cMath: Spontaneous Step-Level Self-Correction Makes Large Language Models Better Mathematical Reasoners
AAAI 2025
·
Yuchen Yan
DBLP profile ↗
ORCID search ↗
SEAS: Self-Evolving Adversarial Safety Optimization for Large Language Models
AAAI 2025
·
Muxi Diao
DBLP profile ↗
ORCID search ↗
SampleMix: A Sample-wise Pre-training Data Mixing Strategy by Coordinating Data Quality and Diversity
EMNLP 2025
·
Xiangyu Xi
DBLP profile ↗
ORCID search ↗
The Role of Visual Modality in Multimodal Mathematical Reasoning: Challenges and Insights
ACL 2025
·
Yufang Liu
DBLP profile ↗
ORCID search ↗
Too Consistent to Detect: A Study of Self-Consistent Errors in LLMs
EMNLP 2025
·
Hexiang Tan
DBLP profile ↗
ORCID search ↗
When to Continue Thinking: Adaptive Thinking Mode Switching for Efficient Reasoning
EMNLP 2025
·
Xiaoyun Zhang
DBLP profile ↗
ORCID search ↗
Why Not Act on What You Know? Unleashing Safety Potential of LLMs via Self-Aware Guard Enhancement
ACL 2025
·
Peng Ding
DBLP profile ↗
ORCID search ↗
DolphCoder: Echo-Locating Code Large Language Models with Diverse and Multi-Objective Instruction Tuning
ACL 2024
·
Yejie Wang
DBLP profile ↗
ORCID search ↗
Graph-Structured Speculative Decoding
ACL 2024
·
Zhuocheng Gong
DBLP profile ↗
ORCID search ↗
Hallu-PI: Evaluating Hallucination in Multi-modal Large Language Models within Perturbed Inputs
ACM MM 2024
·
Peng Ding
DBLP profile ↗
ORCID search ↗
How Do Your Code LLMs perform? Empowering Code Instruction Tuning with Really Good Data
EMNLP 2024
·
Yejie Wang
DBLP profile ↗
ORCID search ↗
Learning or Self-aligning? Rethinking Instruction Fine-tuning
ACL 2024
·
Mengjie Ren
DBLP profile ↗
ORCID search ↗
Not All Contexts Are Equal: Teaching LLMs Credibility-aware Generation
EMNLP 2024
·
Ruotong Pan
DBLP profile ↗
ORCID search ↗
Predictor-Corrector Enhanced Transformers with Exponential Moving Average Coefficient Learning
NeurIPS 2024
·
Bei Li
DBLP profile ↗
ORCID search ↗
Rethinking the Reversal Curse of LLMs: a Prescription from Human Knowledge Reversal
EMNLP 2024
·
Zhicong Lu
DBLP profile ↗
ORCID search ↗
Speculative Decoding via Early-exiting for Faster LLM Inference with Thompson Sampling Control Mechanism
ACL 2024
·
Jiahao Liu
DBLP profile ↗
ORCID search ↗
What Makes Quantization for Large Language Model Hard? An Empirical Study from the Lens of Perturbation
AAAI 2024
·
Zhuocheng Gong
DBLP profile ↗
ORCID search ↗