P
PaperPicks
Conferences
Yali Du
King's College London, London, UK
39 papers at tracked venues · 23 at CORE A* · active 2024–2026
DBLP profile ↗
ORCID 0000-0001-5683-2621 ↗
Google Scholar ↗
Homepage ↗
Venues
NeurIPS
×10
AAMAS
×7
AAAI
×6
EMNLP
×4
ICML
×3
IJCAI
×3
ACL
×2
ICLR
×2
ECAI
×1
ICRA
×1
Frequent coauthors
Richard Willis
DBLP profile ↗
ORCID search ↗
×3
Ziyan Wang
DBLP profile ↗
ORCID search ↗
×2
Zhixun Chen
DBLP profile ↗
ORCID search ↗
×2
Runze Liu
DBLP profile ↗
ORCID search ↗
×2
Xingzhou Lou
DBLP profile ↗
ORCID search ↗
×2
Hongye Cao
DBLP profile ↗
ORCID search ↗
×1
Zhi Li
DBLP profile ↗
ORCID search ↗
×1
Edoardo Pona
DBLP profile ↗
ORCID search ↗
×1
Zhenyi Shen
DBLP profile ↗
ORCID search ↗
×1
Hao Liang
DBLP profile ↗
ORCID search ↗
×1
Lukas Schäfer
DBLP profile ↗
ORCID search ↗
×1
Chandler Smith
DBLP profile ↗
ORCID search ↗
×1
Papers
Causality-Aware Efficient Exploration for Cooperative Multi-Agent Reinforcement Learning
AAAI 2026
·
Hongye Cao
DBLP profile ↗
ORCID search ↗
Entropy-Aware Reshaping of Reinforcement Signals for Multi-Answer Reasoning
ACL 2026
·
Zhi Li
DBLP profile ↗
ORCID search ↗
Safe Multi-agent Reinforcement Learning with Natural Language Constraints
AAAI 2026
·
Ziyan Wang
DBLP profile ↗
ORCID search ↗
ATLAS: Agent Tuning via Learning Critical Steps
ACL 2025
·
Zhixun Chen
DBLP profile ↗
ORCID search ↗
Abstract Counterfactuals for Language Model Agents
NeurIPS 2025
·
Edoardo Pona
DBLP profile ↗
ORCID search ↗
CODI: Compressing Chain-of-Thought into Continuous Space via Self-Distillation
EMNLP 2025
·
Zhenyi Shen
DBLP profile ↗
ORCID search ↗
Causality Meets Locality: Provably Generalizable and Scalable Policy Learning for Networked Systems
NeurIPS 2025
·
Hao Liang
DBLP profile ↗
ORCID search ↗
Ensemble Value Functions for Efficient Exploration in Multi-Agent Reinforcement Learning
AAMAS 2025
·
Lukas Schäfer
DBLP profile ↗
ORCID search ↗
Evaluating Generalization Capabilities of LLM-Based Agents in Mixed-Motive Scenarios Using Concordia
NeurIPS 2025
·
Chandler Smith
DBLP profile ↗
ORCID search ↗
GRU: Mitigating the Trade-off between Unlearning and Retention for LLMs
ICML 2025
·
Yue Wang
DBLP profile ↗
ORCID search ↗
Hierarchical Multi-Agent Framework for Dynamic Macroeconomic Modelling Using Large Language Models
AAMAS 2025
·
Zhixun Chen
DBLP profile ↗
ORCID search ↗
Integrating Large Language Models with Reinforcement Learning for Generalization in Strategic Card Games
AAMAS 2025
·
Wannian Xia
DBLP profile ↗
ORCID search ↗
M³HF: Multi-agent Reinforcement Learning from Multi-phase Human Feedback of Mixed Quality
ICML 2025
·
Ziyan Wang
DBLP profile ↗
ORCID search ↗
NOVER: Incentive Training for Language Models via Verifier-Free Reinforcement Learning
EMNLP 2025
·
Wei Liu
DBLP profile ↗
ORCID search ↗
On the Optimization Landscape of Low Rank Adaptation Methods for Large Language Models
ICLR 2025
·
Xu-Hui Liu
DBLP profile ↗
ORCID search ↗
Quantifying the Self-Interest Level of Markov Social Dilemmas
IJCAI 2025
·
Richard Willis
DBLP profile ↗
ORCID search ↗
RAT: Adversarial Attacks on Deep Reinforcement Agents for Targeted Behaviors
AAAI 2025
·
Fengshuo Bai
DBLP profile ↗
ORCID search ↗
Resolving Social Dilemmas with Minimal Reward Transfer - Extended Abstract
AAMAS 2025
·
Richard Willis
DBLP profile ↗
ORCID search ↗
RuAG: Learned-rule-augmented Generation for Large Language Models
ICLR 2025
·
Yudi Zhang
DBLP profile ↗
ORCID search ↗
Self-Verifying Reflection Helps Transformers with CoT Reasoning
NeurIPS 2025
·
Zhongwei Yu
DBLP profile ↗
ORCID search ↗
Social World Model-Augmented Mechanism Design Policy Learning
NeurIPS 2025
·
Xiaoyuan Zhang
DBLP profile ↗
ORCID search ↗
Spiral of Silence in Large Language Model Agents
EMNLP 2025
·
Mingze Zhong
DBLP profile ↗
ORCID search ↗
VLP: Vision-Language Preference Learning for Embodied Manipulation
EMNLP 2025
·
Runze Liu
DBLP profile ↗
ORCID search ↗
Will Systems of LLM Agents Lead to Cooperation: An Investigation into a Social Dilemma
AAMAS 2025
·
Richard Willis
DBLP profile ↗
ORCID search ↗
Aligning Individual and Collective Objectives in Multi-Agent Cooperation
NeurIPS 2024
·
Yang Li
DBLP profile ↗
ORCID search ↗
Characterizing Physical Adversarial Attacks on Robot Motion Planners
ICRA 2024
·
Wenxi Wu
DBLP profile ↗
ORCID search ↗
Dual Contrastive Graph-Level Clustering with Multiple Cluster Perspectives Alignment
IJCAI 2024
·
Jinyu Cai
DBLP profile ↗
ORCID search ↗
Explaining an Agent's Future Beliefs Through Temporally Decomposing Future Reward Estimators
ECAI 2024
·
Mark Towers
DBLP profile ↗
ORCID search ↗
Human-Guided Moral Decision Making in Text-Based Games
AAAI 2024
·
Zijing Shi
DBLP profile ↗
ORCID search ↗
Learning the Expected Core of Strictly Convex Stochastic Cooperative Games
NeurIPS 2024
·
Nam Phuong Tran
DBLP profile ↗
ORCID search ↗
Learning to Discuss Strategically: A Case Study on One Night Ultimate Werewolf
NeurIPS 2024
·
Xuanfa Jin
DBLP profile ↗
ORCID search ↗
Off-Agent Trust Region Policy Optimization
IJCAI 2024
·
Ruiqing Chen
DBLP profile ↗
ORCID search ↗
PEARL: Zero-shot Cross-task Preference Alignment and Robust Reward Learning for Robotic Manipulation
ICML 2024
·
Runze Liu
DBLP profile ↗
ORCID search ↗
Policy Learning from Tutorial Books via Understanding, Rehearsing and Introspecting
NeurIPS 2024
·
Xiong-Hui Chen
DBLP profile ↗
ORCID search ↗
STAS: Spatial-Temporal Return Decomposition for Solving Sparse Rewards Problems in Multi-agent Reinforcement Learning
AAAI 2024
·
Sirui Chen
DBLP profile ↗
ORCID search ↗
Safe Reinforcement Learning with Free-form Natural Language Constraints and Pre-Trained Language Models
AAMAS 2024
·
Xingzhou Lou
DBLP profile ↗
ORCID search ↗
Self-Guiding Exploration for Combinatorial Problems
NeurIPS 2024
·
Zangir Iklassov
DBLP profile ↗
ORCID search ↗
TAPE: Leveraging Agent Topology for Cooperative Multi-Agent Policy Gradient
AAAI 2024
·
Xingzhou Lou
DBLP profile ↗
ORCID search ↗
The Selfishness Level of Social Dilemmas
AAMAS 2024
·
Stefan Roesch
DBLP profile ↗
ORCID search ↗