PPaperPicks

Jun Wang

University College London, Department of Computer Science, UCL Centre for Artificial Intelligence, London, UK

56 papers at tracked venues · 42 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Dual Activation-Weight Sparsity: A Training-Free Framework for Efficient Large Language Model Compression
  2. Proactive Constrained Policy Optimization with Preemptive Penalty
  3. Probe-and-Fetch: Dynamic KV Cache Pruning for Accelerated Long-Context Inference in Web-Scale AI Search
  4. Process Evaluation for Agentic Systems
  5. Towards Unified Affective Reasoning via In-Context Reinforcement Learning
  6. Vision-Language Reasoning for Geolocalization: A Reinforcement Learning Approach
  7. A Principle of Targeted Intervention for Multi-Agent Reinforcement Learning
  8. Boost, Disentangle, and Customize: A Robust System2-to-System1 Pipeline for Code Generation
  9. CMoB: Modality Valuation via Causal Effect for Balanced Multimodal Learning
    NeurIPS 2025 · Jun Wang
  10. Causal Sufficiency and Necessity Improves Chain-of-Thought Reasoning
  11. Circuit Transformer: A Transformer That Preserves Logical Equivalence
  12. Constrain Alignment with Sparse Autoencoders
  13. Curious Causality-Seeking Agents in Open-ended Worlds
  14. Direct Value Optimization: Improving Chain-of-Thought Reasoning in LLMs with Refined Values
  15. DistRL: An Asynchronous Distributed Reinforcement Learning Framework for On-Device Control Agent
  16. EconGym: A Scalable AI Testbed with Diverse Economic Tasks
  17. GenSim: A General Social Simulation Platform with Large Language Model based Agents
  18. Human-inspired Episodic Memory for Infinite Context LLMs
  19. Large Language Models are Demonstration Pre-Selectors for Themselves
  20. Learning Macroeconomic Policies Through Dynamic Stackelberg Mean-Field Games
  21. Lightweight Neural App Control
  22. MF-LLM: Simulating Population Decision Dynamics via a Mean-Field Large Language Model Framework
  23. Mean Field Correlated Imitation Learning
  24. Mixture of Attentions For Speculative Decoding
  25. MobileUse: A Hierarchical Reflection-Driven GUI Agent for Autonomous Mobile Operation
  26. On the Optimization Landscape of Low Rank Adaptation Methods for Large Language Models
  27. Optimizing Case-Based Reasoning System for Functional Test Script Generation with Large Language Models
  28. ReMA: Learning to Meta-Think for LLMs with Multi-agent Reinforcement Learning
  29. Retrieval-Augmented Process Reward Model for Generalizable Mathematical Reasoning
  30. Risk-aware Direct Preference Optimization under Nested Risk Measure
  31. Robust Function-Calling for On-Device Language Model via Function Masking
  32. Self-Verifying Reflection Helps Transformers with CoT Reasoning
  33. Spa-Bench: a comprehensive Benchmark for Smartphone Agent Evaluation
  34. SparsePO: Controlling Preference Alignment of LLMs via Sparse Token Masks
  35. Spiral of Silence in Large Language Model Agents
  36. Succeed or Learn Slowly: Sample Efficient Off-Policy Reinforcement Learning for Mobile App Control
  37. Taming Multi-Agent Reinforcement Learning with Estimator Variance Reduction
  38. ThinkBench: Dynamic Out-of-Distribution Evaluation for Robust LLM Reasoning
  39. Uncertainty-quantified Rollout Policy Adaptation for Unlabelled Cross-domain Video Temporal Grounding
  40. Unlocking the Potential of Decentralized LLM-based MAS: Privacy Preservation and Monetization in Collective Intelligence
  41. Why Not Together? A Multiple-Round Recommender System for Queries and Items
  42. A Summary of Online Markov Decision Processes with Non-oblivious Strategic Adversary
  43. AlphaZero-Like Tree-Search can Guide Large Language Model Decoding and Training
  44. Boosting Studies of Multi-Agent Reinforcement Learning on Google Research Football Environment: The Past, Present, and Future
  45. DS-Agent: Automated Data Science by Empowering Large Language Models with Case-Based Reasoning
  46. Human-Guided Moral Decision Making in Text-Based Games
  47. InfoRank: Unbiased Learning-to-Rank via Conditional Mutual Information Minimization
  48. Language and Sketching: An LLM-driven Interactive Multimodal Multitask Robot Navigation Framework
  49. Large Language Models Are Neurosymbolic Reasoners
  50. Large Language Models Play StarCraft II: Benchmarks and A Chain of Summarization Approach
  51. Multiple Knowledge-Enhanced Interactive Graph Network for Multimodal Conversational Emotion Recognition
  52. Policy Learning from Tutorial Books via Understanding, Rehearsing and Introspecting
  53. Reinforcing LLM Agents via Policy Optimization with Action Decomposition
  54. TaxAI: A Dynamic Economic Simulator and Benchmark for Multi-agent Reinforcement Learning
  55. Token-level Direct Preference Optimization