PPaperPicks

Dong Yu

Tencent AI Lab, China

84 papers at tracked venues · 50 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Audio-Thinker: Guiding Large Audio Language Model When and How to Think via Reinforcement Learning
  2. Crossing the Reward Bridge: Expanding Reinforcement Learning with Verifiable Rewards Across Diverse Domains
  3. DegVoC: Revisiting Neural Vocoder from a Degradation Perspective
  4. EconProver: Towards More Economical Test-Time Scaling for Automated Theorem Proving
  5. Enhancing Stability and Fidelity for Zero-Shot TTS with a Multi-Level Evaluator
  6. Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification
  7. Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation
  8. Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning
  9. Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data
  10. UniCUE: Unified Recognition and Generation Framework for Chinese Cued Speech Video-to-Speech Generation
  11. VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents
  12. Verified Critical Step Optimization for LLM Agents
  13. WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation Models
  14. WebRollback: Enhancing Web Agents with Explicit Rollback Mechanisms
  15. Your Reasoning Model is Secretly a Reward Model - Optimization-Free Verification from Experience
  16. A Silver Bullet or a Compromise for Full Attention? A Comprehensive Study of Gist Token-based Context Compression
  17. Attention Entropy is a Key Factor: An Analysis of Parallel Context Encoding with Full-attention-based Pre-trained Language Models
  18. BridgeVoC: Neural Vocoder with Schrödinger Bridge
  19. Cognitive Kernel: An Open-source Agent System towards Generalist Autopilots
  20. DOTS: Learning to Reason Dynamically in LLMs via Optimal Reasoning Trajectories Search
  21. DSBench: How Far Are Data Science Agents from Becoming Data Science Experts?
  22. DeFine: Decision-Making with Analogical Reasoning over Factor Profiles
  23. DivScene: Towards Open-Vocabulary Object Navigation with Large Vision Language Models in Diverse Scenes
  24. Do NOT Think That Much for 2+3=? On the Overthinking of Long Reasoning Models
  25. Don't Get Lost in the Trees: Streamlining LLM Reasoning by Overcoming Tree Search Exploration Pitfalls
  26. Efficient Multilingual ASR Finetuning via LoRA Language Experts
  27. EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
  28. From Continuous to Discrete: Cross-Domain Collaborative General Speech Enhancement via Hierarchical Language Models
  29. Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model
  30. Improving LLM General Preference Alignment via Optimistic Online Mirror Descent
  31. Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning
  32. LeVo: High-Quality Song Generation with Multi-Preference Alignment
  33. LiteSearch: Efficient Tree Search with Dynamic Exploration Budget for Math Reasoning
  34. LoGU: Long-form Generation with Uncertainty Expressions
  35. LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory
  36. Low-Bit Quantization Favors Undertrained LLMs
  37. MPS-Prover: Advancing Stepwise Theorem Proving by Multi-Perspective Search and Data Curation
  38. Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning
  39. OpenWebVoyager: Building Multimodal Web Agents via Iterative Real-World Exploration, Feedback and Optimization
  40. Recall with Reasoning: Chain-of-Thought Distillation for Mamba's Long-Context Memory and Extrapolation
  41. RepoGraph: Enhancing AI Software Engineering with Repository-level Code Graph
  42. Retrieval-augmented GUI Agents with Generative Guidelines
  43. Router-Tuning: A Simple and Effective Approach for Dynamic Depth
  44. Scaling beyond Denoising: Submitted System and Findings in URGENT Challenge 2025
  45. The First Few Tokens Are All You Need: An Efficient and Effective Unsupervised Prefix Fine-Tuning Method for Reasoning Models
  46. Thoughts Are All Over the Place: On the Underthinking of Long Reasoning Models
  47. Towards Diverse and Efficient Audio Captioning via Diffusion Models
  48. Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards
  49. Two Experts Are All You Need for Steering Thinking: Reinforcing Cognitive Effort in MoE Reasoning Models Without Additional Training
  50. UNCLE: Benchmarking Uncertainty Expressions in Long-Form Generation
  51. UniGist: Towards General and Hardware-aligned Sequence-level Long Context Compression
  52. Video-to-Audio Generation with Fine-grained Temporal Semantics
  53. VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining
  54. WAKE: Watermarking Audio with Key Enrichment
  55. WebCoT: Enhancing Web Agent Reasoning by Reconstructing Chain-of-Thought in Reflection, Branching, and Rollback
  56. WebEvolver: Enhancing Web Agent Self-Improvement with Co-evolving World Model
  57. A Closer Look at the Self-Verification Abilities of Large Language Models in Logical Reasoning
  58. Abstraction-of-Thought Makes Language Models Better Reasoners
  59. CLOMO: Counterfactual Logical Modification with Large Language Models
  60. Chain-of-Note: Enhancing Robustness in Retrieval-Augmented Language Models
  61. Comparing Discrete and Continuous Space LLMs for Speech Recognition
  62. Dense X Retrieval: What Retrieval Granularity Should We Use?
  63. Fact-and-Reflection (FaR) Improves Confidence Calibration of Large Language Models
  64. From Language Modeling to Instruction Following: Understanding the Behavior Shift in LLMs after Instruction Tuning
  65. Generative Pre-trained Speech Language Model with Efficient Hierarchical Transformer
  66. Improving LLM Generations via Fine-Grained Self-Endorsement
  67. InFoBench: Evaluating Instruction Following Ability in Large Language Models
  68. Learn Beyond The Answer: Training Language Models with Reflection for Mathematical Reasoning
  69. MM-LLMs: Recent Advances in MultiModal Large Language Models
  70. MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning
  71. Make-A-Voice: Revisiting Voice Large Language Models as Scalable Multilingual and Multitask Learners
  72. Multi-Channel Multi-Speaker ASR Using Target Speaker's Solo Segment
  73. Polarity Calibration for Opinion Summarization
  74. Prompt-guided Precise Audio Editing with Diffusion Models
  75. RIR-SF: Room Impulse Response Based Spatial Feature for Target Speech Recognition in Multi-Channel Multi-Speaker Scenarios
  76. Rewards-in-Context: Multi-objective Alignment of Foundation Models with Dynamic Preference Adjustment
  77. Self-Consistency Boosts Calibration for Math Reasoning
  78. Skills-in-Context: Unlocking Compositionality in Large Language Models
  79. SportsMetrics: Blending Text and Numerical Data to Understand Information Fusion in LLMs
  80. Sub-Sentence Encoder: Contrastive Learning of Propositional Semantic Representations
  81. The Trickle-down Impact of Reward Inconsistency on RLHF
  82. Toward Self-Improvement of LLMs via Imagination, Searching, and Criticizing
  83. WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models
  84. When Reasoning Meets Information Aggregation: A Case Study with Sports Narratives