PPaperPicks

Yongliang Shen

Zhejiang University, College of Computer Science and Technology, China

34 papers at tracked venues · 28 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. AutoTaskEval: Towards Domain-Specific and Fine-Grained Evaluation for LLMs
  2. CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution
  3. Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks
  4. Experience-driven Multi-turn Reinforcement Learning for GUI Agents
  5. GUI-G²: Gaussian Reward Modeling for GUI Grounding
  6. How Controllable Are Large Language Models? A Unified Evaluation across Behavioral Granularities
  7. Leveraging Outline-Optimized Generative Interactions and Critique for Self-Refining Outlines with Reinforcement Learning
  8. Pause or Fabricate? Training Language Models for Grounded Reasoning
  9. Phun-Bench: Evaluating LLMs on Phonological Understanding in Chinese
  10. Reality vs Counterfactual: Multi-World Contrastive Reinforcement Learning for Enhancing MLLM's Theory of Mind in Egocentric Videos
  11. Seeing but Not Thinking: Routing Distraction in Multimodal Mixture-of-Experts
  12. Test-Time Reinforcement Learning for GUI Grounding via Region Consistency
  13. ToM-Synth: Scaling Robust Theory of Mind in LLMs via 6, 912 Structured Social Units
  14. UI-Copilot: Advancing Long-Horizon GUI Automation via Tool-Integrated Policy Optimization
  15. 2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining
  16. AskToAct: Enhancing LLMs Tool Use via Self-Correcting Clarification
  17. Chain-of-Model Learning for Language Model
  18. DB-Explore: Automated Database Exploration and Instruction Synthesis for Text-to-SQL
  19. EASYTOOL: Enhancing LLM-based Agents with Concise Tool Instruction
  20. Let LRMs Break Free from Overthinking via Self-Braking Tuning
  21. Logic: Long-form Outline Generation via Imitative and Critical Self-refinement
  22. Mind the Gap: Bridging Thought Leap for Improved Chain-of-Thought Tuning
  23. STaR-SQL: Self-Taught Reasoner for Text-to-SQL
  24. SVGenius: Benchmarking LLMs in SVG Understanding, Editing and Generation
  25. Scaling LLMs' Social Reasoning: Sprinkle Cognitive "Aha Moment" into Fundamental Long-thought Logical Capabilities
  26. Advancing Process Verification for Large Language Models via Tree-Based Preference Learning
  27. Agent-Pro: Learning to Evolve via Policy-Level Reflection and Optimization
  28. Insert or Attach: Taxonomy Completion via Box Embedding
  29. Learning Global Controller in Latent Space for Parameter-Efficient Fine-Tuning
  30. Multimodal Self-Instruct: Synthetic Abstract Image and Visual Reasoning Instruction Using Language Model
  31. Progressive Tuning: Towards Generic Sentiment Abilities for Large Language Models
  32. Self-Contrast: Better Reflection Through Inconsistent Solving Perspectives
  33. TaskBench: Benchmarking Large Language Models for Task Automation
    NeurIPS 2024 · Yongliang Shen
  34. TimeToM: Temporal Space is the Key to Unlocking the Door of Large Language Models' Theory-of-Mind