PPaperPicks

Zhongyuan Wang

Meituan-Dianping Group, Beijing, China

18 papers at tracked venues · 13 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. NavA³: Understanding Any Instruction, Navigating Anywhere, Finding Anything
  2. Toward Generalized Web Agent Training: A Deep Dive into Entropy-Balanced Reinforcement Learning
  3. Towards Effective Code-Integrated Reasoning
  4. AC-DiT: Adaptive Coordination Diffusion Transformer for Mobile Manipulation
  5. AffordGrasp: In-Context Affordance Reasoning for Open-Vocabulary Task-Oriented Grasping in Clutter
  6. Code-as-Monitor: Constraint-aware Visual Programming for Reactive and Proactive Robotic Failure Detection
  7. Lift3D Policy: Lifting 2D Foundation Models for Robust 3D Robotic Manipulation
  8. MapNav: A Novel Memory Representation via Annotated Semantic Maps for VLM-based Vision-and-Language Navigation
  9. Na Vid-4D: Unleashing Spatial Intelligence in Egocentric RGB-D Videos for Vision-and-Language Navigation
  10. Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
  11. RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete
  12. RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics
  13. SimpleDeepSearcher: Deep Information Seeking via Web-Powered Reasoning Trajectory Synthesis
  14. Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought
  15. CogGPT: Unleashing the Power of Cognitive Dynamics on Large Language Models
  16. GUIDE: A Guideline-Guided Dataset for Instructional Video Comprehension
  17. Just Ask One More Time! Self-Agreement Improves Reasoning of Language Models in (Almost) All Scenarios
  18. Learning Multi-Dimensional Human Preference for Text-to-Image Generation