PPaperPicks

Yuan Wang

25 papers at tracked venues · 21 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Act as you think: Reinforcing Consistent Reasoning in Medical Visual Question Answering
  2. Beyond N-grams: A Hierarchical Reward Learning Framework for Clinically-Aware Medical Report Generation
    AAAI 2026 · Yuan Wang
  3. Data Efficient RLVR via Off-Policy Influence Guidance
  4. IPFormer: Instance Prompt-guided Transformer for Multi-modal Multi-shot Video Understanding
  5. TCoT: Trajectory Chain-of-Thoughts for Robotic Manipulation with Failure Recovery in Vision-Language-Action Model
  6. Towards Proactive Personalization through Profile Customization for Individual Users in Dialogues
  7. Unreal-MAP: Unreal-Engine-Based General Platform for Multi-agent Reinforcement Learning
  8. VisionReward: Fine-Grained Multi-Dimensional Human Preference Learning for Image and Video Generation
  9. BookBot: A Robotic Manipulation Benchmark for Voice-Driven Book Recognition and Grasping in Cluttered Environments
  10. ComRAG: Retrieval-Augmented Generation with Dynamic Vector Stores for Real-time Community Question Answering in Industry
  11. Golden Cudgel Network for Real-Time Semantic Segmentation
  12. HSI-GPT: A General-Purpose Large Scene-Motion-Language Model for Human Scene Interaction
    CVPR 2025 · Yuan Wang
  13. Human-Centric Foundation Models: Perception, Generation and Agentic Modeling
  14. LEADRE: Multi-Faceted Knowledge Enhanced LLM Empowered Display Advertisement Recommender System
  15. LIBA: Language Instructed Multi-granularity Bridge Assistant for 3D Visual Grounding
    AAAI 2025 · Yuan Wang
  16. Mamba-3VL: Taming State Space Model for 3D Vision Language Learning
    ICCV 2025 · Yuan Wang
  17. OmniTalker: One-shot Real-time Text-Driven Talking Audio-Video Generation With Multimodal Style Mimicking
  18. Precise, Fast, and Low-cost Concept Erasure in Value Space: Orthogonal Complement Matters
    CVPR 2025 · Yuan Wang
  19. U-ViLAR: Uncertainty-Aware Visual Localization for Autonomous Driving via Differentiable Association and Registration
  20. V2T-CoT: From Vision to Text Chain-of-Thought for Medical Reasoning and Diagnosis
    MICCAI 2025 · Yuan Wang
  21. Exploring Pose-Aware Human-Object Interaction via Hybrid Learning
  22. Frequency Shuffling and Enhancement for Open Set Recognition
  23. G3-LQ: Marrying Hyperbolic Alignment with Explicit Semantic-Geometric Modeling for 3D Visual Grounding
    CVPR 2024 · Yuan Wang
  24. MedCoT: Medical Chain of Thought via Hierarchical Expert
  25. Near-Optimal Resilient Aggregation Rules for Distributed Learning Using 1-Center and 1-Mean Clustering with Outliers