PPaperPicks

Yanwei Fu

Fudan University, School of Data Science, Shanghai, China

51 papers at tracked venues · 39 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. One-Step Generative Policies with Q-Learning: A Reformulation of MeanFlow
  2. Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination
  3. SwiftVideo: A Unified Framework for Few-Step Video Generation Through Trajectory-Distribution Alignment
  4. 3D StreetUnveiler with Semantic-aware 2DGS - a simple baseline
  5. A Neural Representation Framework with LLM-Driven Spatial Reasoning for Open-Vocabulary 3D Visual Grounding
  6. Adaptive Pruning of Pretrained Transformer via Differential Inclusions
  7. Ali-UI: Enhancing Complex Vision-Language Navigation with Alignment of Unified Map and Instruction Parsing
  8. Bivariate Causal Discovery with Proxy Variables: Integral Solving and Beyond
  9. CAP-Net: A Unified Network for 6D Pose and Size Estimation of Categorical Articulated Parts from a Single RGB-D Image
  10. Concept Replacer: Replacing Sensitive Concepts in Diffusion Models via Precision Localization
  11. ContextualStory: Consistent Visual Storytelling with Spatially-Enhanced and Storyline Context
  12. CrossVTON: Mimicking the Logic Reasoning on Cross-Category Virtual Try-On Guided by Tri-Zone Priors
  13. CustAny: Customizing Anything from A Single Example
  14. Diffusion-Based Imaginative Coordination for Bimanual Manipulation
  15. Disentangle Identity, Cooperate Emotion: Correlation-Aware Emotional Talking Portrait Generation
  16. Domain-RAG: Retrieval-Guided Compositional Image Generation for Cross-Domain Few-Shot Object Detection
  17. EDEN: Enhanced Diffusion for High-quality Large-motion Video Frame Interpolation
  18. HOP: Heterogeneous Topology-based Multimodal Entanglement for Co-Speech Gesture Generation
  19. MVGenMaster: Scaling Multi-View Generation from Any Image via 3D Priors Enhanced Diffusion Model
  20. NTIRE 2025 Challenge on Cross-Domain Few-Shot Object Detection: Methods and Results
  21. ObjectRelator: Enabling Cross-View Object Relation Understanding Across Ego-Centric and Exo-Centric Perspectives
  22. Online Dense Point Tracking with Streaming Memory
  23. PPMStereo: Pick-and-Play Memory Construction for Consistent Dynamic Stereo Matching
  24. RAG-6DPose: Retrieval-Augmented 6D Pose Estimation via Leveraging CAD as Knowledge Base
  25. ReasonGrounder: LVLM-Guided Hierarchical Feature Splatting for Open-Vocabulary 3D Visual Grounding and Reasoning
  26. Sequential Multi-Object Grasping with One Dexterous Hand
  27. Spatial-Temporal Aware Visuomotor Diffusion Policy Learning
  28. StrandDesigner: Towards Practical Strand Generation with Sketch Guidance
  29. TP-MDDN: Task-Preferenced Multi-Demand-Driven Navigation with Autonomous Decision-Making
  30. Towards Enhanced Image Inpainting: Mitigating Unwanted Object Insertion and Preserving Color Consistency
  31. Towards Reliable and Holistic Visual In-Context Learning Prompt Selection
  32. TransSoft: The Low-Cost, Adaptable, and Radial Reconfigurable Soft Hand for Diverse Object Grasping
  33. UniDB: A Unified Diffusion Bridge Framework via Stochastic Optimal Control
  34. You Only Estimate Once: Unified, One-stage, Real-Time Category-Level Articulated Object 6D Pose Estimation for Robotic Grasping
  35. Adaptive Slot Attention: Object Discovery with Dynamic Slot Number
  36. Cross-Domain Few-Shot Object Detection via Enhanced Open-Set Object Detector
  37. Doubly Robust Proximal Causal Learning for Continuous Treatments
  38. Enhancing Cross-Subject fMRI-to-Video Decoding with Global-Local Functional Alignment
  39. HybridGait: A Benchmark for Spatial-Temporal Cloth-Changing Gait Recognition with Hybrid Explorations
  40. Improving Neural Surface Reconstruction with Feature Priors from Multi-view Images
  41. LAC-Net: Linear-Fusion Attention-Guided Convolutional Network for Accurate Robotic Grasping Under the Occlusion
  42. LeftRefill: Filling Right Canvas based on Left Reference through Generalized Text-to-Image Diffusion Model
  43. MVInpainter: Learning Multi-View Consistent Inpainting to Bridge 2D and 3D Editing
  44. MVSFormer++: Revealing the Devil in Transformer's Details for Multi-View Stereo
  45. MemFlow: Optical Flow Estimation and Prediction with Memory
  46. MinD-3D: Reconstruct High-Quality 3D Objects in Human Brain
  47. NeuroPictor: Refining fMRI-to-Image Reconstruction via Multi-individual Pretraining and Multi-level Modulation
  48. Polaris: Open-ended Interactive Robotic Manipulation via Syn2Real Visual Grounding and Large Language Models
  49. Test-Time Linear Out-of-Distribution Detection
  50. Towards Global Optimal Visual In-Context Learning Prompt Selection
  51. Unified Lexical Representation for Interpretable Visual-Language Alignment