PPaperPicks

Yuan Xie

East China Normal University, Shanghai, China

39 papers at tracked venues · 38 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Auto-Stega: An Agent-Driven System for Lifelong Strategy Evolution in LLM-Based Text Steganography
  2. Diffusion Implicit Policy for Unpaired Scene-aware Motion Synthesis
  3. Human Motion Synthesis in 3D Scenes via Unified Scene Semantic Occupancy
  4. Multi-Step Deformable Gaussian Splatting for Dynamic Scene Rendering
  5. NaviMaster: Learning a Unified Policy for GUI and Embodied Navigation Tasks
  6. PC-CrossDiff: Point-Cluster Dual-Level Cross-Modal Differential Attention for Unified 3D Referring and Segmentation
  7. Target Refocusing via Attention Redistribution for Open-Vocabulary Semantic Segmentation: An Explainability Perspective
  8. Zero-Shot Robotic Manipulation via 3D Gaussian Splatting-Enhanced Multimodal Retrieval-Augmented Generation
  9. DrivingForward: Feed-forward 3D Gaussian Splatting for Driving Scene Reconstruction from Flexible Surround-view Input
  10. FastLGS: Speeding Up Language Embedded Gaussians with Feature Grid Mapping
  11. From Enhancement to Understanding: Build a Generalized Bridge for Low-Light Vision via Semantically Consistent Unsupervised Fine-Tuning
  12. IDMR: Towards Instance-Driven Precise Visual Correspondence in Multimodal Retrieval
  13. Large Continual Instruction Assistant
  14. MaskViM: Domain Generalized Semantic Segmentation with State Space Models
  15. Novel Category Discovery with X-Agent Attention for Open-Vocabulary Semantic Segmentation
  16. Omni-Query Active Learning for Source-Free Domain Adaptive Cross-Modality 3D Semantic Segmentation
  17. One-for-More: Continual Diffusion Model for Anomaly Detection
  18. PFDepth: Heterogeneous Pinhole-Fisheye Joint Depth Estimation via Distortion-aware Gaussian-Splatted Volumetric Fusion
  19. PLATO-TTA: Prototype-Guided Pseudo-Labeling and Adaptive Tuning for Multi-Modal Test-Time Adaptation of 3D Segmentation
  20. SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding
  21. AdaFormer: Efficient Transformer with Adaptive Token Sparsification for Image Super-resolution
  22. Beyond the Label Itself: Latent Labels Enhance Semi-supervised Point Cloud Panoptic Segmentation
  23. Building a Strong Pre-Training Baseline for Universal 3D Large-Scale Perception
  24. CLIP-Guided Federated Learning on Heterogeneity and Long-Tailed Data
  25. CLIP2UDA: Making Frozen CLIP Reward Unsupervised Domain Adaptation in 3D Semantic Segmentation
  26. COTR: Compact Occupancy TRansformer for Vision-Based 3D Occupancy Prediction
  27. Cross-Modal Match for Language Conditioned 3D Object Grounding
  28. Efficient Lightweight Image Denoising with Triple Attention Transformer
  29. Harmonizing Visual Text Comprehension and Generation
  30. Learning Task-Aware Language-Image Representation for Class-Incremental Object Detection
  31. Multi-memory Matching for Unsupervised Visible-Infrared Person Re-identification
  32. Multi-modal In-Context Learning Makes an Ego-evolving Scene Text Recognizer
  33. Prompt Gradient Projection for Continual Learning
  34. PromptAD: Learning Prompts with only Normal Samples for Few-Shot Anomaly Detection
  35. Relationship Prompt Learning is Enough for Open-Vocabulary Semantic Segmentation
  36. Robust Pseudo-label Learning with Neighbor Relation for Unsupervised Visible-Infrared Person Re-Identification
  37. SkipDiff: Adaptive Skip Diffusion Model for High-Fidelity Perceptual Image Super-resolution
  38. SkipVSR: Adaptive Patch Routing for Video Super-Resolution with Inter-Frame Mask
  39. UniDSeg: Unified Cross-Domain 3D Semantic Segmentation via Visual Foundation Models Prior