PPaperPicks

Yu Zhou

Nankai University, Tianjin, China

28 papers at tracked venues · 20 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. ST-SAM: Multimodal Scene Text Segmentation with Dense Visual and Sparse Textual Prompts via SAM
  2. SUGAR: Learning Skeleton Representation with Visual-Motion Knowledge for Action Recognition
  3. Task-Aware 3D Affordance Segmentation via 2D Guidance and Geometric Refinement
  4. Towards Breaking the Visual Perception Bottleneck for Geometry Problem Solving
  5. When Eyes and Ears Disagree: Can MLLMs Discern Audio-Visual Confusion?
  6. An Empirical Study on Configuring In-Context Learning Demonstrations for Unleashing MLLMs' Sentimental Perception Capability
  7. Arbitrary Reading Order Scene Text Spotter with Local Semantics Guidance
  8. Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts
  9. Beyond Flat Text: Dual Self-Inherited Guidance for Visual Text Generation
  10. Class-Agnostic Region-of-Interest Matching in Document Images
  11. DCA: Dividing and Conquering Amnesia in Incremental Object Detection
  12. Gather and Trace: Rethinking Video TextVQA from an Instance-oriented Perspective
  13. LDP: Generalizing to Multilingual Visual Information Extraction by Language Decoupled Pretraining
  14. Linguistics-aware Masked Image Modeling for Self-supervised Scene Text Recognition
  15. PACM: Position-Aware Cross-Modality Decoder for Handwritten Mathematical Expression Recognition
  16. PerturbCTC: Improving Alignment in Scene Text Recognition with Feature Perturbation Based CTC
  17. Specifying What You Know or Not for Multi-Label Class-Incremental Learning
  18. TADoc: Robust Time-Aware Document Image Dewarping
  19. The Devil is in Fine-tuning and Long-tailed Problems: A New Benchmark for Scene Text Detection
  20. The Role of Video Generation in Enhancing Data-Limited Action Understanding
  21. Track the Answer: Extending TextVQA from Image to Video with Spatio-Temporal Clues
  22. Uni-DocDiff: A Unified Document Restoration Model Based on Diffusion
  23. When Semantics Mislead Vision: Mitigating Large Multimodal Models Hallucinations in Scene Text Spotting and Understanding
  24. Bridging Visual Affective Gap: Borrowing Textual Knowledge by Learning from Noisy Image-Text Pairs
  25. First Creating Backgrounds Then Rendering Texts: A New Paradigm for Visual Text Blending
  26. Focus, Distinguish, and Prompt: Unleashing CLIP for Efficient and Flexible Scene Text Retrieval
  27. Robust Multimodal Sentiment Analysis of Image-Text Pairs by Distribution-Based Feature Recovery and Fusion
  28. TextCtrl: Diffusion-based Scene Text Editing with Prior Guidance Control