PPaperPicks

Yao Zhao

Beijing Jiaotong University, Institute of Information Science, Beijing, China

53 papers at tracked venues · 47 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. RAIN: Redundancy-Aware Latent Injection for Quality-Preserving Image Watermarking
  2. AEMVC: Mitigate Imbalanced Embedding Space in Multi-view Clustering
  3. Attend and Enrich: Enhanced Visual Prompt for Zero-Shot Learning
  4. C2P-CLIP: Injecting Category Common Prompt in CLIP to Enhance Generalization in Deepfake Detection
  5. CLIP-GS: Unifying Vision-Language Representation with 3D Gaussian Splatting
  6. CharaConsist: Fine-Grained Consistent Character Generation
  7. ClassDiffusion: More Aligned Personalization Tuning with Explicit Class Guidance
  8. Collapsed Language Models Promote Fairness
  9. DCI: Dual-Conditional Inversion for Boosting Diffusion-Based Image Editing
  10. Dual-view X-ray Detection: Can AI Detect Prohibited Items from Dual-view X-ray Images like Humans?
  11. EvEnhancer: Empowering Effectiveness, Efficiency and Generalizability for Continuous Space-Time Video Super-Resolution with Events
  12. FlexVAR: Flexible Visual Autoregressive Modeling without Residual Prediction
  13. Jasmine: Harnessing Diffusion Prior for Self-supervised Depth Estimation
  14. Learning from Disjoint Views: A Contrastive Prototype Matching Network for Fully Incomplete Multi-View Clustering
  15. Martian World Model: Controllable Video Synthesis with Physically Accurate 3D Reconstructions
  16. Memory Efficient Matting with Adaptive Token Routing
  17. NTClick: Achieving Precise Interactive Segmentation With Noise-tolerant Clicks
  18. NTIRE 2025 Challenge on Short-form UGC Video Quality Assessment and Enhancement: Methods and Results
  19. ODDN: Addressing Unpaired Data Challenges in Open-World Deepfake Detection on Online Social Networks
  20. Once-for-All: Controllable Generative Image Compression with Dynamic Granularity Adaptation
  21. PixelStitch: Structure-Preserving Pixel-Wise Bidirectional Warps for Unsupervised Image Stitching
  22. PreFM: Online Audio-Visual Event Parsing via Predictive Future Modeling
  23. ReCot: Reflective Self-Correction Training for Mitigating Confirmation Bias in Large Vision-Language Models
  24. TiP4GEN: Text to Immersive Panorama 4D Scene Generation
  25. Towards Pre-trained Graph Condensation via Optimal Transport
  26. Unifying Reconstruction and Density Estimation via Invertible Contraction Mapping in One-Class Classification
  27. Unsupervised Region-Based Image Editing of Denoising Diffusion Models
  28. VideoWorld: Exploring Knowledge Learning from Unlabeled Videos
  29. Visual Relation Diffusion for Human-Object Interaction Detection
  30. ChatVTG: Video Temporal Grounding via Chat with Video Dialogue Large Language Models
  31. Collaborative Vision-Text Representation Optimizing for Open-Vocabulary Segmentation
  32. Diffusion for Natural Image Matting
  33. Diffusion4D: Fast Spatial-temporal Consistent 4D generation via Video Diffusion Models
  34. Digging into Contrastive Learning for Robust Depth Estimation with Diffusion Models
  35. DreamLCM: Towards High Quality Text-to-3D Generation via Latent Consistency Model
  36. Eliminating Warping Shakes for Unsupervised Online Video Stitching
  37. Endow SAM with Keen Eyes: Temporal-Spatial Prompt Learning for Video Camouflaged Object Detection
  38. FlexCare: Leveraging Cross-Task Synergy for Flexible Multimodal Healthcare Prediction
  39. Forgery-aware Adaptive Transformer for Generalizable Synthetic Image Detection
  40. Frequency-Aware Deepfake Detection: Improving Generalizability through Frequency Space Domain Learning
  41. Frozen CLIP: A Strong Backbone for Weakly Supervised Semantic Segmentation
  42. Lyapunov-Stable Deep Equilibrium Models
  43. On the Unstable Convergence Regime of Gradient Descent
  44. PixelLM: Pixel Reasoning with Large Multimodal Model
  45. Region-Adaptive Transform with Segmentation Prior for Image Compression
  46. Region-Native Visual Tokenization
  47. Rethinking the Up-Sampling Operations in CNN-Based Generative Network for Generalizable Deepfake Detection
  48. SeeClear: Semantic Distillation Enhances Pixel Condensation for Video Super-Resolution
  49. Segment Anything with Precise Interaction
  50. Semantic Lens: Instance-Centric Semantic Alignment for Video Super-resolution
  51. Towards the Uncharted: Density-Descending Feature Perturbation for Semi-supervised Semantic Segmentation
  52. Transferable and Principled Efficiency for Open-Vocabulary Segmentation
  53. WeatherDepth: Curriculum Contrastive Learning for Self-Supervised Depth Estimation under Adverse Weather Conditions