PPaperPicks

Yunhang Shen

32 papers at tracked venues · 31 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Robust Pseudo-Labeling via Decoupled Class-Aware Filtering and Dynamic Category Correction
  2. BUFF: Bayesian Uncertainty Guided Diffusion Probabilistic Model for Single Image Super-Resolution
  3. DS-VLM: Diffusion Supervision Vision Language Model
  4. Dynamic Contrastive Knowledge Distillation for Efficient Image Restoration
  5. Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification
  6. Feature Denoising Diffusion Model for Blind Image Quality Assessment
  7. Few-Shot Image Quality Assessment via Adaptation of Vision-Language Models
  8. FlashSloth : Lightning Multimodal Large Language Models via Embedded Visual Compression
  9. FlexiReID: Adaptive Mixture of Expert for Multi-Modal Person Re-Identification
  10. Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM
  11. From Objects to Events: Unlocking Complex Visual Understanding in Object Detectors Via LLM-guided Symbolic Reasoning
  12. Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
  13. MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
  14. Probability-Density-aware Semi-supervised Learning
  15. Towards Universal Perception through Language-Guided Open-World Object Detection
  16. VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction
  17. VITA-Audio: Fast Interleaved Audio-Text Token Generation for Efficient Large Speech-Language Model
  18. Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
  19. Weakly Supervised Semantic Segmentation via Progressive Confidence Region Expansion
  20. What You Perceive Is What You Conceive: A Cognition-Inspired Framework for Open Vocabulary Image Segmentation
  21. Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs
  22. A General and Efficient Training for Transformer via Token Expansion
  23. Adaptive Feature Selection for No-Reference Image Quality Assessment by Mitigating Semantic Noise Sensitivity
  24. Aligning and Prompting Everything All at Once for Universal Visual Perception
    CVPR 2024 · Yunhang Shen
  25. Cantor: Inspiring Multimodal Chain-of-Thought of MLLM
  26. Integrating Global Context Contrast and Local Sensitivity for Blind Image Quality Assessment
  27. Multimodal Inplace Prompt Tuning for Open-set Object Detection
  28. Rethinking Centered Kernel Alignment in Knowledge Distillation
  29. SPD-DDPM: Denoising Diffusion Probabilistic Models in the Symmetric Positive Definite Space
  30. Semi-Supervised Blind Image Quality Assessment through Knowledge Distillation and Incremental Learning
  31. Solving the Catastrophic Forgetting Problem in Generalized Category Discovery
  32. Weakly Supervised Open-Vocabulary Object Detection