PPaperPicks

Kaicheng Yang

DeepGlint, Beijing, China

17 papers at tracked venues · 12 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. UniME-V2: MLLM-as-a-Judge for Universal Multimodal Embedding Learning
  2. ViCToR: Improving Visual Comprehension via Token Reconstruction for Pretraining LMMs
  3. Breaking the Modality Barrier: Universal Embedding Learning with Multimodal LLMs
  4. CLIP-CID: Efficient CLIP Distillation via Cluster-Instance Discrimination
    AAAI 2025 · Kaicheng Yang
  5. Decoupled Global-Local Alignment for Improving Compositional Understanding
  6. Dual-Level Open-Vocabulary 3D Scene Representation for Instance-Aware Robot Navigation
  7. ForCenNet: Foreground-Centric Network for Document Image Rectification
  8. Gradient-Attention Guided Dual-Masking Synergetic Framework for Robust Text-based Person Retrieval
  9. HUST: High-Fidelity Unbiased Skin Tone Estimation via Texture Quantization
  10. ORID: Organ-Regional Information Driven Framework for Radiology Report Generation
  11. RealSyn: An Effective and Scalable Multimodal Interleaved Document Transformation Paradigm
  12. Region-based Cluster Discrimination for Visual Representation Learning
  13. The Solution to the WWW25 Text-based Person Anomaly Search Challenge
  14. UniViT: Unifying Image and Video Understanding in One Vision Encoder
  15. LaPA: Latent Prompt Assist Model for Medical Visual Question Answering
  16. Multi-label Cluster Discrimination for Visual Representation Learning
  17. RWKV-CLIP: A Robust Vision-Language Representation Learner