PPaperPicks

Yupeng Hu

Shandong University, Jinan, China

25 papers at tracked venues · 24 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. D2MoRA: Diversity-Regulated Asymmetric MoE-LoRA Decomposition for Efficient Multi-Task Adaptation
  2. Decompose and Conquer: Compositional Reasoning for Zero-Shot Temporal Action Localization
  3. From Interference to Stability: Adversarial Reliability Correction for Video Moment Retrieval with Relevance Feedback
  4. HABIT: Chrono-Synergia Robust Progressive Learning Framework for Composed Image Retrieval
  5. INTENT: Invariance and Discrimination-aware Noise Mitigation for Robust Composed Image Retrieval
  6. Omni-R1: Towards the Unified Generative Paradigm for Multimodal Reasoning
  7. ReTrack: Evidence-Driven Dual-Stream Directional Anchor Calibration Network for Composed Video Retrieval
  8. Reasoning in the Dark: Interleaved Vision-Text Reasoning in Latent Space
  9. Resonating with RoPE: Spectral Quantization for High-Fidelity Key Cache Compression
  10. StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval
  11. TEMA: Anchor the Image, Follow the Text for Multi-Modification Composed Image Retrieval
  12. CoRe-MMRAG: Cross-Source Knowledge Reconciliation for Multimodal RAG
  13. Content-aware Balanced Spectrum Encoding in Masked Modeling for Time Series Classification
  14. DCount: Decoupled Spatial Perception and Attribute Discrimination for Referring Expression Counting
  15. ENCODER: Entity Mining and Modification Relation Binding for Composed Image Retrieval
  16. FiRE: Enhancing MLLMs with Fine-Grained Context Learning for Complex Image Retrieval
  17. Gaming for Boundary: Elastic Localization for Frame-Supervised Video Moment Retrieval
  18. HUD: Hierarchical Uncertainty-Aware Disambiguation Network for Composed Video Retrieval
  19. OFFSET: Segmentation-based Focus Shift Revision for Composed Image Retrieval
  20. Towards Stable and Storage-efficient Dataset Distillation: Matching Convexified Trajectory
  21. Breaking Barriers of System Heterogeneity: Straggler-Tolerant Multimodal Federated Learning via Knowledge Distillation
  22. Explicit Granularity and Implicit Scale Correspondence Learning for Point-Supervised Video Moment Localization
  23. Exploiting the Social-Like Prior in Transformer for Visual Reasoning
  24. Fine-grained Textual Inversion Network for Zero-Shot Composed Image Retrieval
  25. Revisiting Unsupervised Temporal Action Localization: The Primacy of High-Quality Actionness and Pseudolabels