PPaperPicks

Hyunwoo J. Kim

University of Wisconsin-Madison, Department of Computer Sciences, WI, USA

31 papers at tracked venues · 26 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Improving Large Molecular Language Model via Relation-aware Multimodal Collaboration
  2. Relevance-aware Multi-context Contrastive Decoding for Retrieval-augmented Visual Question Answering
  3. TabFlash: Efficient Table Understanding with Progressive Question Conditioning and Token Focusing
  4. Transferable Model-agnostic Vision-Language Model Adaptation for Efficient Weak-to-Strong Generalization
  5. Bidirectional Likelihood Estimation with Multi-Modal Large Language Models for Text-Video Retrieval
  6. Blockwise Flow Matching: Improving Flow Matching Models For Efficient High-Quality Generation
  7. Captioning for Text-Video Retrieval via Dual-Group Direct Preference Optimization
  8. DeepVideo-R1: Video Reinforcement Fine-Tuning via Difficulty-aware Regressive GRPO
  9. EfficientViM: Efficient Vision Mamba with Hidden State Mixer based State Space Duality
  10. Latent Bayesian Optimization via Autoregressive Normalizing Flows
  11. LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding
  12. Multidimensional Adaptive Coefficient for Inference Trajectory Optimization in Flow and Diffusion
  13. PRESTO: Preimage-Informed Instruction Optimization for Prompting Black-Box LLMs
  14. Representation Shift: Unifying Token Compression with Flashattention
  15. Super-Class Guided Transformer for Zero-Shot Attribute Classification
  16. VidChain: Chain-of-Tasks with Metric-based Direct Preference Optimization for Dense Video Captioning
  17. Visual Diversity and Region-aware Prompt Learning for Zero-shot HOI Detection
  18. When Model Knowledge meets Diffusion Model: Diffusion-assisted Data-free Image Synthesis with Alignment of Domain and Class
  19. Constant Acceleration Flow
  20. DDMI: Domain-agnostic Latent Diffusion Models for Synthesizing High-Quality Implicit Neural Representations
  21. Diffusion Prior-Based Amortized Variational Inference for Noisy Inverse Problems
  22. Generative Subgraph Retrieval for Knowledge Graph-Grounded Dialog Generation
  23. Groupwise Query Specialization and Quality-Aware Multi-Assignment for Transformer-Based Visual Relationship Detection
  24. Inversion-based Latent Bayesian Optimization
  25. LLaMo: Large Language Model-based Molecular Graph Assistant
  26. Multi-Criteria Token Fusion with One-Step-Ahead Attention for Efficient Vision Transformers
  27. Prompt Learning via Meta-Regularization
  28. Retrieval-Augmented Open-Vocabulary Object Detection
  29. Stochastic Conditional Diffusion Models for Robust Semantic Image Synthesis
  30. Understanding Multi-compositional Learning in Vision and Language Models via Category Theory
    ECCV 2024 ·
    Sotirios Panagiotis Chytas
  31. vid-TLDR: Training Free Token merging for Light-Weight Video Transformer