PPaperPicks

Mubarak Shah

University of Central Florida, Orlando, USA

44 papers at tracked venues · 30 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. GAEA: A Geolocation Aware Conversational Assistant
  2. Jailbreaks as Inference-Time Alignment: A Framework for Understanding Safety Failures in LLMs
  3. SMPRO: Self-Supervised Visual Preference Alignment via Differentiable Multi-Preference Multi-Group Ranking
  4. SafeR-CLIP: Mitigating NSFW Content in Vision-Language Models While Preserving Pre-Trained Knowledge
  5. ViLL-E: Video LLM Embeddings for Retrieval
  6. A Culturally-diverse Multilingual Multimodal Video Benchmark & Model
  7. ALBAR: Adversarial Learning approach to mitigate Biases in Action Recognition
  8. ASTrA: Adversarial Self-supervised Training with Adaptive-Attacks
  9. AdaIR: Adaptive All-in-One Image Restoration via Frequency Mining and Modulation
  10. All Languages Matter: Evaluating LMMs on Culturally Diverse 100 Languages
  11. Beyond Simple Edits: Composed Video Retrieval with Dense Modifications
  12. CoLLM: A Large Language Model for Composed Image Retrieval
  13. Curriculum Direct Preference Optimization for Diffusion and Consistency Models
  14. DEXTER: Diffusion-Guided EXplanations with TExtual Reasoning for Vision Models
  15. DLCR: A Generative Data Expansion Framework via Diffusion for Clothes-Changing Person Re-Id
  16. Enhancing Privacy-Utility Trade-offs to Mitigate Memorization in Diffusion Models
  17. Enhancing Vision-Language Models for Zero-Shot Video Action Recognition via Visual-Textual Refinement and Improved Interpretability
  18. Exploring Local Memorization in Diffusion Models via Bright Ending Attention
  19. From Play to Replay: Composed Video Retrieval for Temporally Fine-Grained Videos
  20. GT-Loc: Unifying When and Where in Images Through a Joint Embedding Space
  21. Intent3D: 3D Object Detection in RGB-D Scans Based on Human Intention
  22. LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs
  23. M-LLM Based Video Frame Selection for Efficient Video Understanding
  24. MGD3 : Mode-Guided Dataset Distillation using Diffusion Models
    ICML 2025 ·
    Jeffrey A. Chan-Santiago
  25. Robin3D Improving 3D Large Language Model via Robust Instruction Tuning
  26. Safety Without Semantic Disruptions: Editing-free Safe Image Generation via Context-preserving Dual Latent Reconstruction
  27. Test-Time Retrieval-Augmented Adaptation for Vision-Language Models
  28. CityGuessr: City-Level Video Geo-Localization on a Global Scale
  29. Composed Video Retrieval via Enriched Context and Discriminative Embeddings
  30. DVANet: Disentangling View and Action Features for Multi-View Action Recognition
  31. FinePseudo: Improving Pseudo-labelling Through Temporal-Alignablity for Semi-supervised Fine-Grained Action Recognition
    ECCV 2024 ·
    Ishan Rajendrakumar Dave
  32. GAReT: Cross-View Video Geolocalization with Adapters and Auto-Regressive Transformers
  33. Multiview Aerial Visual Recognition (MAVREC): Can Multi-View Improve Aerial Visual Perception?
  34. Möbius Transform for Mitigating Perspective Distortions in Representation Learning
  35. No More Shortcuts: Realizing the Potential of Temporal Self-Supervision
    AAAI 2024 ·
    Ishan Rajendrakumar Dave
  36. Open Vocabulary Multi-label Video Classification
  37. PTQ4DiT: Post-training Quantization for Diffusion Transformers
  38. Regulating Model Reliance on Non-robust Features by Smoothing Input Marginal Density
  39. SegVG: Transferring Object Bounding Box to Segmentation for Visual Grounding
  40. Self-Distilled Masked Auto-Encoders are Efficient Video Anomaly Detectors
  41. Sparse Points to Dense Clouds: Enhancing 3D Detection with Limited LiDAR Data
  42. Sync from the Sea: Retrieving Alignable Videos from Large-Scale Datasets
    ECCV 2024 ·
    Ishan Rajendrakumar Dave
  43. VidLA: Video-Language Alignment at Scale
  44. X-Former: Unifying Contrastive and Reconstruction Learning for MLLMs