PPaperPicks

Salman H. Khan

Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, UAE

78 papers at tracked venues · 49 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. A Multi-Agent Diffusion Approach for MRI Anomaly Segmentation via Modality-Specific LoRA Specialization
  2. Bring Your Dreams to Life: Continual Text-to-Video Customization
  3. CASS: Nvidia to AMD Transpilation with Data, Models, and Benchmark
  4. DuwatBench: Bridging Language and Visual Heritage through an Arabic Calligraphy Benchmark for Multimodal Understanding
  5. GCA Framework: A GCC Countries-Grounded Dataset and Agentic Pipeline for Climate Decision Support
  6. MedROV: Towards Real-Time Open-Vocabulary Detection Across Diverse Medical Imaging Modalities
  7. Paper Circle: An Open-source Multi-agent Research Discovery and Analysis Framework
  8. A Culturally-diverse Multilingual Multimodal Video Benchmark & Model
  9. AdaIR: Adaptive All-in-One Image Restoration via Frequency Mining and Modulation
  10. AirCast: Improving Air Pollution Forecasting Through Multi-Variable Data Alignment
  11. All Languages Matter: Evaluating LMMs on Culturally Diverse 100 Languages
  12. Aurelia: Test-Time Reasoning Distillation in Audio-Visual LLMs
  13. Beyond Simple Edits: Composed Video Retrieval with Dense Modifications
  14. BiMediX2 : Bio-Medical EXpert LMM for Diverse Medical Modalities
  15. CAMEL-Bench: A Comprehensive Arabic LMM Benchmark
  16. COSNet: A Novel Semantic Segmentation Network using Enhanced Boundaries in Cluttered Scenes
  17. DEFT: Decompositional Efficient Fine-Tuning for Text-to-Image Models
  18. DriveLMM-o1: A Step-by-Step Reasoning Dataset and Large Multimodal Model for Driving Scenario Understanding
  19. EarthDial: Turning Multi-sensory Earth Observations to Interactive Dialogues
  20. Efficient Video Object Segmentation via Modulated Cross-Attention Memory
  21. Enhancing Novel Object Detection via Cooperative Foundational Models
  22. Fann or Flop: A Multigenre, Multiera Benchmark for Arabic Poetry Understanding in LLMs
  23. GEOBench-VLM: Benchmarking Vision-Language Models for Geospatial Tasks
  24. GenZSL: Generative Zero-Shot Learning Via Inductive Variational Autoencoder
  25. GeoPixel: Pixel Grounding Large Multimodal Model in Remote Sensing
  26. GroupMamba: Efficient Group-Based Visual State Space Model
  27. Hierarchical Self-supervised Adversarial Training for Robust Vision Models in Histopathology
  28. Hierarchical Visual Prompt Learning for Continual Video Instance Segmentation
  29. How Good is my Video-LMM? Complex Video Reasoning and Robustness Evaluation Suite for Video-LMMs
  30. Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model
  31. KITAB-Bench: A Comprehensive Multi-Domain Benchmark for Arabic OCR and Document Understanding
  32. LLMVoX: Autoregressive Streaming Text-to-Speech Model for Any LLM
  33. LawDIS: Language-Window-Based Controllable Dichotomous Image Segmentation
  34. LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs
  35. MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks
  36. MAviS: A Multimodal Conversational Assistant For Avian Species
  37. MPromer: A Unified Diffusion-Based Framework for Scalable and Generalizable Multi-Modal Medical Image Segmentation
  38. O-TPT: Orthogonality Constraints for Calibrating Test-time Prompt Tuning in Vision-Language Models
  39. On the Importance of Language-driven Representation Learning for Heterogeneous Federated Learning
  40. Open-YOLO 3D: Towards Fast and Accurate Open-Vocabulary 3D Instance Segmentation
    ICLR 2025 ·
    Mohamed El Amine Boudjoghra
  41. Open3DTrack: Towards Open-Vocabulary 3D Multi-Object Tracking
  42. Palo: A Polyglot Large Multimodal Model for 5B People
  43. PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding
  44. Promptception: How Sensitive Are Large Multimodal Models to Prompts?
    EMNLP 2025 ·
    Mohamed Insaf Ismithdeen
  45. SPARTA: Spectral Prompt Agnostic Adversarial Attack on Medical Vision-Language Models
  46. TAViS: Text-bridged Audio-Visual Segmentation with Foundation Models
  47. Time Travel: A Comprehensive Benchmark to Evaluate LMMs on Historical and Cultural Artifacts
  48. Towards Evaluating the Robustness of Visual State Space Models
  49. VANE-Bench: Video Anomaly Evaluation Benchmark for Conversational LMMs
  50. VQA4CIR: Boosting Composed Image Retrieval with Visual Question Answering
  51. VideoGLaMM : A Large Multimodal Model for Pixel-Level Visual Grounding in Videos
  52. Vocabulary-Free Fine-Grained Visual Recognition via Enriched Contextually Grounded Vision-Language Model
  53. A New Perspective to Boost Performance Fairness For Medical Federated Learning
  54. BAPLe: Backdoor Attacks on Medical Foundational Models Using Prompt Learning
  55. BiMediX: Bilingual Medical Mixture of Experts LLM
  56. Bidirectional Reciprocative Information Communication for Few-Shot Semantic Segmentation
  57. CONDA: Condensed Deep Association Learning for Co-salient Object Detection
  58. Composed Video Retrieval via Enriched Context and Discriminative Embeddings
  59. Continual Learning and Unknown Object Discovery in 3D Scenes via Self-distillation
    ECCV 2024 ·
    Mohamed El Amine Boudjoghra
  60. Cross-Modal Self-Training: Aligning Images and Pointclouds to learn Classification without Labels
  61. Efficient 3D-Aware Facial Image Editing via Attribute-Specific Prompt Learning
  62. GLaMM: Pixel Grounding Large Multimodal Model
  63. GeoChat: Grounded Large Vision-Language Model for Remote Sensing
  64. Hierarchical Text-to-Vision Self Supervised Alignment for Improved Histopathology Representation Learning
  65. How to Continually Adapt Text-to-Image Diffusion Models for Flexible Customization?
  66. LLM Blueprint: Enabling Text-to-Image Generation with Complex and Detailed Prompts
  67. Long-Tailed 3D Semantic Segmentation with Adaptive Weight Constraint and Sampling
  68. MedContext: Learning Contextual Cues for Efficient Volumetric Medical Segmentation
  69. Modulate Your Spectrum in Self-Supervised Learning
  70. On Evaluating Adversarial Robustness of Volumetric Medical Segmentation Models
  71. Open-Vocabulary Temporal Action Localization using Multimodal Guidance
  72. Progressive Semantic-Guided Vision Transformer for Zero-Shot Learning
  73. Rethinking Transformers Pre-training for Multi-Spectral Satellite Imagery
  74. S3A: Towards Realistic Zero-Shot Classification via Self Structural Semantic Alignment
  75. Sentence-level Prompts Benefit Composed Image Retrieval
  76. Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models
  77. VideoGrounding-DINO: Towards Open-Vocabulary Spatio- Temporal Video Grounding
  78. Visual-Augmented Dynamic Semantic Prototype for Generative Zero-Shot Learning