PPaperPicks

Rao Muhammad Anwer

37 papers at tracked venues · 19 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. DuwatBench: Bridging Language and Visual Heritage through an Arabic Calligraphy Benchmark for Multimodal Understanding
  2. MedROV: Towards Real-Time Open-Vocabulary Detection Across Diverse Medical Imaging Modalities
  3. Think Before You Segment: An Object-aware Reasoning Agent for Referring Audio-Visual Segmentation
  4. Adapting In-Domain Few-Shot Segmentation to New Domains Without Source Domain Retraining
  5. AgroGPT : Efficient Agricultural Vision-Language Model with Expert Tuning
  6. All Languages Matter: Evaluating LMMs on Culturally Diverse 100 Languages
  7. All in One: Visual-Description-Guided Unified Point Cloud Segmentation
  8. Beyond Simple Edits: Composed Video Retrieval with Dense Modifications
  9. BiMediX2 : Bio-Medical EXpert LMM for Diverse Medical Modalities
  10. CAMEL-Bench: A Comprehensive Arabic LMM Benchmark
  11. DEFT: Decompositional Efficient Fine-Tuning for Text-to-Image Models
  12. DriveLMM-o1: A Step-by-Step Reasoning Dataset and Large Multimodal Model for Driving Scenario Understanding
  13. Fann or Flop: A Multigenre, Multiera Benchmark for Arabic Poetry Understanding in LLMs
  14. LLMVoX: Autoregressive Streaming Text-to-Speech Model for Any LLM
  15. LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs
  16. MAviS: A Multimodal Conversational Assistant For Avian Species
  17. MIRA: A Novel Framework for Fusing Modalities in Medical RAG
  18. Open-YOLO 3D: Towards Fast and Accurate Open-Vocabulary 3D Instance Segmentation
    ICLR 2025 ·
    Mohamed El Amine Boudjoghra
  19. Open3DTrack: Towards Open-Vocabulary 3D Multi-Object Tracking
  20. Palo: A Polyglot Large Multimodal Model for 5B People
  21. RAGNet: Large-Scale Reasoning-Based Affordance Segmentation Benchmark Towards General Grasping
  22. SPARTA: Spectral Prompt Agnostic Adversarial Attack on Medical Vision-Language Models
  23. TAViS: Text-bridged Audio-Visual Segmentation with Foundation Models
  24. Time Travel: A Comprehensive Benchmark to Evaluate LMMs on Historical and Cultural Artifacts
  25. BAPLe: Backdoor Attacks on Medical Foundational Models Using Prompt Learning
  26. BiMediX: Bilingual Medical Mixture of Experts LLM
  27. Bidirectional Reciprocative Information Communication for Few-Shot Semantic Segmentation
  28. CONDA: Condensed Deep Association Learning for Co-salient Object Detection
  29. Composed Video Retrieval via Enriched Context and Discriminative Embeddings
  30. Continual Learning and Unknown Object Discovery in 3D Scenes via Self-distillation
    ECCV 2024 ·
    Mohamed El Amine Boudjoghra
  31. DB-SAM: Delving into High Quality Universal Medical Image Segmentation
  32. Efficient 3D-Aware Facial Image Editing via Attribute-Specific Prompt Learning
  33. GLaMM: Pixel Grounding Large Multimodal Model
  34. Long-Tailed 3D Semantic Segmentation with Adaptive Weight Constraint and Sampling
  35. Modulate Your Spectrum in Self-Supervised Learning
  36. Rethinking Transformers Pre-training for Multi-Spectral Satellite Imagery
  37. Semi-supervised Open-World Object Detection