PPaperPicks

Bernard Ghanem

60 papers at tracked venues · 51 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. AVA: Attentive VLM Agent for Mastering StarCraft II
  2. Multimodal Safety Evaluation in Generative Agent Social Simulations
    ACL 2026 ·
    Alhim Adonai Vera Gonzalez
  3. 3D Convex Splatting: Radiance Field Rendering with 3D Smooth Convexes
  4. 4D-Bench: Benchmarking Multi-Modal Large Language Models for 4D Object Understanding
  5. Action Anticipation from SoccerNet Football Video Broadcasts
  6. Adaptive Guidance: Training-free Acceleration of Conditional Diffusion Models
  7. An End-to-End Pipeline for Virtual Banner Replacement in Football Broadcasts
  8. BOLT: Boost Large Vision-Language Model Without Training for Long-form Video Understanding
  9. Behind the Magic, MERLIM: Multi-modal Evaluation Benchmark for Large Image-Language Models
  10. CRAB: Cross-environment Agent Benchmark for Multimodal Language Model Agents
  11. Diffusion-Based Imaginative Coordination for Bimanual Manipulation
  12. Effectiveness of Max-Pooling for Fine-Tuning CLIP on Videos
  13. Enhancing Online Continual Learning with Plug-and-Play State Space Model and Class-Conditional Mixture of Discretization
  14. Exploring Missing Modality in Multimodal Egocentric Datasets
  15. HAMSt3R: Human-Aware Multi-View Stereo 3D Reconstruction
  16. MOLE: Metadata Extraction and Validation in Scientific Papers Using LLMs
  17. MatchDiffusion: Training-Free Generation of Match-Cuts
  18. Mind-the-Glitch: Visual Correspondence for Detecting Inconsistencies in Subject-Driven Generation
  19. OWL: Optimized Workforce Learning for General Multi-Agent Assistance in Real-World Task Automation
  20. OmniResponse: Online Multimodal Conversational Response Generation in Dyadic Interactions
  21. OpenTAD: A Unified Framework and Comprehensive Study of Temporal Action Detection
  22. RMP-SAM: Towards Real-Time Multi-Purpose Segment Anything
  23. ResidualViT for Efficient Temporally Dense Video Encoding
  24. SMILE: Infusing Spatial and Motion Semantics in Masked Video Learning
  25. SynFER: Towards Boosting Facial Expression Recognition With Synthetic Data
  26. Test-Time Adaptation for Combating Missing Modalities in Egocentric Videos
  27. Towards Faster and More Compact Foundation Models for Molecular Property Prediction
  28. UnMix-NeRF: Spectral Unmixing Meets Neural Radiance Fields
  29. Beyond the Premier: Assessing Action Spotting Transfer Capability Across Diverse Domains
  30. Boundary Denoising for Video Activity Localization
  31. Can Large Language Model Agents Simulate Human Trust Behavior?
  32. ColorMAE: Exploring Data-Independent Masking Strategies in Masked AutoEncoders
  33. Continual Learning on a Diet: Learning from Sparsely Labeled Streams Under Constrained Computation
  34. CorDA: Context-Oriented Decomposition Adaptation of Large Language Models for Task-Aware Parameter-Efficient Fine-tuning
  35. DATENeRF: Depth-Aware Text-Based Editing of NeRFs
  36. Dr2Net: Dynamic Reversible Dual-Residual Networks for Memory-Efficient Finetuning
  37. Efficient Image Pre-training with Siamese Cropped Masked Autoencoders
  38. Ego-Exo4D: Understanding Skilled Human Activity from First- and Third-Person Perspectives
  39. End-to-End Temporal Action Detection with 1B Parameters Across 1000 Frames
  40. Evaluation of Test-Time Adaptation Under Computational Time Constraints
  41. FedMedICL: Towards Holistic Evaluation of Distribution Shifts in Federated Medical Imaging
  42. GES: Generalized Exponential Splatting for Efficient Radiance Field Rendering
  43. GenView: Enhancing View Quality with Pretrained Generative Model for Self-Supervised Learning
  44. Look, Listen, and Attack: Backdoor Attacks Against Video Action Recognition
    CVPR 2024 ·
    Hasan Abed Al Kader Hammoud
  45. Magic123: One Image to High-Quality 3D Object Generation Using Both 2D and 3D Diffusion Priors
  46. Model Merging and Safety Alignment: One Bad Model Spoils the Bunch
  47. Multi-Stream Cellular Test-Time Adaptation of Real-Time Models Evolving in Dynamic Environments
  48. On Pretraining Data Diversity for Self-Supervised Learning
    ECCV 2024 ·
    Hasan Abed Al Kader Hammoud
  49. Privacy-Preserving Optics for Enhancing Protection in Face De-Identification
  50. SPAD: Spatially Aware Multi-View Diffusers
  51. SimCS: Simulation for Domain Incremental Online Continual Segmentation
  52. SoccerNet Game State Reconstruction: End-to-End Athlete Tracking and Identification on a Minimap
  53. SoccerNet-Depth: a Scalable Dataset for Monocular Depth Estimation in Sports Videos
  54. SplitNeRF: Split Sum Approximation Neural Field for Joint Geometry, Illumination, and Material Estimation
  55. Towards Automated Movie Trailer Generation
  56. Towards Interpretable Deep Local Learning with Successive Gradient Reconciliation
  57. TrackNeRF: Bundle Adjusting NeRF from Sparse and Noisy Views via Feature Tracks
  58. Tune-an-Ellipse: CLIP Has Potential to Find what you Want
  59. Vivid-ZOO: Multi-View Video Generation with Diffusion Model
  60. X-VARS: Introducing Explainability in Football Refereeing with Multi-Modal Large Language Models