PPaperPicks

Chris Thomas

Virginia Tech, Blacksburg, VA, USA

16 papers at tracked venues · 10 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Designing Multi-Robot Ground Video Sensemaking with Public Safety Professionals
  2. LAMP: Learning Universal Adversarial Perturbations for Multi-Image Tasks via Pre-trained Models
  3. SoundBreak: A Systematic Study of Audio-Only Adversarial Attacks on Trimodal Models
    ACL 2026 ·
    Aafiya Shamshad Hussain
  4. Advancing Chart Question Answering with Robust Chart Component Recognition
  5. Benchmarking and Mitigating MCQA Selection Bias of Large Vision-Language Models
  6. Flexible-length Text Infilling for Discrete Diffusion Models
  7. Maximal Matching Matters: Preventing Representation Collapse for Robust Cross-Modal Retrieval
  8. Real-Time Ultra-Fine-Grained Surgical Instrument Classification
  9. SteerVLM: Robust Model Control through Lightweight Activation Steering for Vision Language Models
  10. Zero-Shot Fine-Grained Image Classification Using Large Vision-Language Models
  11. Beyond Grounding: Extracting Fine-Grained Event Hierarchies across Modalities
  12. Detecting Multimodal Situations with Insufficient Context and Abstaining from Baseless Predictions
  13. JourneyBench: A Challenging One-Stop Vision-Language Understanding Benchmark of Generated Images
  14. M3D: MultiModal MultiDocument Fine-Grained Inconsistency Detection
  15. MetaSumPerceiver: Multimodal Multi-Document Evidence Summarization for Fact-Checking
  16. Semantic Shield: Defending Vision-Language Models Against Backdooring and Poisoning via Fine-Grained Knowledge Alignment