PPaperPicks

Weidi Xie

34 papers at tracked venues · 24 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Versatile Vision-Language Model for 3D Computed Tomography
  2. A Sanity Check for AI-generated Image Detection
  3. Character-Centric Understanding of Animated Movies
  4. EgoExo-Gen: Ego-centric Video Prediction by Watching Exo-centric Videos
  5. Enhancing Video-LLM Reasoning via Agent-of-Thoughts Distillation
  6. Grounded Multi-Hop VideoQA in Long-Form Egocentric Videos
  7. LamRA: Large Multimodal Model as Your Advanced Retrieval Assistant
  8. Learning Streaming Video Representation via Multitask Training
  9. M3Builder: A Multi-agent System for Automated Machine Learning in Medical Imaging
  10. MRGen: Segmentation Data Engine for Underrepresented MRI Modalities
  11. Modeling Fine-Grained Hand-Object Dynamics for Egocentric Video Representation Learning
  12. Multi-Agent System for Comprehensive Soccer Understanding
  13. Object-Centric Video Question Answering with Visual Grounding and Referring
  14. RadIR: A Scalable Framework for Multi-grained Medical Image Retrieval via Radiology Report Mining
  15. Shot-by-Shot: Film-Grammar-Aware Training-Free Audio Description Generation
  16. Towards Universal Soccer Video Understanding
  17. Track-On: Transformer-based Online Point Tracking with Memory
  18. Universal Video Temporal Grounding with Generative Multi-modal Large Language Models
  19. A General Protocol to Probe Large Vision Models for 3D Physical Understanding
  20. Amodal Ground Truth and Completion in the Wild
  21. Appearance-Based Refinement for Object-Centric Motion Segmentation
  22. Auto-ACD: A Large-scale Dataset for Audio-Language Representation Learning
  23. AutoAD III: The Prequel - Back to the Pixels
  24. EchoSight: Advancing Visual-Language Models with Wiki Knowledge
  25. Grounded Question-Answering in Long Egocentric Videos
  26. InstaGen: Enhancing Object Detection by Training on Synthetic Dataset
  27. Intelligent Grimm - Open-ended Visual Storytelling via Latent Diffusion Models
  28. Knowledge-Enhanced Visual-Language Pretraining for Computational Pathology
  29. Made to Order: Discovering Monotonic Temporal Changes via Self-supervised Video Ordering
  30. MatchTime: Towards Automatic Soccer Game Commentary Generation
  31. Multi-sentence Grounding for Long-Term Instructional Video
  32. RaTEScore: A Metric for Radiology Report Generation
  33. Retrieval-Augmented Egocentric Video Captioning
  34. VISA: Reasoning Video Object Segmentation via Large Language Models