PPaperPicks

Xinxiao Wu

9 papers at tracked venues · 7 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. TongUI: Internet-Scale Trajectories from Multimodal Web Tutorials for Generalized GUI Agents
  2. What to Trust? A Trust-aware Knowledge-guided Method for Zero-shot Object State Understanding in Videos
  3. LLM-Enhanced Action-Aware Multi-Modal Prompt Tuning for Image-Text Matching
  4. METOR: A Unified Framework for Mutual Enhancement of Objects and Relationships in Open-vocabulary Video Visual Relationship Detection
  5. Storyboard-guided Alignment for Fine-grained Video Action Recognition
  6. Video Summarization Using Denoising Diffusion Probabilistic Model
  7. Event-based Few-shot Fine-grained Human Action Recognition
  8. Multi-Modal Prompting for Open-Vocabulary Video Visual Relationship Detection
  9. Relational Distant Supervision for Image Captioning without Image-Text Pairs