PPaperPicks

Yapeng Tian

27 papers at tracked venues · 22 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Do Audio-Visual Segmentation Models Truly Segment Sounding Objects?
  2. Touch with Meaning: A Contextual Analysis of Social Touch
  3. Toward Gaze Target Detection of Young Autistic Children
  4. <tt>AVROBUSTBENCH</tt>: Benchmarking the Robustness of Audio-Visual Recognition Models at Test-Time
  5. AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multimodal Information Between Reality and Videos
  6. AV-DiT: Taming Image Diffusion Transformers for Efficient Joint Audio and Video Generation
  7. CLIPErase: Efficient Unlearning of Visual-Textual Associations in CLIP
  8. Demonstration of VRSight: AI-Driven Real-Time Descriptions to Enhance VR Accessibility for Blind People
  9. Introduction to the First Workshop on Vision Foundation Models and Generative AI for Accessibility
    ICCV 2025 · Yapeng Tian
  10. Joint Co-Speech Gesture and Expressive Talking Face Generation Using Diffusion with Adapters
  11. Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel Level
  12. PRVQL: Progressive Knowledge-Guided Refinement for Robust Egocentric Visual Query Localization
  13. Self-Improvement in Multimodal Large Language Models: A Survey
  14. SignLLM: Sign Language Production Large Language Models
  15. VRSight: An AI-Driven Scene Description System to Improve Virtual Reality Accessibility for Blind People
  16. VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation
  17. ZFusion: Efficient Deep Compositional Zero-Shot Learning for Blind Image Super-Resolution with Generative Diffusion Prior
  18. Benchmarking and Optimizing Federated Learning with Hardware-related Metrics
  19. Continual Audio-Visual Sound Separation
  20. CookAR: Affordance Augmentations in Wearable AR to Support Kitchen Tool Interactions for People with Low Vision
  21. DiffTED: One-shot Audio-driven TED Talk Video Generation with Diffusion-based Co-speech Gestures
  22. MA-AVT: Modality Alignment for Parameter-Efficient Audio-Visual Transformers
  23. OSCaR: Object State Captioning and State Change Representation
  24. SPICA: Interactive Video Content Exploration through Augmented Audio Descriptions for Blind or Low-Vision Viewers
  25. SaSR-Net: Source-Aware Semantic Representation Network for Enhancing Audio-Visual Question Answering
  26. T-VSL: Text-Guided Visual Sound Source Localization in Mixtures
  27. Towards Efficient Audio-Visual Learners via Empowering Pre-trained Vision Transformers with Cross-Modal Adaptation