P
PaperPicks
Conferences
Yapeng Tian
27 papers at tracked venues · 22 at CORE A* · active 2024–2026
DBLP profile ↗
ORCID 0000-0003-1423-4513 ↗
Homepage ↗
Venues
CVPR
×6
ICCV
×4
CHI
×3
UIST
×3
AAAI
×2
EMNLP
×2
NeurIPS
×2
ACL
×1
ACM MM
×1
BMVC
×1
NAACL
×1
WACV
×1
Frequent coauthors
Shijian Deng
DBLP profile ↗
ORCID search ↗
×2
Zheng Ning
DBLP profile ↗
ORCID search ↗
×2
Tianyu Yang
DBLP profile ↗
ORCID search ↗
×2
Daniel Killough
DBLP profile ↗
ORCID search ↗
×2
Steven Hogue
DBLP profile ↗
ORCID search ↗
×2
Tanvir Mahmud
DBLP profile ↗
ORCID search ↗
×2
Jia Li
DBLP profile ↗
ORCID search ↗
×1
Ayush Bhardwaj
DBLP profile ↗
ORCID search ↗
×1
Sarthak Kumar Maharana
DBLP profile ↗
ORCID search ↗
×1
Kai Wang
DBLP profile ↗
ORCID search ↗
×1
Andong Deng
DBLP profile ↗
ORCID search ↗
×1
Bing Fan
DBLP profile ↗
ORCID search ↗
×1
Papers
Do Audio-Visual Segmentation Models Truly Segment Sounding Objects?
AAAI 2026
·
Jia Li
DBLP profile ↗
ORCID search ↗
Touch with Meaning: A Contextual Analysis of Social Touch
CHI 2026
·
Ayush Bhardwaj
DBLP profile ↗
ORCID search ↗
Toward Gaze Target Detection of Young Autistic Children
AAAI 2026
·
Shijian Deng
DBLP profile ↗
ORCID search ↗
<tt>AVROBUSTBENCH</tt>: Benchmarking the Robustness of Audio-Visual Recognition Models at Test-Time
NeurIPS 2025
·
Sarthak Kumar Maharana
DBLP profile ↗
ORCID search ↗
AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multimodal Information Between Reality and Videos
UIST 2025
·
Zheng Ning
DBLP profile ↗
ORCID search ↗
AV-DiT: Taming Image Diffusion Transformers for Efficient Joint Audio and Video Generation
ACM MM 2025
·
Kai Wang
DBLP profile ↗
ORCID search ↗
CLIPErase: Efficient Unlearning of Visual-Textual Associations in CLIP
ACL 2025
·
Tianyu Yang
DBLP profile ↗
ORCID search ↗
Demonstration of VRSight: AI-Driven Real-Time Descriptions to Enhance VR Accessibility for Blind People
CHI 2025
·
Daniel Killough
DBLP profile ↗
ORCID search ↗
Introduction to the First Workshop on Vision Foundation Models and Generative AI for Accessibility
ICCV 2025
·
Yapeng Tian
Joint Co-Speech Gesture and Expressive Talking Face Generation Using Diffusion with Adapters
WACV 2025
·
Steven Hogue
DBLP profile ↗
ORCID search ↗
Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel Level
CVPR 2025
·
Andong Deng
DBLP profile ↗
ORCID search ↗
PRVQL: Progressive Knowledge-Guided Refinement for Robust Egocentric Visual Query Localization
ICCV 2025
·
Bing Fan
DBLP profile ↗
ORCID search ↗
Self-Improvement in Multimodal Large Language Models: A Survey
EMNLP 2025
·
Shijian Deng
DBLP profile ↗
ORCID search ↗
SignLLM: Sign Language Production Large Language Models
ICCV 2025
·
Sen Fang
DBLP profile ↗
ORCID search ↗
VRSight: An AI-Driven Scene Description System to Improve Virtual Reality Accessibility for Blind People
UIST 2025
·
Daniel Killough
DBLP profile ↗
ORCID search ↗
VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation
CVPR 2025
·
Saksham Singh Kushwaha
DBLP profile ↗
ORCID search ↗
ZFusion: Efficient Deep Compositional Zero-Shot Learning for Blind Image Super-Resolution with Generative Diffusion Prior
ICCV 2025
·
Alireza Esmaeilzehi
DBLP profile ↗
ORCID search ↗
Benchmarking and Optimizing Federated Learning with Hardware-related Metrics
BMVC 2024
·
Kai Pan
DBLP profile ↗
ORCID search ↗
Continual Audio-Visual Sound Separation
NeurIPS 2024
·
Weiguo Pian
DBLP profile ↗
ORCID search ↗
CookAR: Affordance Augmentations in Wearable AR to Support Kitchen Tool Interactions for People with Low Vision
UIST 2024
·
Jaewook Lee
DBLP profile ↗
ORCID search ↗
DiffTED: One-shot Audio-driven TED Talk Video Generation with Diffusion-based Co-speech Gestures
CVPR 2024
·
Steven Hogue
DBLP profile ↗
ORCID search ↗
MA-AVT: Modality Alignment for Parameter-Efficient Audio-Visual Transformers
CVPR 2024
·
Tanvir Mahmud
DBLP profile ↗
ORCID search ↗
OSCaR: Object State Captioning and State Change Representation
NAACL 2024
·
Nguyen Nguyen
DBLP profile ↗
ORCID search ↗
SPICA: Interactive Video Content Exploration through Augmented Audio Descriptions for Blind or Low-Vision Viewers
CHI 2024
·
Zheng Ning
DBLP profile ↗
ORCID search ↗
SaSR-Net: Source-Aware Semantic Representation Network for Enhancing Audio-Visual Question Answering
EMNLP 2024
·
Tianyu Yang
DBLP profile ↗
ORCID search ↗
T-VSL: Text-Guided Visual Sound Source Localization in Mixtures
CVPR 2024
·
Tanvir Mahmud
DBLP profile ↗
ORCID search ↗
Towards Efficient Audio-Visual Learners via Empowering Pre-trained Vision Transformers with Cross-Modal Adaptation
CVPR 2024
·
Kai Wang
DBLP profile ↗
ORCID search ↗