P
PaperPicks
Conferences
Tao Jin
Zhejiang University, Hangzhou, China
51 papers at tracked venues · 44 at CORE A* · active 2024–2026
DBLP profile ↗
ORCID 0000-0003-3564-1628 ↗
Homepage ↗
Venues
ACL
×12
ACM MM
×7
CVPR
×5
ICLR
×5
NeurIPS
×5
AAAI
×4
NAACL
×4
ICML
×3
EMNLP
×2
SIGKDD
×2
ICCV
×1
InterSpeech
×1
Frequent coauthors
Zirun Guo
DBLP profile ↗
ORCID search ↗
×7
Zehan Wang
DBLP profile ↗
ORCID search ↗
×5
Xize Cheng
DBLP profile ↗
ORCID search ↗
×4
Wang Lin
DBLP profile ↗
ORCID search ↗
×4
Xiaoda Yang
DBLP profile ↗
ORCID search ↗
×3
Zequn Xie
DBLP profile ↗
ORCID search ↗
×2
Fangming Feng
DBLP profile ↗
ORCID search ↗
×2
Weicai Yan
DBLP profile ↗
ORCID search ↗
×2
Hanting Wang
DBLP profile ↗
ORCID search ↗
×2
Yu Zhang
DBLP profile ↗
ORCID search ↗
×2
Shulei Wang
DBLP profile ↗
ORCID search ↗
×2
Dongjie Fu
DBLP profile ↗
ORCID search ↗
×2
Papers
Bridging the Pose-Semantic Gap: A Cascade Framework for Text-Based Person Anomaly Search
ACL 2026
·
Zequn Xie
DBLP profile ↗
ORCID search ↗
DPDV: Dual-Pathway and Dual-View Representation Learning for Bridging Information Asymmetry in Text-Video Retrieval
ACL 2026
·
Zequn Xie
DBLP profile ↗
ORCID search ↗
Generative-to-Discriminative Test-Time Adaptation via Manifold-Aware Diffusion and Bayesian Distillation
ACL 2026
·
Boyun Zhang
DBLP profile ↗
ORCID search ↗
Rectifying the Emotional Flow: Aligning Priors and Dynamic Guidance for High-Arousal Text-to-Speech
ACL 2026
·
Fangming Feng
DBLP profile ↗
ORCID search ↗
SAME: Signer-Aware Mixture-of-Experts for Test-Time Adaptation in Sign Language Translation
ACL 2026
·
Lujia Yang
DBLP profile ↗
ORCID search ↗
Scene-Aware Spatiotemporal Generalization: Towards Robust Temporal Action Detection Across Domains
AAAI 2026
·
Fangming Feng
DBLP profile ↗
ORCID search ↗
View-R1: Asymmetric Policy Optimization for Difficulty-Aware Multimodal Reinforcement Learning
ACL 2026
·
Minjie Hong
DBLP profile ↗
ORCID search ↗
A Wander Through the Multimodal Landscape: Efficient Transfer Learning via Low-rank Sequence Multimodal Adapter
AAAI 2025
·
Zirun Guo
DBLP profile ↗
ORCID search ↗
AHa-Bench: Benchmarking Audio Hallucinations in Large Audio-Language Models
NeurIPS 2025
·
Xize Cheng
DBLP profile ↗
ORCID search ↗
Bridging the Gap for Test-Time Multimodal Sentiment Analysis
AAAI 2025
·
Zirun Guo
DBLP profile ↗
ORCID search ↗
ConceptGuard: Continual Personalized Text-to-Image Generation with Forgetting and Confusion Mitigation
CVPR 2025
·
Zirun Guo
DBLP profile ↗
ORCID search ↗
Data-Efficiently Learn Large Language Model for Universal 3D Scene Perception
NAACL 2025
·
Zehan Wang
DBLP profile ↗
ORCID search ↗
Diff-Prompt: Diffusion-Driven Prompt Generator with Mask Supervision
ICLR 2025
·
Weicai Yan
DBLP profile ↗
ORCID search ↗
Efficient Prompting for Continual Adaptation to Missing Modalities
NAACL 2025
·
Zirun Guo
DBLP profile ↗
ORCID search ↗
IRBridge: Solving Image Restoration Bridge with Pre-trained Generative Diffusion Models
ICML 2025
·
Hanting Wang
DBLP profile ↗
ORCID search ↗
ISDrama: Immersive Spatial Drama Generation through Multimodal Prompting
ACM MM 2025
·
Yu Zhang
DBLP profile ↗
ORCID search ↗
Multimodal Conditional Retrieval with High Controllability
SIGKDD 2025
·
Xiaoda Yang
DBLP profile ↗
ORCID search ↗
Non-Natural Image Understanding with Advancing Frequency-based Vision Encoders
CVPR 2025
·
Wang Lin
DBLP profile ↗
ORCID search ↗
Omni-Chart-600K: A Comprehensive Dataset of Chart Types for Chart Understanding
NAACL 2025
·
Shulei Wang
DBLP profile ↗
ORCID search ↗
OmniBind: Large-scale Omni Multimodal Representation via Binding Spaces
ICLR 2025
·
Zehan Wang
DBLP profile ↗
ORCID search ↗
OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup
ICLR 2025
·
Xize Cheng
DBLP profile ↗
ORCID search ↗
Open-Set Cross Modal Generalization via Multimodal Unified Representation
ICCV 2025
·
Hai Huang
DBLP profile ↗
ORCID search ↗
PACHAT: Persona-Aware Speech Assistant for Multi-party Dialogue
EMNLP 2025
·
Dongjie Fu
DBLP profile ↗
ORCID search ↗
Smoothing the Shift: Towards Stable Test-Time Adaptation under Complex Multimodal Noises
ICLR 2025
·
Zirun Guo
DBLP profile ↗
ORCID search ↗
SpatialCLIP: Learning 3D-aware Image Representations from Spatially Discriminative Language
CVPR 2025
·
Zehan Wang
DBLP profile ↗
ORCID search ↗
Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation
ACM MM 2025
·
Wenrui Liu
DBLP profile ↗
ORCID search ↗
Speech Watermarking with Discrete Intermediate Representations
AAAI 2025
·
Shengpeng Ji
DBLP profile ↗
ORCID search ↗
T2A-Feedback: Improving Basic Capabilities of Text-to-Audio Generation via Fine-grained AI Feedback
ACL 2025
·
Zehan Wang
DBLP profile ↗
ORCID search ↗
TAP: Parameter-efficient Task-Aware Prompting for Adverse Weather Removal
ACM MM 2025
·
Hanting Wang
DBLP profile ↗
ORCID search ↗
TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis
ACL 2025
·
Yu Zhang
DBLP profile ↗
ORCID search ↗
Towards Transformer-Based Aligned Generation with Self-Coherence Guidance
CVPR 2025
·
Shulei Wang
DBLP profile ↗
ORCID search ↗
Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval
InterSpeech 2025
·
Ruofan Hu
DBLP profile ↗
ORCID search ↗
VoxDialogue: Can Spoken Dialogue Systems Understand Information Beyond Words?
ICLR 2025
·
Xize Cheng
DBLP profile ↗
ORCID search ↗
Action Imitation in Common Action Space for Customized Action Image Synthesis
NeurIPS 2024
·
Wang Lin
DBLP profile ↗
ORCID search ↗
AudioVSR: Enhancing Video Speech Recognition with Audio Data
EMNLP 2024
·
Xiaoda Yang
DBLP profile ↗
ORCID search ↗
Boosting Speech Recognition Robustness to Modality-Distortion with Contrast-Augmented Prompts
ACM MM 2024
·
Dongjie Fu
DBLP profile ↗
ORCID search ↗
Calibrating Prompt from History for Continual Vision-Language Retrieval and Grounding
ACM MM 2024
·
Tao Jin
Classifier-guided Gradient Modulation for Enhanced Multimodal Learning
NeurIPS 2024
·
Zirun Guo
DBLP profile ↗
ORCID search ↗
E3: Exploring Embodied Emotion Through A Large-Scale Egocentric Video Dataset
NeurIPS 2024
·
Wang Lin
DBLP profile ↗
ORCID search ↗
EAGER: Two-Stream Generative Recommender with Behavior-Semantic Collaboration
SIGKDD 2024
·
Ye Wang
DBLP profile ↗
ORCID search ↗
Extending Multi-modal Contrastive Representations
NeurIPS 2024
·
Ziang Zhang
DBLP profile ↗
ORCID search ↗
FreeBind: Free Lunch in Unified Multimodal Space via Knowledge Fusion
ICML 2024
·
Zehan Wang
DBLP profile ↗
ORCID search ↗
Low-rank Prompt Interaction for Continual Vision-Language Retrieval
ACM MM 2024
·
Weicai Yan
DBLP profile ↗
ORCID search ↗
MPOD123: One Image to 3D Content Generation Using Mask-Enhanced Progressive Outline-to-Detail Optimization
CVPR 2024
·
Jimin Xu
DBLP profile ↗
ORCID search ↗
Multimodal Prompt Learning with Missing Modalities for Sentiment Analysis and Emotion Recognition
ACL 2024
·
Zirun Guo
DBLP profile ↗
ORCID search ↗
Non-confusing Generation of Customized Concepts in Diffusion Models
ICML 2024
·
Wang Lin
DBLP profile ↗
ORCID search ↗
Prompt-Singer: Controllable Singing-Voice-Synthesis with Natural Language Prompt
NAACL 2024
·
Yongqi Wang
DBLP profile ↗
ORCID search ↗
Rethinking the Multimodal Correlation of Multimodal Sequential Learning via Generalizable Attentional Results Alignment
ACL 2024
·
Tao Jin
SyncTalklip: Highly Synchronized Lip-Readable Speaker Generation with Multi-Task Learning
ACM MM 2024
·
Xiaoda Yang
DBLP profile ↗
ORCID search ↗
TransFace: Unit-Based Audio-Visual Speech Synthesizer for Talking Head Translation
ACL 2024
·
Xize Cheng
DBLP profile ↗
ORCID search ↗
Uni-Dubbing: Zero-Shot Speech Synthesis from Visual Articulation
ACL 2024
·
Songju Lei
DBLP profile ↗
ORCID search ↗