PPaperPicks

Tao Jin

Zhejiang University, Hangzhou, China

51 papers at tracked venues · 44 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Bridging the Pose-Semantic Gap: A Cascade Framework for Text-Based Person Anomaly Search
  2. DPDV: Dual-Pathway and Dual-View Representation Learning for Bridging Information Asymmetry in Text-Video Retrieval
  3. Generative-to-Discriminative Test-Time Adaptation via Manifold-Aware Diffusion and Bayesian Distillation
  4. Rectifying the Emotional Flow: Aligning Priors and Dynamic Guidance for High-Arousal Text-to-Speech
  5. SAME: Signer-Aware Mixture-of-Experts for Test-Time Adaptation in Sign Language Translation
  6. Scene-Aware Spatiotemporal Generalization: Towards Robust Temporal Action Detection Across Domains
  7. View-R1: Asymmetric Policy Optimization for Difficulty-Aware Multimodal Reinforcement Learning
  8. A Wander Through the Multimodal Landscape: Efficient Transfer Learning via Low-rank Sequence Multimodal Adapter
  9. AHa-Bench: Benchmarking Audio Hallucinations in Large Audio-Language Models
  10. Bridging the Gap for Test-Time Multimodal Sentiment Analysis
  11. ConceptGuard: Continual Personalized Text-to-Image Generation with Forgetting and Confusion Mitigation
  12. Data-Efficiently Learn Large Language Model for Universal 3D Scene Perception
  13. Diff-Prompt: Diffusion-Driven Prompt Generator with Mask Supervision
  14. Efficient Prompting for Continual Adaptation to Missing Modalities
  15. IRBridge: Solving Image Restoration Bridge with Pre-trained Generative Diffusion Models
  16. ISDrama: Immersive Spatial Drama Generation through Multimodal Prompting
  17. Multimodal Conditional Retrieval with High Controllability
  18. Non-Natural Image Understanding with Advancing Frequency-based Vision Encoders
  19. Omni-Chart-600K: A Comprehensive Dataset of Chart Types for Chart Understanding
  20. OmniBind: Large-scale Omni Multimodal Representation via Binding Spaces
  21. OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup
  22. Open-Set Cross Modal Generalization via Multimodal Unified Representation
  23. PACHAT: Persona-Aware Speech Assistant for Multi-party Dialogue
  24. Smoothing the Shift: Towards Stable Test-Time Adaptation under Complex Multimodal Noises
  25. SpatialCLIP: Learning 3D-aware Image Representations from Spatially Discriminative Language
  26. Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation
  27. Speech Watermarking with Discrete Intermediate Representations
  28. T2A-Feedback: Improving Basic Capabilities of Text-to-Audio Generation via Fine-grained AI Feedback
  29. TAP: Parameter-efficient Task-Aware Prompting for Adverse Weather Removal
  30. TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis
  31. Towards Transformer-Based Aligned Generation with Self-Coherence Guidance
  32. Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval
  33. VoxDialogue: Can Spoken Dialogue Systems Understand Information Beyond Words?
  34. Action Imitation in Common Action Space for Customized Action Image Synthesis
  35. AudioVSR: Enhancing Video Speech Recognition with Audio Data
  36. Boosting Speech Recognition Robustness to Modality-Distortion with Contrast-Augmented Prompts
  37. Calibrating Prompt from History for Continual Vision-Language Retrieval and Grounding
    ACM MM 2024 · Tao Jin
  38. Classifier-guided Gradient Modulation for Enhanced Multimodal Learning
  39. E3: Exploring Embodied Emotion Through A Large-Scale Egocentric Video Dataset
  40. EAGER: Two-Stream Generative Recommender with Behavior-Semantic Collaboration
  41. Extending Multi-modal Contrastive Representations
  42. FreeBind: Free Lunch in Unified Multimodal Space via Knowledge Fusion
  43. Low-rank Prompt Interaction for Continual Vision-Language Retrieval
  44. MPOD123: One Image to 3D Content Generation Using Mask-Enhanced Progressive Outline-to-Detail Optimization
  45. Multimodal Prompt Learning with Missing Modalities for Sentiment Analysis and Emotion Recognition
  46. Non-confusing Generation of Customized Concepts in Diffusion Models
  47. Prompt-Singer: Controllable Singing-Voice-Synthesis with Natural Language Prompt
  48. Rethinking the Multimodal Correlation of Multimodal Sequential Learning via Generalizable Attentional Results Alignment
    ACL 2024 · Tao Jin
  49. SyncTalklip: Highly Synchronized Lip-Readable Speaker Generation with Multi-Task Learning
  50. TransFace: Unit-Based Audio-Visual Speech Synthesizer for Talking Head Translation
  51. Uni-Dubbing: Zero-Shot Speech Synthesis from Visual Articulation