PPaperPicks

Jialong Zuo

23 papers at tracked venues · 19 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Learning to Tell Apart: Weakly Supervised Video Anomaly Detection via Disentangled Semantic Alignment
  2. CART: A Generative Cross-Modal Retrieval Framework With Coarse-To-Fine Semantic Modeling
  3. ControlSpeech: Towards Simultaneous and Independent Zero-shot Speaker Cloning and Zero-shot Language Style Control
  4. GTA: Towards Generative Text-To-Audio Retrieval via Multi-Scale Tokenizer
  5. Holmes-VAU: Towards Long-term Video Anomaly Understanding at Any Granularity
  6. L-Man: A Large Multi-modal Model Unifying Human-centric Tasks
    AAAI 2025 · Jialong Zuo
  7. Language-Codec: Bridging Discrete Codec Representations and Speech Language Models
  8. MelRe: Vision-Based Mel-Spectrogram Restoration
  9. OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup
  10. Partial Forward Blocking: A Novel Data Pruning Paradigm for Lossless Training Acceleration
  11. ReID5o: Achieving Omni Multi-modal Person Re-identification in a Single Model
    NeurIPS 2025 · Jialong Zuo
  12. Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching
    ACL 2025 · Jialong Zuo
  13. Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation
  14. Speech Watermarking with Discrete Intermediate Representations
  15. VideoLucy: Deep Memory Backtracking for Long Video Understanding
    NeurIPS 2025 · Jialong Zuo
  16. WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling
  17. AudioVSR: Enhancing Video Speech Recognition with Audio Data
  18. Cross-video Identity Correlating for Person Re-identification Pre-training
    NeurIPS 2024 · Jialong Zuo
  19. MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis
  20. MobileSpeech: A Fast and High-Fidelity Framework for Mobile Zero-Shot Text-to-Speech
  21. PLIP: Language-Image Pre-training for Person Representation Learning
    NeurIPS 2024 · Jialong Zuo
  22. SyncTalklip: Highly Synchronized Lip-Readable Speaker Generation with Multi-Task Learning
  23. UFineBench: Towards Text-based Person Retrieval with Ultra-fine Granularity
    CVPR 2024 · Jialong Zuo