PPaperPicks

Shiliang Zhang

30 papers at tracked venues · 23 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. SCAN: Self-Calibrated AutoregressioN for High-Quality Visual Generation
  2. When Person Re-Identification Meets Event Camera: A Benchmark Dataset and an Attribute-Guided Re-Identification Framework
  3. Differentiable Reward Optimization for LLM based TTS system
  4. Efficient Multi-modal Long Context Learning for Training-free Adaptation
  5. EmoVoice: LLM-based Emotional Text-To-Speech Model with Freestyle Text Prompting
  6. Exploring SSL Discrete Speech Features for Zipformer-based Contextual ASR
  7. Generalizable Object Keypoint Localization from Generative Priors
  8. HDCFN: Haze Distribution-aware Cross-modal Fusion Network for Infrared-guided Dense Haze Removal in UAVs
  9. MV-VTON: Multi-View Virtual Try-On with Diffusion Models
  10. MagCache: Fast Video Generation with Magnitude-Aware Cache
  11. NN-Former: Rethinking Graph Structure in Neural Architecture Representation
  12. OmniAudio: Generating Spatial Audio from 360-Degree Video
  13. OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation
  14. Speech Recognition Meets Large Language Model: Benchmarking, Models, and Exploration
  15. UniCodec: Unified Audio Codec with Single Domain-Adaptive Codebook
  16. UniSpeaker: A Unified Approach for Multimodality-driven Speaker Generation
  17. Unified Visual Generation via Next-Set Prediction in Continuous Domain
  18. CoTuning: A Large-Small Model Collaborating Distillation Framework for Better Model Generalization
  19. Decoupled Contrastive Learning for Long-Tailed Recognition
  20. Decoupled Optimisation for Long-Tailed Visual Recognition
  21. ERes2NetV2: Boosting Short-Duration Speaker Verification Performance with Computational Efficiency
  22. Incorporating Class-based Language Model for Named Entity Recognition in Factorized Neural Transducer
  23. LocLLM: Exploiting Generalizable Human Keypoint Localization via Large Language Model
  24. MaLa-ASR: Multimedia-Assisted LLM-Based ASR
  25. OVMR: Open-Vocabulary Recognition with Multi-Modal References
  26. Personality-memory Gated Adaptation: An Efficient Speaker Adaptation for Personalized End-to-end Automatic Speech Recognition
  27. Pink: Unveiling the Power of Referential Comprehension for Multi-modal LLMs
  28. Recognizing Ultra-High-Speed Moving Objects with Bio-Inspired Spike Camera
  29. Spatial-Aware Regression for Keypoint Localization
  30. emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation