PPaperPicks

Yossi Adi

19 papers at tracked venues · 10 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. LaMI: Augmenting Large Language Models via Late Multi-Image Fusion
  2. StressTest: Can YOUR Speech LM Handle the Stress?
  3. CAFA: A Controllable Automatic Foley Artist
  4. GmSLM : Generative Marmoset Spoken Language Modeling
  5. PAST: Phonetic-Acoustic Speech Tokenizer
  6. Slamming: Training a Speech Language Model on One GPU in a Day
  7. Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation
  8. WhiStress: Enriching Transcriptions with Sentence Stress Detection
  9. A Language Modeling Approach to Diacritic-Free Hebrew TTS
  10. An Independence-promoting Loss for Music Generation with Language Models
  11. Audio Enhancement from Multiple Crowdsourced Recordings: A Simple and Effective Baseline
  12. Discrete Flow Matching
  13. Diverse and Aligned Audio-to-Video Generation via Text-to-Video Model Adaptation
  14. HebDB: a Weakly Supervised Dataset for Hebrew Speech Processing
  15. Layer Collaboration in the Forward-Forward Algorithm
  16. Masked Audio Generation using a Single Non-Autoregressive Transformer
  17. NAST: Noise Aware Speech Tokenization for Speech Language Models
  18. The Interspeech 2024 Challenge on Speech Processing Using Discrete Units
  19. Transformers are Multi-State RNNs