PPaperPicks

Yiran Zhong

14 papers at tracked venues · 11 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Learning Spatial Decay for Vision Transformers
  2. Deep Non-Rigid Structure-from-Motion Revisited: Canonicalization and Sequence Modeling
  3. Storyboard-guided Alignment for Fine-grained Video Action Recognition
  4. Towards Open-Vocabulary Audio-Visual Event Localization
  5. Tri-Ergon: Fine-Grained Video-to-Audio Generation with Multi-Modal Conditions and LUFS Control
  6. CO2: Efficient Distributed Training with Full Communication-Computation Overlap
  7. Exploring Transformer Extrapolation
  8. Geolocation on Cartographic Maps with Multi-Modal Fusion
  9. Improving Audio-Visual Segmentation with Bidirectional Generation
  10. Label-Anticipated Event Disentanglement for Audio-Visual Video Parsing
  11. MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map
  12. Scaling Laws for Linear Complexity Language Models
  13. TAVGBench: Benchmarking Text to Audible-Video Generation
  14. Various Lengths, Constant Speed: Efficient Language Modeling with Lightning Attention