PPaperPicks

Limin Wang

Nanjing University, State Key Laboratory for Novel Software Technology, China

49 papers at tracked venues · 42 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Flowing Backwards: Improving Normalizing Flows via Reverse Representation Alignment
  2. VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning
  3. Bootstrapping Language-Guided Navigation Learning with Self-Refining Data Flywheel
  4. CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding
  5. Contextual AD Narration with Interleaved Multimodal Sequence
  6. Differentiable Solver Search for Fast Diffusion Sampling
  7. Eagle 2.5: Boosting Long-Context Post-Training for Frontier Vision-Language Models
  8. LeviTor: 3D Trajectory Oriented Image-to-Video Synthesis
  9. LongVPO: From Anchored Cues to Self-Reasoning for Long-Form Video Preference Optimization
  10. MUVR: A Multi-Modal Untrimmed Video Retrieval Benchmark with Multi-Level Visual Correspondence
  11. Make Your Training Flexible: Towards Deployment-Efficient Video Models
  12. MobileViCLIP: An Efficient Video-Text Model for Mobile Devices
  13. Modeling Fine-Grained Hand-Object Dynamics for Egocentric Video Representation Learning
  14. MotionRAG: Motion Retrieval-Augmented Image-to-Video Generation
  15. Multiple Object Tracking as ID Prediction
  16. Online Video Understanding: OVBench and VideoChat-Online
  17. SPA: 3D Spatial-Awareness Enables Effective Embodied Representation
  18. Scalable Image Tokenization with Index Backpropagation Quantization
  19. Stochastic Layer-Wise Shuffle for Improving Vision Mamba Training
  20. StreamForest: Efficient Online Video Understanding with Persistent Event Memory
  21. Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment
  22. TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
  23. Tra-MoE: Learning Trajectory Prediction Model from Multiple Domains for Adaptive Policy Conditioning
  24. VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos
  25. VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative Perception
  26. p-MoD: Building Mixture-of-Depths MLLMs via Progressive Ratio Decay
  27. AWT: Transferring Vision-Language Models via Augmentation, Weighting, and Transportation
  28. Accelerating Image Generation with Sub-path Linear Approximation Model
  29. Adapting Short-Term Transformers for Action Detection in Untrimmed Videos
  30. Asymmetric Masked Distillation for Pre-Training Small Foundation Models
  31. BIVDiff: A Training-Free Framework for General-Purpose Video Synthesis via Bridging Image and Video Diffusion Models
  32. Does Video-Text Pretraining Help Open-Vocabulary Online Action Detection?
  33. Dual DETRs for Multi-Label Temporal Action Detection
  34. EgoExoLearn: A Dataset for Bridging Asynchronous Ego- and Exo-centric View of Procedural Activities in Real World
  35. Exploring DCN-like architecture for fast image generation with arbitrary resolution
  36. Fully Sparse 3D Occupancy Prediction
  37. InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation
  38. InternVideo2: Scaling Foundation Models for Multimodal Video Understanding
  39. MVBench: A Comprehensive Multi-modal Video Understanding Benchmark
  40. Scaffold-GS: Structured 3D Gaussians for View-Adaptive Rendering
  41. Sparse Global Matching for Video Frame Interpolation with Large Motion
  42. SparseFormer: Sparse Visual Recognition via Limited Latent Tokens
  43. SportsHHI: A Dataset for Human-Human Interaction Detection in Sports Videos
  44. StableDrag: Stable Dragging for Point-Based Image Editing
  45. The Second Visual Object Tracking Segmentation VOTS2024 Challenge Results
  46. VBench: Comprehensive Benchmark Suite for Video Generative Models
  47. VFIMamba: Video Frame Interpolation with State Space Models
  48. VideoMamba: State Space Model for Efficient Video Understanding
  49. ZeroI2V: Zero-Cost Adaptation of Pre-trained Transformers from Image to Video