PPaperPicks

Yansong Tang

42 papers at tracked venues · 34 at CORE A* · active 20242025

Venues

Frequent coauthors

Papers

  1. ATP-LLaVA: Adaptive Token Pruning for Large Vision Language Models
  2. AnyBimanual: Transferring Unimanual Policy for General Bimanual Manipulation
  3. Coarse Correspondences Boost Spatial-Temporal Reasoning in Multimodal Language Model
  4. DreamLight: Towards Harmonious and Consistent Image Relighting
  5. FADE: Frequency-Aware Diffusion Model Factorization for Video Editing
  6. Flash-Vstream: Efficient Real-Time Understanding for Long Video Streams
  7. GWM: Towards Scalable Gaussian World Models for Robotic Manipulation
  8. InstaRevive: One-Step Image Enhancement via Dynamic Score Matching
  9. IteRPrimE: Zero-shot Referring Image Segmentation with Iterative Grad-CAM Refinement and Primary Word Emphasis
  10. KV-Edit: Training-Free Image Editing for Precise Background Preservation
  11. ManiGaussian++: General Robotic Bimanual Manipulation with Hierarchical Gaussian World Model
  12. Momentum-Gs: Momentum Gaussian Self-Distillation for High-Quality Large Scene Reconstruction
  13. Ponder & Press: Advancing Visual GUI Agent towards General Computer Control
  14. Pseudo Depth Meets Gaussian: A Feed-forward RGB SLAM Baseline
  15. SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes
  16. ScoreHOI: Physically Plausible Reconstruction of Human-Object Interaction via Score-Guided Diffusion
  17. Stepping Out of Similar Semantic Space for Open-Vocabulary Segmentation
  18. ThinkBot: Embodied Instruction Following with Thought Chain Reasoning
  19. VoCo-LLaMA: Towards Vision Compression with Large Language Models
  20. WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct
  21. CoSTA: End-to-End Comprehensive Space-Time Entanglement for Spatio-Temporal Video Grounding
  22. DPMesh: Exploiting Diffusion Prior for Occluded Human Mesh Recovery
  23. FlowIE: Efficient Image Enhancement via Rectified Flow
  24. GaussianCube: A Structured and Explicit Radiance Representation for 3D Generative Modeling
  25. GeoLRM: Geometry-Aware Large Reconstruction Model for High-Quality 3D Gaussian Generation
  26. Learning Dual-Level Deformable Implicit Representation for Real-World Scale Arbitrary Super-Resolution
  27. Learning Multi-Scale Video-Text Correspondence for Weakly Supervised Temporal Article Gronding
  28. MADTP: Multimodal Alignment-Guided Dynamic Token Pruning for Accelerating Vision-Language Transformer
  29. ManiGaussian: Dynamic Gaussian Splatting for Multi-task Robotic Manipulation
  30. MotionLCM: Real-Time Controllable Motion Generation via Latent Consistency Model
  31. Narrative Action Evaluation with Prompt-Guided Multimodal Interaction
  32. Once for Both: Single Stage of Importance and Sparsity Search for Vision Transformer Compression
  33. Open-Vocabulary Segmentation with Semantic-Assisted Calibration
  34. PTM-VQA: Efficient Video Quality Assessment Leveraging Diverse PreTrained Models from the Wild
  35. Plan, Posture and Go: Towards Open-Vocabulary Text-to-Motion Generation
  36. Post-training Quantization with Progressive Calibration and Activation Relaxing for Text-to-Image Diffusion Models
  37. Q-VLM: Post-training Quantization for Large Vision-Language Models
  38. RodinHD: High-Fidelity 3D Avatar Generation with Diffusion Models
  39. Segment and Caption Anything
  40. Towards Accurate Post-Training Quantization for Diffusion Models
  41. Universal Segmentation at Arbitrary Granularity with Language Instruction
  42. WizardArena: Post-training Large Language Models via Simulated Offline Chatbot Arena