PPaperPicks

Lin Ma

Meituan Inc., Beijing, China

28 papers at tracked venues · 24 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. DBGroup: Dual-Branch Point Grouping for Weakly Supervised 3D Semantic Instance Segmentation
  2. X-SAM: From Segment Anything to Any Segmentation
  3. Affordances-Oriented Planning Using Foundation Models for Continuous Vision-Language Navigation
  4. CO-MOT: Boosting End-to-end Transformer-based Multi-Object Tracking via Coopetition Label Assignment and Shadow Sets
  5. DisTime: Distribution-Based Time Representation for Video Large Language Models
  6. FlexVAR: Flexible Visual Autoregressive Modeling without Residual Prediction
  7. GUIDED: Granular Understanding via Identification, Detection, and Discrimination for Fine-Grained Open-Vocabulary Object Detection
  8. MLLM-Tool: A Multimodal Large Language Model for Tool Agent Learning
  9. RoboTron-Drive: All-in-One Large Multimodal Model for Autonomous Driving
  10. RoboTron-Mani: All-in-One Multimodal Large Model for Robotic Manipulation
  11. RoboTron-Nav: A Unified Framework for Embodied Navigation Integrating Perception, Planning, and Prediction
  12. RoboTron-Sim: Improving Real-World Driving via Simulated Hard-Case
  13. Towards Better & Faster Autoregressive Image Generation: From the Perspective of Entropy
  14. Towards Efficient Foundation Model for Zero-shot Amodal Segmentation
  15. UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding
  16. VITRIX-CLIPIN: Enhancing Fine-Grained Visual Understanding in CLIP via Instruction-Editing Data and Long Captions
  17. VITRIX-UniViTAR: Unified Vision Transformer with Native Resolution
  18. 3D Weakly Supervised Semantic Segmentation with 2D Vision-Language Guidance
  19. AlignSAM: Aligning Segment Anything Model to Open Context via Reinforcement Learning
  20. Aux-NAS: Exploiting Auxiliary Labels with Negligibly Extra Inference Cost
  21. ColNeRF: Collaboration for Generalizable Sparse Input Neural Radiance Field
  22. InstaGen: Enhancing Object Detection by Training on Synthetic Dataset
  23. Instance-Aware Multi-Camera 3D Object Detection with Structural Priors Mining and Self-Boosting Learning
  24. LESS: Label-Efficient and Single-Stage Referring 3D Segmentation
  25. Lumen: Unleashing Versatile Vision-Centric Capabilities of Large Multimodal Models
  26. Making Large Language Models Better Planners with Reasoning-Decision Alignment
  27. Misalignment-Robust Frequency Distribution Loss for Image Transformation
  28. UniMD: Towards Unifying Moment Retrieval and Temporal Action Detection