PPaperPicks

Jun Song

21 papers at tracked venues · 18 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Contribution-aware Token Compression for Efficient Video Understanding via Reinforcement Learning
  2. DeepPhy: Benchmarking Agentic VLMs on Physical Reasoning
  3. Geoparsing: Diagram Parsing for Plane and Solid Geometry with a Unified Formal Language
  4. Global Compression Commander: Plug-and-Play Inference Acceleration for High-Resolution Large Vision-Language Models
  5. How Foundational Skills Influence VLM-based Embodied Agents: A Native Perspective
  6. InquireMobile: Teaching VLM-based Mobile Agent to Request Human Assistance via Reinforcement Fine-Tuning
  7. LLaVA-UHD v2: Exploiting Hierarchical Vision Granularity in MLLMs via Inverse Semantic Pyramid
  8. MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs
  9. MOON: Generative MLLM-based Multimodal Representation Learning for E-commerce Product Understanding
  10. Mobile-R1: Towards Interactive Capability for VLM-Based Mobile Agent via Systematic Training
  11. Unified Thinker: A General Reasoning Core for Image Generation
  12. CombatVLA: An Efficient Vision-Language-Action Model for Combat Tasks in 3D Action Role-Playing Games
  13. LongDocURL: a Comprehensive Multimodal Long Document Benchmark Integrating Understanding, Reasoning, and Locating
  14. Magnus: A Holistic Approach to Data Management for Large-Scale Machine Learning Workloads
    VLDB 2025 · Jun Song
  15. POI Recommendation via Multi-Objective Adversarial Imitation Learning
  16. RLAIF-V: Open-Source AI Feedback Leads to Super GPT-4V Trustworthiness
  17. See the World, Discover Knowledge: A Chinese Factuality Evaluation for Large Vision Language Models
  18. Token Preference Optimization with Self-Calibrated Visual-Anchored Rewards for Hallucination Mitigation
  19. Demystify Mamba in Vision: A Linear Attention Perspective
  20. Enhancing Sufficient Dimension Reduction via Hellinger Correlation
  21. GeoGPT4V: Towards Geometric Multi-modal Large Language Models with Geometric Image Generation