PPaperPicks

Ming Yan

Alibaba Group, DAMO Academy, Institute of Intelligent Computing, Hangzhou, China

43 papers at tracked venues · 33 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. AgentOCR: Reimagining Agent History via Optical Self-Compression
  2. Efficient and Effective In-context Demonstration Selection with Coreset
  3. Experience-driven Multi-turn Reinforcement Learning for GUI Agents
  4. Incentivizing In-depth Reasoning over Long Contexts with Process Advantage Shaping
  5. MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding
  6. ProFuser: Progressive Fusion of Large Language Models
  7. Scaling External Knowledge Input Beyond Context Windows of LLMs via Multi-Agent Collaboration
  8. Writing-RL: Advancing Long-form Writing via Adaptive Curriculum Reinforcement Learning
  9. A Training-free LLM-based Approach to General Chinese Character Error Correction
  10. AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization
  11. End-to-End Optimization for Multimodal Retrieval-Augmented Generation via Reward Backpropagation
  12. Endowing Visual Reprogramming with Adversarial Robustness
  13. Exploiting Presentative Feature Distributions for Parameter-Efficient Continual Learning of Large Language Models
  14. Intelligent Document Parsing: Towards End-to-end Document Parsing via Decoupled Content Parsing and Layout Grounding
  15. Is Cognition Consistent with Perception? Assessing and Mitigating Multimodal Knowledge Conflicts in Document Understanding
  16. Look Before You Leap: A GUI-Critic-R1 Model for Pre-Operative Error Diagnosis in GUI Automation
  17. Mutual-Taught for Co-adapting Policy and Reward Models
  18. SymDPO: Boosting In-Context Learning of Large Multimodal Models with Symbol Demonstration Direct Preference Optimization
  19. Towards Efficient Online Tuning of VLM Agents via Counterfactual Soft Reinforcement Learning
  20. VLM-R³: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought
  21. WritingBench: A Comprehensive Benchmark for Generative Writing
  22. mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding
  23. mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models
  24. Breaking Barriers of System Heterogeneity: Straggler-Tolerant Multimodal Federated Learning via Knowledge Distillation
  25. Browse and Concentrate: Comprehending Multimodal Content via Prior-LLM Context Fusion
  26. Budget-Constrained Tool Learning with Planning
  27. DiveSound: LLM-Assisted Automatic Taxonomy Construction for Diverse Audio Generation
  28. Enhancing Zero-shot Audio Classification using Sound Attribute Knowledge from Large Language Models
  29. Hal-Eval: A Universal and Fine-grained Hallucination Evaluation Framework for Large Vision Language Models
  30. Hallucination Augmented Contrastive Learning for Multimodal Large Language Model
  31. MIBench: Evaluating Multimodal Large Language Models over Multiple Images
  32. MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
  33. Mobile-Agent-v2: Mobile Device Operation Assistant with Effective Navigation via Multi-Agent Collaboration
  34. Model Composition for Multimodal Large Language Models
  35. PANDA: Preference Adaptation for Enhancing Domain-Specific Abilities of LLMs
  36. Revisiting Unsupervised Temporal Action Localization: The Primacy of High-Quality Actionness and Pseudolabels
  37. Small LLMs Are Weak Tool Learners: A Multi-LLM Agent
  38. SocialBench: Sociality Evaluation of Role-Playing Conversational Agents
  39. TiMix: Text-Aware Image Mixing for Effective Vision-Language Pre-training
  40. TinyChart: Efficient Chart Understanding with Program-of-Thoughts Learning and Visual Token Merging
  41. mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding
  42. mPLUG-OwI2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration
  43. mPLUG-PaperOwl: Scientific Diagram Analysis with the Multimodal Large Language Model