PPaperPicks

Haiyang Xu

Alibaba Group

21 papers at tracked venues · 18 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. AgentOCR: Reimagining Agent History via Optical Self-Compression
  2. Efficient and Effective In-context Demonstration Selection with Coreset
  3. Experience-driven Multi-turn Reinforcement Learning for GUI Agents
  4. Endowing Visual Reprogramming with Adversarial Robustness
  5. Exploiting Presentative Feature Distributions for Parameter-Efficient Continual Learning of Large Language Models
  6. Look Before You Leap: A GUI-Critic-R1 Model for Pre-Operative Error Diagnosis in GUI Automation
  7. SymDPO: Boosting In-Context Learning of Large Multimodal Models with Symbol Demonstration Direct Preference Optimization
  8. Towards Efficient Online Tuning of VLM Agents via Counterfactual Soft Reinforcement Learning
  9. VLM-R³: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought
  10. mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding
  11. mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models
  12. Hal-Eval: A Universal and Fine-grained Hallucination Evaluation Framework for Large Vision Language Models
  13. Hallucination Augmented Contrastive Learning for Multimodal Large Language Model
  14. MIBench: Evaluating Multimodal Large Language Models over Multiple Images
  15. MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
  16. Mobile-Agent-v2: Mobile Device Operation Assistant with Effective Navigation via Multi-Agent Collaboration
  17. TiMix: Text-Aware Image Mixing for Effective Vision-Language Pre-training
  18. TinyChart: Efficient Chart Understanding with Program-of-Thoughts Learning and Visual Token Merging
  19. mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding
  20. mPLUG-OwI2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration
  21. mPLUG-PaperOwl: Scientific Diagram Analysis with the Multimodal Large Language Model