PPaperPicks

Zhe Gan

20 papers at tracked venues · 15 at CORE A* · active 20242025

Venues

Frequent coauthors

Papers

  1. Contrastive Localized Language-Image Pre-Training
  2. Ferret-UI 2: Mastering Universal User Interface Understanding Across Platforms
  3. From Multimodal LLMs to Generalist Embodied Agents: Methods and Lessons
  4. Improve Vision Language Model Chain-of-thought Reasoning
  5. MIA-Bench: Towards Better Instruction Following Evaluation of Multimodal LLMs
  6. MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning
  7. MMEgo: Towards Building Egocentric Multimodal LLMs for Video QA
  8. Multimodal Autoregressive Pre-training of Large Vision Encoders
  9. Proactive Pseudo-Intervention: Pre-informed Contrastive Learning For Interpretable Vision Models
  10. Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models
  11. UniVG: A Generalist Diffusion Model for Unified Image Generation and Editing
  12. Compressing LLMs: The Truth is Rarely Pure and Never Simple
  13. Diagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation
  14. Ferret-UI: Grounded Mobile UI Understanding with Multimodal LLMs
  15. Ferret: Refer and Ground Anything Anywhere at Any Granularity
  16. GRiT: A Generative Region-to-Text Transformer for Object Understanding
  17. Guiding Instruction-based Image Editing via Multimodal Large Language Models
  18. MM1: Methods, Analysis and Insights from Multimodal LLM Pre-training
  19. Pre-trained Language Models Do Not Help Auto-regressive Text-to-Image Generation
  20. VeCLIP: Improving CLIP Training via Visual-Enriched Captions