PPaperPicks

Qing-Guo Chen

20 papers at tracked venues · 19 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. LPO: Towards Accurate GUI Agent Interaction via Location Preference Optimization
  2. MirrorCAPTCHA: Wild CAPTCHA, Wild Distribution, Wild Web-based Platform Meet Multimodal LLM Agents
  3. Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding
  4. BooW-VTON: Boosting In-the-Wild Virtual Try-On via Mask-Free Pseudo Data Training
  5. CHATS: Combining Human-Aligned Optimization and Test-Time Sampling for Text-to-Image Generation
  6. Let the LLM Stick to Its Strengths: Learning to Route Economical LLM
  7. Mdp3: a Training-Free Approach for List-Wise Frame Selection in Video-Llms
  8. Meissonic: Revitalizing Masked Generative Transformers for Efficient High-Resolution Text-to-Image Synthesis
  9. Multi-Label Test-Time Adaptation with Bound Entropy Minimization
  10. Multimodal Tabular Reasoning with Privileged Structured Information
  11. Parrot: Multilingual Visual Instruction Tuning
  12. SPACE: Noise Contrastive Estimation Stabilizes Self-Play Fine-Tuning for Large Language Models
  13. TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
  14. Teefusion: Blending Text Embeddings to Distill Classifier-Free Guidance
  15. Triplets Better Than Pairs: Towards Stable and Effective Self-Play Fine-Tuning for LLMs
  16. UNIC-Adapter: Unified Image-instruction Adapter with Multi-modal Transformer for Image Generation
  17. ZooProbe: A Data Engine for Evaluating, Exploring, and Evolving Large-scale Training Data for Multimodal LLMs
  18. Advancing Tool-Augmented Large Language Models: Integrating Insights from Errors in Inference Trees
  19. TAI++: Text as Image for Multi-Label Image Classification by Co-Learning Transferable Prompt
  20. Wings: Learning Multimodal LLMs without Text-only Forgetting