PPaperPicks

Zhuowen Tu

University of California, San Diego, USA

24 papers at tracked venues · 17 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. AuthGuard: Generalizable Deepfake Detection via Language Guidance
  2. CVP: Central-Peripheral Vision-Inspired Multimodal Model for Spatial Reasoning
  3. Gaussian Swaying ⚑: Surface-Based Framework for Aerodynamic Simulation with 3D Gaussians
  4. DepR: Depth Guided Single-View Scene Reconstruction with Instance-Level Diffusion
  5. Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels
  6. Lay-Your-Scene: Natural Scene Layout Generation with Diffusion Transformers
  7. OverLayBench: A Benchmark for Layout-to-Image Generation with Dense Overlaps
  8. Salient Concept-Aware Generative Data Augmentation
  9. YOLO-Count: Differentiable Object Counting for Text-to-Image Generation
  10. AffordanceLLM: Grounding Affordance from Vision Language Models
  11. BLIVA: A Simple Multimodal LLM for Better Handling of Text-Rich Visual Questions
  12. Bayesian Diffusion Models for 3D Shape Reconstruction
  13. DocKD: Knowledge Distillation from LLMs for Open-World Document Understanding Models
  14. Dolfin: Diffusion Layout Transformers Without Autoencoder
  15. Enhancing Vision-Language Pre-Training with Rich Supervisions
  16. HOIDiffusion: Generating Realistic 3D Hand-Object Interaction Data
  17. Non-autoregressive Sequence-to-Sequence Vision-Language Models
  18. OmniControlNet: Dual-stage Integration for Conditional Image Generation
  19. On the Scalability of Diffusion-based Text-to-Image Generation
  20. Open-World Dynamic Prompt and Continual Visual Representation Learning
  21. Patched Denoising Diffusion Models For High-Resolution Image Synthesis
  22. Restoration by Generation with Constrained Priors
  23. TokenCompose: Text-to-Image Diffusion with Token-Level Supervision
  24. When Is Multilinguality a Curse? Language Modeling for 250 High- and Low-Resource Languages