PPaperPicks

Zhengyuan Yang

41 papers at tracked venues · 32 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Conditional Text-to-Image Generation with Reference Guidance
  2. Shanks: Simultaneous Hearing and Thinking for Spoken Language Models
  3. TextGround4M: A Prompt-Aligned Dataset for Layout-Aware Text Rendering
  4. V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models
  5. Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising
  6. Audio-Aware Large Language Models as Judges for Speaking Styles
  7. Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
  8. Design2Code: Benchmarking Multimodal Code Generation for Automated Front-End Engineering
  9. EditRoom: LLM-parameterized Graph Diffusion for Composable 3D Room Layout Editing
  10. Elevating Visual Perception in Multimodal LLMs with Visual Embedding Distillation
  11. GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?
  12. GenXD: Generating Any 3D and 4D Scenes
  13. ImageGen-CoT: Enhancing Text-to-Image in-context Learning with Chain-of-Thought Reasoning
  14. LiVOS: Light Video Object Segmentation with Gated Linear Matching
  15. MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos
  16. Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
  17. ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding
  18. SITE: Towards Spatial Intelligence Thorough Evaluation
  19. Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension
  20. ShowUI: One Vision-Language-Action Model for GUI Visual Agent
  21. SlowFast-VGen: Slow-Fast Learning for Action-Driven Long Video Generation
  22. SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement
  23. Tuning Timestep-Distilled Diffusion Model Using Pairwise Sample Optimization
  24. VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
  25. ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs
  26. Bring Metric Functions into Diffusion Models
  27. Diagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation
  28. Disco: Disentangled Control for Realistic Human Dance Generation
  29. GRiT: A Generative Region-to-Text Transformer for Object Understanding
  30. IDOL: Unified Dual-Modal Latent Diffusion for Human-Centric Joint Video-Depth Generation
  31. Idea2Img: Iterative Self-refinement with GPT-4V for Automatic Image Design and Generation
    ECCV 2024 · Zhengyuan Yang
  32. Interfacing Foundation Models' Embeddings
  33. MM-Narrator: Narrating Long-form Videos with Multimodal In-Context Learning
  34. MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
  35. MMSum: A Dataset for Multimodal Summarization and Thumbnail Generation of Videos
  36. Motion Consistency Model: Accelerating Video Diffusion with Disentangled Motion-Appearance Distillation
  37. OpenLEAF: A Novel Benchmark for Open-Domain Interleaved Image-Text Generation
  38. SGFormer: Semantic Graph Transformer for Point Cloud-Based 3D Scene Graph Generation
  39. StrokeNUWA - Tokenizing Strokes for Vector Graphic Synthesis
  40. Training Diffusion Models Towards Diverse Image Generation with Reinforcement Learning
  41. VideoGUI: A Benchmark for GUI Automation from Instructional Videos