PPaperPicks

Lijuan Wang

46 papers at tracked venues · 37 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Conditional Text-to-Image Generation with Reference Guidance
  2. Shanks: Simultaneous Hearing and Thinking for Spoken Language Models
  3. Towards Zero-Shot Diabetic Retinopathy Grading: Learning Generalized Knowledge via Prompt-Driven Matching and Emulating
  4. V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models
  5. Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising
  6. ART: Anonymous Region Transformer for Variable Multi-Layer Transparent Image Generation
  7. Audio-Aware Large Language Models as Judges for Speaking Styles
  8. Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
  9. CertainlyUncertain: A Benchmark and Metric for Multimodal Epistemic and Aleatoric Awareness
  10. EditRoom: LLM-parameterized Graph Diffusion for Composable 3D Room Layout Editing
  11. GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?
  12. GenXD: Generating Any 3D and 4D Scenes
  13. ImageGen-CoT: Enhancing Text-to-Image in-context Learning with Chain-of-Thought Reasoning
  14. LiVOS: Light Video Object Segmentation with Gated Linear Matching
  15. MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models
  16. MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos
  17. Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
  18. SITE: Towards Spatial Intelligence Thorough Evaluation
  19. Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension
  20. ShowUI: One Vision-Language-Action Model for GUI Visual Agent
  21. SlowFast-VGen: Slow-Fast Learning for Action-Driven Long Video Generation
  22. SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement
  23. Tuning Timestep-Distilled Diffusion Model Using Pairwise Sample Optimization
  24. VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
  25. ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs
  26. APTPose: Anatomy-aware Pre-Training for 3D Human Pose Estimation
  27. Bring Metric Functions into Diffusion Models
  28. Completing Visual Objects via Bridging Generation and Segmentation
  29. Diagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation
  30. Disco: Disentangled Control for Realistic Human Dance Generation
  31. GRiT: A Generative Region-to-Text Transformer for Object Understanding
  32. IDOL: Unified Dual-Modal Latent Diffusion for Human-Centric Joint Video-Depth Generation
  33. Idea2Img: Iterative Self-refinement with GPT-4V for Automatic Image Design and Generation
  34. Interfacing Foundation Models' Embeddings
  35. Leveraging Visual Tokens for Extended Text Contexts in Multi-Modal Learning
  36. MM-Narrator: Narrating Long-form Videos with Multimodal In-Context Learning
  37. MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
  38. MMSum: A Dataset for Multimodal Summarization and Thumbnail Generation of Videos
  39. Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning
  40. Motion Consistency Model: Accelerating Video Diffusion with Disentangled Motion-Appearance Distillation
  41. ORES: Open-Vocabulary Responsible Visual Synthesis
  42. OpenLEAF: A Novel Benchmark for Open-Domain Interleaved Image-Text Generation
  43. Segment and Caption Anything
  44. StrokeNUWA - Tokenizing Strokes for Vector Graphic Synthesis
  45. Training Diffusion Models Towards Diverse Image Generation with Reinforcement Learning
  46. VideoGUI: A Benchmark for GUI Automation from Instructional Videos