PPaperPicks

Wangmeng Zuo

62 papers at tracked venues · 49 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Deblur4DGS: 4D Gaussian Splatting from Blurry Monocular Video
  2. Perceptual Quality Assessment of 3D Gaussian Splatting: A Subjective Dataset and Prediction Metric
  3. RefSTAR: Blind Face Image Restoration with Reference Selection, Transfer, and Reconstruction
  4. VitaGlyph: Vitalizing Artistic Typography with Flexible Dual-branch Diffusion Models
  5. ACE: Anti-Editing Concept Erasure in Text-to-Image Models
  6. BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset
  7. CASP: Consistency-aware Audio-induced Saliency Prediction Model for Omnidirectional Video
  8. DreamPhysics: Learning Physics-Based 3D Dynamics with Video Diffusion Priors
  9. Exposure Bracketing Is All You Need For A High-Quality Image
  10. Federated Residual Low-Rank Adaptation of Large Language Models
  11. FramePainter: Endowing Interactive Image Editing with Video Diffusion Priors
  12. Generative Inbetweening through Frame-wise Conditions-Driven Video Generation
  13. Integrating Visual Interpretation and Linguistic Reasoning for Geometric Problem Solving
  14. LabUtopia: High-Fidelity Simulation and Hierarchical Benchmark for Scientific Embodied Agents
  15. MC2: Multi-concept Guidance for Customized Multi-concept Generation
  16. MIRAGE: Assessing Hallucination in Multimodal Reasoning Chains of MLLM
  17. MV-VTON: Multi-View Virtual Try-On with Diffusion Models
  18. Motion-Aware Adaptive Pixel Pruning for Efficient Local Motion Deblurring
  19. NTIRE 2025 Challenge on Real-World Face Restoration: Methods and Results
  20. On the Importance of Language-driven Representation Learning for Heterogeneous Federated Learning
  21. Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
  22. QR-LoRA: Efficient and Disentangled Fine-Tuning via QR Decomposition for Customized Generation
  23. ReMP-AD: Retrieval-Enhanced Multi-Modal Prompt Fusion for Few-Shot Industrial Visual Anomaly Detection
  24. Rethinking Cross-Modal Interaction in Multimodal Diffusion Transformers
  25. Rethinking Transformer-Based Blind-Spot Network for Self-Supervised Image Denoising
  26. RoomEditor: High-Fidelity Furniture Synthesis with Parameter-Sharing U-Net
  27. S2Gaussian: Sparse-View Super-Resolution 3D Gaussian Splatting
  28. Segmenting Objectiveness and Task-awareness Unknown Region for Autonomous Driving
  29. Triad: Empowering LMM-Based Anomaly Detection with Expert-Guided Region-of-Interest Tokenizer and Manufacturing Process
  30. VQA4CIR: Boosting Composed Image Retrieval with Visual Question Answering
  31. VideoElevator: Elevating Video Generation Quality with Versatile Text-to-Image Diffusion Models
  32. Visual-O1: Understanding Ambiguous Instructions via Multi-modal Multi-turn Chain-of-thoughts Reasoning
  33. Arbitrary-Scale Video Super-Resolution with Structural and Textural Priors
  34. Class Balance Matters to Active Class-Incremental Learning
  35. Combining Generative and Geometry Priors for Wide-Angle Portrait Correction
  36. ControlVideo: Training-free Controllable Text-to-video Generation
  37. Decoupled Textual Embeddings for Customized Image Generation
  38. DreamControl: Control-Based Text-to-3D Generation with 3D Self-Prior
  39. Dual-Camera Smooth Zoom on Mobile Phones
  40. Dual-stream Perception-driven Blind Quality Assessment for Stereoscopic Omnidirectional Images
  41. Evaluation of Text-to-Video Generation Models: A Dynamics Perspective
  42. GLAD: Towards Better Reconstruction with Global and Local Adaptive Diffusion Models for Unsupervised Anomaly Detection
  43. Improved Generation of Adversarial Examples Against Safety-aligned LLMs
  44. Improving Image Restoration Through Removing Degradations in Textual Representations
  45. Learning Real-World Image De-weathering with Imperfect Supervision
  46. MasterWeaver: Taming Editability and Face Identity for Personalized Text-to-Image Generation
  47. Multi-modal Crowd Counting via a Broker Modality
  48. NTIRE 2024 Challenge on Bracketing Image Restoration and Enhancement: Datasets, Methods and Results
  49. NTIRE 2024 Challenge on Short-form UGC Video Quality Assessment: Methods and Results
  50. NTIRE 2024 Restore Any Image Model (RAIM) in the Wild Challenge
  51. PLACE: Adaptive Layout-Semantic Fusion for Semantic Image Synthesis
  52. ProGBA: Prompt Guided Bayesian Augmentation for Zero-Shot Domain Adaptation
  53. Responsible Visual Editing
  54. SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
  55. Self-Supervised High Dynamic Range Imaging with Multi-Exposure Images in Dynamic Scenes
  56. Self-Supervised Video Desmoking for Laparoscopic Surgery
  57. Sentence-level Prompts Benefit Composed Image Retrieval
  58. ShoeModel: Learning to Wear on the User-Specified Shoes via Diffusion Model
  59. SmartControl: Enhancing ControlNet for Handling Rough Visual Conditions
  60. TextField3D: Towards Enhancing Open-Vocabulary 3D Generation with Noisy Text Fields
  61. UniM2AE: Multi-modal Masked Autoencoders with Unified 3D Representation for 3D Perception in Autonomous Driving
  62. VQ-FONT: Few-Shot Font Generation with Structure-Aware Enhancement and Quantization