PPaperPicks

Ming-Hsuan Yang

University of California, Merced, Electrical Engineering and Computer Science, Merced, CA, USA

95 papers at tracked venues · 77 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. ParaCook: On Time-Efficient Planning for Multi-Agent Systems
  2. Tracking the Unstable: Appearance-Guided Motion Modeling for Robust Multi-Object Tracking in UAV-Captured Videos
  3. 4KAgent: Agentic Any Image to 4K Super-Resolution
  4. A Simple Approach to Unifying Diffusion-based Conditional Generation
  5. AutoOcc: Automatic Open-Ended Semantic Occupancy Annotation via Vision-Language Guided Gaussian Splatting
  6. Calibrated Multi-Preference Optimization for Aligning Diffusion Models
  7. CompleteMe: Reference-Based Human Image Completion
  8. Controllable 3D Outdoor Scene Generation via Scene Graphs
  9. Cropper: Vision-Language Model for Image Cropping through In-Context Learning
  10. DGS-LRM: Real-Time Deformable 3D Gaussian Reconstruction From Monocular Videos
  11. DiMo-GUI: Advancing Test-time Scaling in GUI Grounding via Modality-Aware Visual Reasoning
  12. Distilling Spectral Graph for Object-Context Aware Open-Vocabulary Semantic Segmentation
  13. DreaMo: Articulated 3D Reconstruction from a Single Casual Video
  14. DynamicScaler: Seamless and Scalable Video Generation for Panoramic Scenes
  15. EA3D: Online Open-World 3D Object Extraction from Streaming Videos
  16. Efficient Concertormer for Image Deblurring and Beyond
  17. Efficient Video Object Segmentation via Modulated Cross-Attention Memory
  18. Efficient Visual State Space Model for Image Deblurring
  19. Engage for All: Making Ordinary Image Descriptions Appealing Again!
  20. FaceLift: Learning Generalizable Single Image 3D Face Reconstruction From Synthetic Heads
  21. Fine-grained Controllable Video Generation via Object Appearance and Context
  22. Frequency Domain-Based Diffusion Model for Unpaired Image Dehazing
  23. From Prompt to Progression: Taming Video Diffusion Models for Seamless Attribute Transition
  24. Generating Long-Take Videos via Effective Keyframes and Guidance
  25. Generating Synthetic Data for Unsupervised Federated Learning of Cross-Modal Retrieval
  26. HQGS: High-Quality Novel View Synthesis with Gaussian Splatting in Degraded Scenes
  27. HoliGS: Holistic Gaussian Splatting for Embodied View Synthesis
  28. IllumiCraft: Unified Geometry and Illumination Diffusion for Controllable Video Generation
  29. InstaInpaint: Instant 3D-Scene Inpainting with Masked Large Reconstruction Model
  30. KRIS-Bench: Benchmarking Next-Level Intelligent Image Editing Models
  31. LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion
  32. Layout-your-3D: Controllable and Precise 3D Generation with 2D Blueprint
  33. Learning Deblurring Texture Prior From Unpaired Data with Diffusion Model
  34. Learning Spatial-Semantic Features for Robust Video Object Segmentation
  35. MRFD: Multi-Region Fusion Decoding with Self-Consistency for Mitigating Hallucinations in LVLMs
  36. MeshLLM: Empowering Large Language Models to Progressively Understand and Generate 3D Mesh
  37. MonST3R: A Simple Approach for Estimating Geometry in the Presence of Motion
  38. Move-in-2D: 2D-Conditioned Human Motion Generation
  39. Multi-subject Open-set Personalization in Video Generation
  40. NTIRE 2025 Challenge on Cross-Domain Few-Shot Object Detection: Methods and Results
  41. No Pose, No Problem: Surprisingly Simple 3D Gaussian Splats from Sparse Unposed Images
  42. OmnixR: Evaluating Omni-modality Language Models on Reasoning across Modalities
  43. OpenAD: Open-World Autonomous Driving Benchmark for 3D Object Detection
  44. PocoLoco: A Point Cloud Diffusion Model of Human Shape in Loose Clothing
  45. QK-Edit: Revisiting Attention-based Injection in MM-DiT for Image and Video Editing
  46. RAPID Hand: Robust, Affordable, Perception-Integrated, Dexterous Manipulation Platform for Embodied Intelligence
  47. RMP-SAM: Towards Real-Time Multi-Purpose Segment Anything
  48. Ranking-aware adapter for text-driven image ordering with CLIP
  49. Restage4D: Reanimating Deformable 3D Reconstruction from a Single Video
  50. RobuRCDet: Enhancing Robustness of Radar-Camera Fusion in Bird's Eye View for 3D Object Detection
  51. Social Debiasing for Fair Multi-Modal LLMs
  52. TESLA: Test-Time Reference-Free Through-Plane Super-Resolution for Multi-Contrast Brain MRI
  53. The Third Visual Object Tracking Segmentation VOTS2025 Challenge Results
  54. Three-Dimensional Trajectory Prediction with 3DMoTraj Dataset
  55. Toward Material-Agnostic System Identification From Videos
  56. UniRestore: Unified Perceptual and Task-Oriented Image Restoration Model Using Diffusion Prior
  57. Unified Dense Prediction of Video Diffusion
  58. BEV-MAE: Bird's Eye View Masked Autoencoders for Point Cloud Pre-training in Autonomous Driving Scenarios
  59. CSL: Class-Agnostic Structure-Constrained Learning for Segmentation Including the Unseen
  60. Chat-Edit-3D: Interactive 3D Scene Editing via Text Prompts
  61. DrivingGaussian: Composite Gaussian Splatting for Surrounding Dynamic Autonomous Driving Scenes
  62. Dual Associated Encoder for Face Restoration
  63. Exploiting Diffusion Prior for Generalizable Dense Prediction
  64. Extending Video Masked Autoencoders to 128 frames
    NeurIPS 2024 ·
    Nitesh Bharadwaj Gundavarapu
  65. GALA3D: Towards Text-to-3D Complex Scene Generation via Layout-guided Generative Gaussian Splatting
  66. GLaMM: Pixel Grounding Large Multimodal Model
  67. HENet: Hybrid Encoding for End-to-End Multi-task 3D Perception from Multi-view Cameras
  68. Improving Point-Based Crowd Counting and Localization Based on Auxiliary Point Guidance
  69. Improving Subject-Driven Image Synthesis with Subject-Agnostic Guidance
  70. LSVOS Challenge Report: Large-Scale Complex and Long Video Object Segmentation
  71. Language Model Beats Diffusion - Tokenizer is key to visual generation
  72. Motion-Adaptive Separable Collaborative Filters for Blind Motion Deblurring
  73. No More Ambiguity in 360° Room Layout via Bi-Layout Estimation
  74. PTT: Point-Trajectory Transformer for Efficient Temporal 3D Object Detection
  75. PVUW 2024 Challenge on Complex Video Understanding: Methods and Results
  76. Panda-70M: Captioning 70M Videos with Multiple Cross-Modality Teachers
  77. Pyramid Diffusion for Fine 3D Large Scene Generation
  78. RTracker: Recoverable Tracking via PN Tree Structured Memory
  79. SemFlow: Binding Semantic Segmentation and Image Synthesis via Rectified Flow
  80. Sharing Key Semantics in Transformer Makes Efficient Image Restoration
  81. Spatial-Temporal Multi-level Association for Video Object Segmentation
  82. Structured Video-Language Modeling with Temporal Grouping and Spatial Grounding
  83. StyleDubber: Towards Multi-Scale Style Learning for Movie Dubbing
  84. Taming Latent Diffusion Model for Neural Radiance Field Inpainting
  85. Telling Left from Right: Identifying Geometry-Aware Semantic Correspondence
  86. Text-Driven Image Editing via Learnable Regions
  87. The Second Visual Object Tracking Segmentation VOTS2024 Challenge Results
  88. UniGS: Unified Representation for Image Generation and Segmentation
  89. VidToMe: Video Token Merging for Zero-Shot Video Editing
  90. VideoGrounding-DINO: Towards Open-Vocabulary Spatio- Temporal Video Grounding
  91. VideoPoet: A Large Language Model for Zero-Shot Video Generation
  92. VideoPrism: A Foundational Visual Encoder for Video Understanding
  93. VinT-6D: A Large-Scale Object-in-hand Dataset from Vision, Touch and Proprioception
  94. Weakly Supervised 3D Object Detection via Multi-level Visual Guidance
  95. Weakly Supervised Video Individual Counting