PPaperPicks

Yi Yang

Zhejiang University, College of Computer Science and Technology, Hangzhou, China

97 papers at tracked venues · 79 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. DLVINet: Advancing Dual-Lens Video Inpainting Beyond Parallax Constraints
  2. FlowMorph: Revealing an Optimizable Flow Latent Space for Controlled Image Morphing
  3. GraphTARIF: Linear Graph Transformer with Augmented Rank and Improved Focus
  4. Insert Anything: Image Insertion via In-Context Editing in DiT
  5. MathFlow: Enhancing the Perceptual Flow of MLLMs for Visual Mathematical Problems
  6. One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement
  7. Oscillation Inversion: Training-Free Image and Video Enhancement Through Oscillated Latents in Large Flow Models
  8. RegionSLM: Region-aware Question Answering on Document Screenshots
  9. 3DID: Direct 3D Inverse Design for Aerodynamics with Physics-Aware Optimization
  10. 3DIS: Depth-Driven Decoupled Image Synthesis for Universal Multi-Instance Generation
  11. Adapting Text-to-Image Generation with Feature Difference Instruction for Generic Image Restoration
  12. Autonomous LLM-Enhanced Adversarial Attack for Text-to-Motion
  13. BVINet: Unlocking Blind Video Inpainting With Zero Annotations
  14. BrainGuard: Privacy-Preserving Multisubject Image Reconstructions from Brain Activities
  15. DecoupledESC: Enhancing Emotional Support Generation via Strategy-Response Decoupled Preference Optimization
  16. DeltaPhi: Physical States Residual Learning for Neural Operators in Data-Limited PDE Solving
  17. DiffVsgg: Diffusion-Driven Online Video Scene Graph Generation
  18. Drafting and Revision: Advancing High-Fidelity Video Inpainting
  19. DreamDPO: Aligning Text-to-3D Generation with Human Preferences via Direct Preference Optimization
  20. DreamRenderer: Taming Multi-Instance Attribute Control in Large-Scale Text-to-Image Models
  21. Dropping Experts, Recombining Neurons: Retraining-Free Pruning for Sparse Mixture-of-Experts LLMs
  22. Dual Reciprocal Learning of Language-based Human Motion Understanding and Generation
  23. Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer
  24. EnergyMoGen: Compositional Human Motion Generation with Energy-Based Diffusion Model in Latent Space
  25. FlexSelect: Flexible Token Selection for Efficient Long Video Understanding
  26. From Trial to Triumph: Advancing Long Video Understanding via Visual Context Sample Scaling and Self-Reward Alignment
  27. Gaussian-Based World Model: Gaussian Priors for Voxel-Based Occupancy Prediction and Future Motion Prediction
  28. Holistic Physics Solver: Learning PDEs in a Unified Spectral-Physical Space
  29. Hydra-SGG: Hybrid Relation Assignment for One-stage Scene Graph Generation
  30. Image Regeneration: Evaluating Text-to-Image Model via Generating Identical Image with Multimodal Large Language Models
  31. Long-horizon Visual Instruction Generation with Logic and Attribute Self-reflection
  32. MASTER: Multi-Agent Security Through Exploration of Roles and Topological Structures - A Comprehensive Framework
  33. MC-Bench: A Benchmark for Multi-Context Visual Grounding in the Era of MLLMs
  34. MaGS: Reconstructing and Simulating Dynamic 3D Objects with Mesh-Adsorbed Gaussian Splatting
  35. OSDA Agent: Leveraging Large Language Models for De Novo Design of Organic Structure Directing Agents
  36. Origin Identification for Text-Guided Image-to-Image Diffusion Models
  37. Prompt-Aware Controllable Shadow Removal
  38. ProtChatGPT: Towards Understanding Proteins with Hybrid Representation and Large Language Models
  39. R1-Onevision: Advancing Generalized Multimodal Reasoning Through Cross-Modal Formalization
    ICCV 2025 · Yi Yang
  40. Reaction Graph: Towards Reaction-Level Modeling for Chemical Reactions with 3D Structures
  41. SKDream: Controllable Multi-view and 3D Generation with Arbitrary Skeletons
  42. Scene Map-based Prompt Tuning for Navigation Instruction Generation
  43. Silence is Golden: Leveraging Adversarial Examples to Nullify Audio Control in LDM-based Talking-Head Generation
  44. SparseDiT: Token Sparsification for Efficient Diffusion Transformer
  45. TSGS: Improving Gaussian Splatting for Transparent Surface Reconstruction via Normal and De-lighting Priors
  46. Towards Human-Like Virtual Beings: Simulating Human Behavior in 3D Scenes
  47. Underwater Visual SLAM with Depth Uncertainty and Medium Modeling
  48. Video2Roleplay: A Multimodal Dataset and Framework for Video-Guided Role-playing Agents
  49. VideoGrain: Modulating Space-Time Attention for Multi-Grained Video Editing
  50. ZeroMamba: Exploring Visual State Space Model for Zero-Shot Learning
  51. CapHuman: Capture Your Moments in Parallel Universes
  52. Clustering Propagation for Universal Medical Image Segmentation
  53. Clustering for Protein Representation Learning
  54. Controllable Navigation Instruction Generation with Chain of Thought Prompting
  55. DGL: Dynamic Global-Local Prompt Tuning for Text-Video Retrieval
  56. DRIP: Unleashing Diffusion Priors for Joint Foreground and Alpha Prediction in Image Matting
  57. Depth-Aware Blind Image Decomposition for Real-World Adverse Weather Recovery
  58. DoraemonGPT: Toward Understanding Dynamic Scenes with Large Language Models (Exemplified as A Video Agent)
  59. Emotional Synchronization for Audio-Driven Talking-Head Generation
  60. Entangled View-Epipolar Information Aggregation for Generalizable Neural Radiance Fields
  61. Epipolar-Free 3D Gaussian Splatting for Generalizable Novel View Synthesis
  62. FragRel: Exploiting Fragment-level Relations in the External Memory of Large Language Models
  63. FreeLong: Training-Free Long Video Generation with SpectralBlend Temporal Attention
  64. GG-Editor: Locally Editing 3D Avatars with Multimodal Large Language Model Guidance
  65. General and Task-Oriented Video Segmentation
  66. HeadStudio: Text to Animatable Head Avatars with 3D Gaussian Splatting
  67. Human-Object Interaction Detection Collaborated with Large Relation-driven Diffusion Models
  68. Image Copy Detection for Diffusion Models
  69. Improving Bird's Eye View Semantic Segmentation by Task Decomposition
  70. Improving Context Understanding in Multimodal Large Language Models via Multimodal Composition Learning
  71. Interpretable3D: An Ad-Hoc Interpretable Classifier for 3D Point Clouds
  72. Knowledge-Enhanced Dual-Stream Zero-Shot Composed Image Retrieval
  73. LSK3DNet: Towards Effective and Efficient 3D Perception with Large Sparse Kernels
  74. MAC 2024: Micro-Action Analysis Grand Challenge
  75. MIGC: Multi-Instance Generation Controller for Text-to-Image Synthesis
  76. MS-DETR: Efficient DETR Training with Mixed Supervision
  77. MS2SL: Multimodal Spoken Data-Driven Continuous Sign Language Production
  78. MoS2: Mixture of Scale and Shift Experts for Text-Only Video Captioning
  79. Mutual Learning for Acoustic Matching and Dereverberation via Visual Scene-Driven Diffusion
  80. Navigation Instruction Generation with BEV Perception and Large Language Models
  81. Neural Clustering Based Visual Representation Learning
  82. Neural Interaction Energy for Multi-Agent Trajectory Prediction
  83. Nonverbal Interaction Detection
  84. Photorealistic Text-to-3D Avatar Generation with Constrained Geometry and Appearance
  85. Progressive Point Cloud Denoising with Cross-Stage Cross-Coder Adaptive Edge Graph Convolution Network
  86. Psychometry: An Omnifit Model for Image Reconstruction from Human Brain Activity
  87. SIFU: Side-view Conditioned Implicit Function for Real-world Usable Clothed Human Reconstruction
  88. Shape2Scene: 3D Scene Representation Learning Through Pre-training on Shape Data
  89. Stitching Segments and Sentences towards Generalization in Video-Text Pre-training
  90. TOPA: Extending Large Language Models for Video Understanding via Text-Only Pre-Alignment
  91. Test-Time Adaptation with CLIP Reward for Zero-Shot Generalization in Vision-Language Models
  92. Transferring to Real-World Layouts: A Depth-aware Framework for Scene Adaptation
  93. VillagerAgent: A Graph-Based Multi-Agent Framework for Coordinating Complex Task Dependencies in Minecraft
  94. Vision-Language Navigation with Energy-Based Policy
  95. Vista-llama: Reducing Hallucination in Video Language Models via Equal Distance to Visual Tokens
  96. VividDreamer: Invariant Score Distillation for Hyper-Realistic Text-to-3D Generation
  97. Volumetric Environment Representation for Vision-Language Navigation