PPaperPicks

Feng Zhao

University of Science and Technology of China, School of Information Science and Technology, Hefei, China

50 papers at tracked venues · 36 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Beyond Accuracy: Unveiling Inefficiency Patterns in Tool-Integrated Reasoning
  2. Breaking Block Boundaries: Anchor-based History-stable Decoding for Diffusion Large Language Models
  3. Token Painter: Training-Free Text-Guided Image Inpainting via Mask Autoregressive Models
  4. Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling
  5. Tracing the Roots: A Multi-Agent Framework for Uncovering Data Lineage in Post-Training LLMs
  6. UniCorn: Towards Self-Improving Unified Multimodal Models through Self-Generated Supervision
  7. AB-Cache: Training-Free Acceleration of Diffusion Models via Adams-Bashforth Cached Feature Reuse
  8. Adaptive Dropout: Unleashing Dropout across Layers for Generalizable Image Super-Resolution
  9. CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios
  10. Enhancing Large Vision-Language Models with Ultra-Detailed Image Caption Generation
  11. FreeDNA: Endowing Domain Adaptation of Diffusion-Based Dense Prediction with Training-Free Domain Noise Alignment
  12. FreePCA: Integrating Consistency Information across Long-short Frames in Training-free Long Video Generation via Principal Component Analysis
  13. Gaussian Variation Field Diffusion for High-Fidelity Video-to-4D Synthesis
  14. Horizon-GS: Unified 3D Gaussian Splatting for Large-Scale Aerial-to-Ground Scenes
  15. MindSearch: Mimicking Human Minds Elicits Deep AI Searcher
  16. Navigating Image Restoration with VAR's Distribution Alignment Prior
  17. PseDet: Revisiting the Power of Pseudo Label in Incremental Object Detection
  18. SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Models
  19. SkySense-O: Towards Open-World Remote Sensing Interpretation with Vision-Centric Visual-Language Modeling
  20. Towards Better & Faster Autoregressive Image Generation: From the Perspective of Entropy
  21. VFM-Adapter: Adapting Visual Foundation Models for Dense Prediction with Dynamic Hybrid Operation Mapping
  22. VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning
  23. ViDoRAG: Visual Document Retrieval-Augmented Generation via Dynamic Iterative Reasoning Agents
  24. VideoMAR: Autoregressive Video Generation with Continuous Tokens
  25. Agent-FLAN: Designing Data and Methods of Effective Agent Tuning for Large Language Models
  26. Are We on the Right Way for Evaluating Large Vision-Language Models?
  27. Discrete Latent Perspective Learning for Segmentation and Detection
  28. Empowering Resampling Operation for Ultra-High-Definition Image Enhancement with Model-Aware Guidance
  29. FreqMamba: Viewing Mamba from a Frequency Perspective for Image Deraining
  30. Frequency Decomposition to Tap the Potential of Single Domain for Generalization
  31. GaussianCube: A Structured and Explicit Radiance Representation for 3D Generative Modeling
  32. Idling Neurons, Appropriately Lenient Workload During Fine-Tuning Leads to Better Generalization
  33. Image-free Pre-training for Low-Level Vision
  34. Leveraging Imagery Data with Spatial Point Prior for Weakly Semi-supervised 3D Object Detection
  35. PPTFormer: Pseudo Multi-Perspective Transformer for UAV Segmentation
  36. Probing Synergistic High-Order Interaction in Infrared and Visible Image Fusion
  37. PsySafe: A Comprehensive Framework for Psychological-based Attack, Defense, and Evaluation of Multi-agent System Safety
  38. Rectifying Shortcut Learning through Cellular Differentiation in Deep Learning Neurons
  39. Revisiting Spatial-Frequency Information Integration from a Hierarchical Perspective for Panchromatic and Multi-Spectral Image Fusion
  40. RodinHD: High-Fidelity 3D Avatar Generation with Diffusion Models
  41. Semantic Pre-supplement for Exposure Correction
  42. ShareGPT4V: Improving Large Multi-modal Models with Better Captions
  43. ShareGPT4Video: Improving Video Understanding and Generation with Better Captions
  44. Stable Preference: Redefining Training Paradigm of Human Preference Model for Text-to-Image Synthesis
  45. Stream Query Denoising for Vectorized HD-Map Construction
  46. T-Eval: Evaluating the Tool Utilization Capability of Large Language Models Step by Step
  47. Task-Related Feature Enhancement Network for Neuronal Morphology Classification
  48. Training Pansharpening Networks at Full Resolution Using Degenerate Invariance
  49. Unleashing the Potential of the Semantic Latent Space in Diffusion Models for Image Dehazing
  50. Unmasking Bias in Diffusion Model Training