PPaperPicks

Guangtao Zhai

102 papers at tracked venues · 88 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. GeoX-Bench: Benchmarking Cross-View Geo-Localization and Pose Estimation Capabilities of Large Multimodal Models
  2. Market-Bench: Benchmarking Large Language Models on Economic and Trade Competition
  3. One Battle After Another: Probing LLMs' Limits on Multi-Turn Instruction Following with a Benchmark Evolving Framework
  4. Scaling-up Perceptual Video Quality Assessment
  5. VQAThinker: Exploring Generalizable and Explainable Video Quality Assessment via Reinforcement Learning
  6. 3DGS-IEval-15K: A Large-scale Image Quality Evaluation Database for 3D Gaussian-Splatting
  7. 4DGC: Rate-Aware 4D Gaussian Compression for Efficient Streamable Free-Viewpoint Video
  8. A-Bench: Are LMMs Masters at Evaluating AI-generated Images?
  9. AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment
  10. AIGV-Assessor: Benchmarking and Evaluating the Perceptual Quality of Text-to-Video Generation with LMM
  11. AIGVQA: A Unified Framework for Multi-Dimensional Quality Assessment of AI-Generated Video
  12. AU-IQA: A Benchmark Dataset for Perceptual Quality Assessment of AI-Enhanced User-Generated Content
  13. An Empirical Study for Efficient Video Quality Assessment
  14. AnimateQR: Bridging Aesthetics and Functionality in Dynamic QR Code Generation
  15. DFBench: Benchmarking Deepfake Image Detection Capability of Large Multimodal Models
  16. EEmo-Bench: A Benchmark for Multi-modal Large Language Models on Image Evoked Emotion Assessment
  17. Efficient Face Image Quality Assessment via Self-Training and Knowledge Distillation
  18. Engagement Prediction of Short Videos with Large Multimodal Models
  19. Envisioning Beyond the Pixels: Benchmarking Reasoning-Informed Visual Editing
  20. Evaluating Perceptual Color Preferences in Smartphone Photography: Dataset and Challenges
  21. F-Bench: Rethinking Human Preference Evaluation Metrics for Benchmarking Face Generation, Customization, and Restoration
  22. FPEM: Face Prior Enhanced Facial Attractiveness Prediction for Live Videos with Face Retouching
  23. FVQ: A Large-Scale Dataset and an LMM-based Method for Face Video Quality Assessment
  24. FineVQ: Fine-Grained User Generated Content Video Quality Assessment
  25. GOBench: Benchmarking Geometric Optics Generation and Understanding of MLLMs
  26. HVEval: Towards Unified Evaluation of Human-Centric Video Generation and Understanding
  27. Human-Activity AGV Quality Assessment: A Benchmark Dataset and an Objective Evaluation Metric
  28. Image Quality Assessment: From Human to Machine Preference
  29. Information Density Principle for MLLM Benchmarks
  30. LMM4Edit: Benchmarking and Evaluating Multimodal Image Editing with LMMs
  31. LMM4LMM: Benchmarking and Evaluating Large-Multimodal Image Generation With LMMs
  32. LMME3DHF: Benchmarking and Evaluating Multimodal 3D Human Face Generation with LMMs
  33. Learning Hazing to Dehazing: Towards Realistic Haze Generation for Real-World Image Dehazing
  34. Leveraging Multimodal Large Language Models for Joint Discrete and Continuous Evaluation in Text-to-Image Alignment
  35. Low-Light Image Enhancement via Generative Perceptual Priors
  36. Medical Manifestation-Aware De-Identification
  37. Mesh Mamba: A Unified State Space Model for Saliency Prediction in Non-Textured and Textured Meshes
  38. Mitigating Long-tail Distribution in Oracle Bone Inscriptions: Dataset, Model, and Benchmark
  39. Multi-Dimensional Text-to-Face Image Quality Assessment Using LLM: Database and Method
  40. NTIRE 2025 Challenge on Short-form UGC Video Quality Assessment and Enhancement: Methods and Results
  41. NTIRE 2025 XGC Quality Assessment Challenge: Methods and Results
  42. NTIRE 2025 challenge on Text to Image Generation Model Quality Assessment
  43. OBI-Bench: Can LMMs Aid in Study of Ancient Script on Oracle Bones?
  44. Omni2: Unifying Omnidirectional Image Generation and Editing in an Omni Model
  45. OmniAlign-V: Towards Enhanced Alignment of MLLMs with Human Preference
  46. Q-Bench-Video: Benchmark the Video Quality Understanding of LMMs
  47. Q-Eval-100K: Evaluating Visual Quality and Alignment Level for Text-to-Vision Content
  48. RGC-VQA: An Exploration Database for Robotic-Generated Video Quality Assessment
  49. Redundancy Principles for MLLMs Benchmarks
  50. Semantics Versus Identity: A Divide-and-Conquer Approach Towards Adjustable Medical Image De-Identification
  51. Shadow Generation Using Diffusion Model with Geometry Prior
  52. TR-PTS: Task-Relevant Parameter and Token Selection for Efficient Tuning
  53. Textured Mesh Saliency: Bridging Geometry and Texture for Human Perception in 3D Graphics
  54. Towards All-in-One Medical Image Re-Identification
  55. Towards Explainable Partial-AIGC Image Quality Assessment
  56. Towards a New Paradigm of Visual Signal Compression
  57. VQA2: Visual Question Answering for Video Quality Assessment
  58. VQualA 2025 Challenge on Engagement Prediction for Short Videos: Methods and Results
  59. VQualA 2025 Challenge on Face Image Quality Assessment: Methods and Results
  60. VQualA 2025 Challenge on GenAI-Bench AIGC Video Quality Assessment: Methods and Results
  61. VQualA 2025 Challenge on Visual Quality Comparison for Large Multimodal Models: Methods and Results
  62. VQualA 2025 Document Image Quality Assessment Challenge
  63. VRVVC: Variable-Rate NeRF-Based Volumetric Video Compression
  64. Who is a Better Talker: Subjective and Objective Quality Assessment for AI-Generated Talking Heads
  65. AIGIQA-20K: A Large Database for AI-Generated Image Quality Assessment
  66. AIM 2024 Challenge on Compressed Video Quality Assessment: Methods and Results
  67. AIM 2024 Challenge on UHD Blind Photo Quality Assessment
  68. AIM 2024 Challenge on Video Saliency Prediction: Methods and Results
  69. AIM 2024 Challenge on Video Super-Resolution Quality Assessment: Methods and Results
  70. AIS 2024 Challenge on Video Quality Assessment of User-Generated Content: Methods and Results
  71. AVSal: Enhancing Video Saliency Prediction Through Audio-Visual Fusion and Temporal Aggregation
  72. Adaptive Image Quality Assessment via Teaching Large Multimodal Model to Compare
  73. Application of 3D nnU-Net with Residual Encoder in the 2024 MICCAI Head and Neck Tumor Segmentation Challenge
  74. Assessing UHD Image Quality from Aesthetics, Distortions, and Saliency
  75. Compression-RQ-VQA: Leveraging Rich Quality-Aware Features for Compressed Video Quality Assessment
  76. Deep Portrait Quality Assessment. A NTIRE 2024 Challenge Survey
  77. DehazeDCT: Towards Effective Non-Homogeneous Dehazing via Deformable Convolutional Transformer
  78. DiffStega: Towards Universal Training-Free Coverless Image Steganography with Diffusion Models
  79. Face2QR: A Unified Framework for Aesthetic, Face-Preserving, and Scannable QR Code Generation
  80. Free-VSC: Free Semantics from Visual Foundation Models for Unsupervised Video Semantic Compression
  81. G-Refine: A General Quality Refiner for Text-to-Image Generation
  82. GAIA: Rethinking Action Quality Assessment for AI-Generated Videos
  83. GLARE: Low Light Image Enhancement via Generative Latent Feature Based Codebook Retrieval
  84. LMM-PCQA: Assisting Point Cloud Quality Assessment with LMM
  85. Large Multi-modality Model Assisted AI-Generated Image Quality Assessment
  86. MMHead: Towards Fine-grained Multi-modal 3D Facial Animation
  87. NTIRE 2024 Challenge on Short-form UGC Video Quality Assessment: Methods and Results
  88. NTIRE 2024 Dense and Non-Homogeneous Dehazing Challenge Report
  89. NTIRE 2024 Quality Assessment of AI-Generated Content Challenge
  90. On Learning Multi-Modal Forgery Representation for Diffusion Generated Video Detection
  91. Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels
  92. Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision
  93. Q-Instruct: Improving Low-Level Visual Abilities for Multi-Modality Foundation Models
  94. ResAD: A Simple Framework for Class Generalizable Anomaly Detection
  95. SR-VQA: Super-Resolution Video Quality Assessment Model
  96. ShadowRefiner: Towards Mask-free Shadow Removal via Fast Fourier Transformer
  97. Subjective and Objective Quality-of-Experience Assessment for 3D Talking Heads
  98. Subjective-Aligned Dataset and Metric for Text-to-Video Quality Assessment
  99. T2I-Scorer: Quantitative Evaluation on Text-to-Image Generation via Fine-Tuned Large Multi-Modal Models
  100. Text2QR: Harmonizing Aesthetic Customization and Scanning Robustness for Text-Guided QR Code Generation
  101. Towards Open-Ended Visual Quality Comparison
  102. UniProcessor: A Text-Induced Unified Low-Level Image Processor