PPaperPicks

Hang Hua

14 papers at tracked venues · 12 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting
  2. Guardian-as-an-Advisor: Advancing Next-Generation Guardian Models for Trustworthy LLMs
  3. Empowering LLMs with Pseudo-Untrimmed Videos for Audio-Visual Temporal Understanding
  4. FINECAPTION: Compositional Image Captioning Focusing on Wherever You Want at Any Granularity
    CVPR 2025 · Hang Hua
  5. Generative AI for Cel-Animation: A Survey
  6. Latent Chain-of-Thought for Visual Reasoning
  7. MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models
    NeurIPS 2025 · Hang Hua
  8. MMPerspective: Do MLLMs Understand Perspective? A Comprehensive Benchmark for Perspective Perception, Reasoning, and Robustness
  9. V2Xum-LLM: Cross-Modal Video Summarization with Temporal Prompt Instruction Tuning
    AAAI 2025 · Hang Hua
  10. VQualA 2025 Challenge on Engagement Prediction for Short Videos: Methods and Results
  11. VidComposition: Can MLLMs Analyze Compositions in Compiled Videos?
  12. BattleAgent: Multi-modal Dynamic Emulation on Historical Battles to Complement Historical Analysis
  13. FineMatch: Aspect-Based Fine-Grained Image and Text Mismatch Detection and Correction
    ECCV 2024 · Hang Hua
  14. PromptFix: You Prompt and We Fix the Photo