PPaperPicks

Hongtao Xie

University of Science and Technology of China, School of Information Science and Technology, Hefei, China

31 papers at tracked venues · 26 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. RegionRAG: Region-level Retrieval-Augmented Generation for Visual Document Understanding
  2. SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability
  3. CAPability: A Comprehensive Visual Caption Benchmark for Evaluating Both Correctness and Thoroughness
  4. CLIP-Adapted Region-to-Text Learning for Generative Open-Vocabulary Semantic Segmentation
  5. Forensic-MoE: Exploring Comprehensive Synthetic Image Detection Traces With Mixture of Experts
  6. GRIP: A Graph-Based Reasoning Instruction Producer
  7. GestureHYDRA: Semantic Co-Speech Gesture Synthesis via Hybrid Modality Diffusion Transformer and Cascaded-Synchronized Retrieval-Augmented Generation
  8. Hybrid-Level Instruction Injection for Video Token Compression in Multi-modal Large Language Models
  9. IDseq: Decoupled and Sequentially Detecting and Grounding Multi-Modal Media Manipulation
  10. Igd: Instructional Graphic Design With Multimodal Layer Generatio
  11. Invisible Watermarks, Visible Gains: Steering Machine Unlearning with Bi-Level Watermarking Design
  12. IterMeme: Expert-Guided Multimodal LLM for Interactive Meme Creation with Layout-Aware Generation
  13. Mask2DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video Generation
  14. PosterMaker: Towards High-Quality Product Poster Generation with Accurate Text Rendering
  15. Proactive Deepfake Detection via Self-Verifiable Semantic Watermarking
  16. SVTRv2: CTC Beats Encoder-Decoder Models in Scene Text Recognition
  17. SynTab-LLaVA: Enhancing Multimodal Table Understanding with Decoupled Synthesis
  18. AlignZeg: Mitigating Objective Misalignment for Zero-Shot Semantic Segmentation
  19. Boosting Semi-Supervised Scene Text Recognition via Viewing and Summarizing
  20. Choose What You Need: Disentangled Representation Learning for Scene Text Recognition, Removal and Editing
  21. Control-Talker: A Rapid-Customization Talking Head Generation Method for Multi-Condition Control and High-Texture Enhancement
  22. DEADiff: An Efficient Stylization Diffusion Model with Disentangled Representations
  23. DiffAM: Diffusion-Based Adversarial Makeup Transfer for Facial Privacy Protection
  24. Focus on the Whole Character: Discriminative Character Modeling for Scene Text Recognition
  25. How Control Information Influences Multilingual Text Image Generation and Editing?
  26. Knowledge Context Modeling with Pre-trained Language Models for Contrastive Knowledge Graph Completion
  27. Leveraging Text Localization for Scene Text Removal via Text-Aware Masked Image Modeling
  28. OTE: Exploring Accurate Scene Text Recognition Using One Token
  29. Self-Supervised Pre-training with Symmetric Superimposition Modeling for Scene Text Recognition
  30. ShowMaker: Creating High-Fidelity 2D Human Video via Fine-Grained Diffusion Modeling
  31. Towards Balanced Alignment: Modal-Enhanced Semantic Modeling for Video Moment Retrieval