PPaperPicks

Heng Wang

25 papers at tracked venues · 16 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. A MambaVision-Based Cross-Modal Feature Enhancement Network for Scene Text Super-Resolution
  2. Improving Implicit Discourse Relation Recognition with Natural Language Explanations from LLMs
    AAAI 2026 · Heng Wang
  3. LVM-Lite: Training Large Vision Models with Efficient Sequential Modeling
  4. Thinking Traps in Long Chain-of-Thought: A Measurable Study and Trap-Aware Adaptive Restart
  5. Autoregressive Pretraining with Mamba in Vision
  6. BannerAgency: Advertising Banner Design with Multimodal LLM Agents
    EMNLP 2025 · Heng Wang
  7. CoSER: Coordinating LLM-Based Persona Simulation of Established Roles
  8. DCC: Plug-and-Play Dynamic Category Compression for Enhanced Handwritten Text Generation
  9. Efficient VideoMAE via Temporal Progressive Training
  10. HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing
  11. Mirror in the Model: Ad Banner Image Generation via Reflective Multi-LLM and Multi-modal Agents
  12. Multimodal Dual-domain Learning for Image Fusion
    ICCV 2025 · Heng Wang
  13. OpenCUA: Open Foundations for Computer-Use Agents
  14. ROS-SAM: High-Quality Interactive Segmentation for Remote Sensing Moving Object
  15. SFRD: Handwritten Mathematical Expressions Generation by Spatial-Aware Feature Refinement Diffusion
  16. Shot2Story: A New Benchmark for Comprehensive Understanding of Multi-shot Videos
  17. VMAs: Video-to-Music Generation via Semantic Alignment in Web Music Videos
  18. VMF-Net: Visual-Aware Multi-representation Fusion Network for Artifact-Free Handwritten Mathematical Expressions Generation
  19. Explaining Datasets in Words: Statistical Models with Natural Language Parameters
  20. Exploring the Role of Audio in Video Captioning
  21. Future Does Matter: Boosting 3D Object Detection with Temporal Motion Estimation in Point Cloud Sequences
  22. Open-world Instance Segmentation: Top-down Learning with Bottom-up Supervision
  23. Stitching Segments and Sentences towards Generalization in Video-Text Pre-training
  24. Video Recognition in Portrait Mode
  25. Vista-llama: Reducing Hallucination in Video Language Models via Equal Distance to Visual Tokens