PPaperPicks

Zihao Wang

44 papers at tracked venues · 35 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. AudioStealer: Extracting Audio Prompts via Shapley Value-Guided Query Search
  2. Detecting AI-Generated Content on Social Media with Multi-modal Language Models
  3. Diff-V2M: A Hierarchical Conditional Diffusion Model with Explicit Rhythmic Modeling for Video-to-Music Generation
  4. Hey, That's My Data! Token-Only Dataset Inference in Large Language Models
  5. PRBench: Large-Scale Expert Rubrics for Evaluating High-Stakes Professional Reasoning
  6. Unlocking Scaling Law in Industrial Recommendation Systems with a Three-step Paradigm based Large User Model
  7. A Recipe for Causal Graph Regression: Confounding Effects Revisited
  8. A Sim-to-Real Transfer Framework for Enhancing Marine Vehicle Performance in Ocean Environments
  9. ACE: Anti-Editing Concept Erasure in Text-to-Image Models
    CVPR 2025 · Zihao Wang
  10. AI-Assisted Human-Pet Artistic Musical Co-Creation for Wellness Therapy
    IJCAI 2025 · Zihao Wang
  11. AIM 2025 challenge on Inverse Tone Mapping Report: Methods and Results
  12. ESEG: Event-Based Segmentation Boosted by Explicit Edge-Semantic Guidance
  13. GROOT-2: Weakly Supervised Multimodal Instruction Following Agents
  14. Generative Music Models' Alignment with Professional and Amateur Users' Expectations
    ACL 2025 · Zihao Wang
  15. JARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mouse
  16. LOKI: A Comprehensive Synthetic Data Detection Benchmark using Large Multimodal Models
  17. Learning Hierarchical Polynomials of Multiple Nonlinear Features
  18. MCU: An Evaluation Framework for Open-Ended Game Agents
  19. MSV-PCT: Multi-Sparse-View Enhanced Transformer Framework for Salient Object Detection in Point Clouds
    AAAI 2025 · Zihao Wang
  20. Mavors: Multi-granularity Video Representation for Multimodal Large Language Model
  21. Model Reveals What to Cache: Profiling-Based Feature Reuse for Video Diffusion Models
  22. Multi-Accent Mandarin Dry-Vocal Singing Dataset: Benchmark for Singing Accent Recognition
    ACM MM 2025 · Zihao Wang
  23. Open-World Skill Discovery from Unsegmented Demonstration Videos
  24. ROCKET-1: Mastering Open-World Interaction with Visual-Temporal Context Prompting
  25. Singing Timbre Popularity Assessment Based on Multimodal Large Foundation Model
    ACM MM 2025 · Zihao Wang
  26. SqueezeAttention: 2D Management of KV-Cache in LLM Inference via Layer-wise Optimal Budget
    ICLR 2025 · Zihao Wang
  27. The Illusion of Role Separation: Hidden Shortcuts in LLM Role Learning (and How to Fix Them)
    ICML 2025 · Zihao Wang
  28. Transtreaming: Adaptive Delay-aware Transformer for Real-time Streaming Perception
  29. UQABench: Evaluating User Embedding for Prompting LLMs in Personalized Question Answering
  30. Where am I? Cross-View Geo-localization with Natural Language Descriptions
  31. nnU-Net v2 for Head-and-Neck PET/CT Primary Tumor and Lymph Node Segmentation: A Simple, Strong Baseline
  32. A User-Friendly Framework for Generating Model-Preferred Prompts in Text-to-Image Synthesis
  33. GROOT: Learning to Follow Instructions by Watching Gameplay Videos
  34. Head and Neck Tumor Segmentation for MRI-Guided Radiation Therapy Using Pre-trained STU-Net Models
    MICCAI 2024 · Zihao Wang
  35. Learning Hierarchical Polynomials with Three-Layer Neural Networks
    ICLR 2024 · Zihao Wang
  36. MuChin: A Chinese Colloquial Description Benchmark for Evaluating Language Models in the Field of Music
    IJCAI 2024 · Zihao Wang
  37. NestE: Modeling Nested Relational Structures for Knowledge Graph Reasoning
  38. OmniJARVIS: Unified Vision-Language-Action Tokenization Enables Open-World Instruction Following Agents
    NeurIPS 2024 · Zihao Wang
  39. PSNE: Efficient Spectral Sparsification Algorithms for Scaling Network Embedding
  40. ProAgent: Building Proactive Cooperative Agents with Large Language Models
  41. SDformer: Transformer with Spectral Filter and Dynamic Attention for Multivariate Time Series Long-term Forecasting
  42. SSL-Cleanse: Trojan Detection and Mitigation in Self-Supervised Learning
  43. Selecting Large Language Model to Fine-tune via Rectified Scaling Law
  44. Transforming and Combining Rewards for Aligning Large Language Models
    ICML 2024 · Zihao Wang