PPaperPicks

Zhihang Yuan

23 papers at tracked venues · 21 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. OTARo: Once Tuning for All Precisions Toward Robust On-Device LLMs
  2. VocabTailor: Dynamic Vocabulary Selection for Downstream Tasks in Small Language Models
  3. A Closer Look at Time Steps is Worthy of Triple Speed-Up for Diffusion Model Training
  4. DLFR-VAE: Dynamic Latent Frame Rate VAE for Video Generation
    ACM MM 2025 · Zhihang Yuan
  5. DiTFastAttnV2: Head-Wise Attention Compression for Multi-Modality Diffusion Transformers
  6. Dlfr-Gen: Diffusion-Based Video Generation With Dynamic Latent Frame Rate
    ICCV 2025 · Zhihang Yuan
  7. EA-Vit: Efficient Adaptation for Elastic Vision Transformer
  8. GSQ-Tuning: Group-Shared Exponents Integer in Fully Quantized Training for LLMs On-Device Fine-tuning
  9. MQuant: Unleashing the Inference Potential of Multimodal Large Language Models via Static Quantization
  10. MVCTrack: Boosting 3D Point Cloud Tracking via Multimodal-Guided Virtual Cues
  11. MambaQuant: Quantizing the Mamba Family with Variance Aligned Rotation Methods
  12. MoEQuant: Enhancing Quantization for Mixture-of-Experts Large Language Models via Expert-Balanced Sampling and Affinity Guidance
  13. MxMoE: Mixed-precision Quantization for MoE with Accuracy and Performance Co-Design
  14. OSTQuant: Refining Large Language Model Quantization with Orthogonal and Scaling Transformations for Better Distribution Fitting
  15. PillarHist: A Quantization-aware Pillar Feature Encoder based on Height-aware Histogram
  16. QuEST: Low-Bit Diffusion Model Quantization via Efficient Selective Finetuning
  17. R2R: Efficiently Navigating Divergent Reasoning Paths with Small-Large Model Token Routing
  18. RWKVQuant: Quantizing the RWKV Family with Proxy Guided Hybrid of Scalar and Vector Quantization
  19. SAFEx: Analyzing Vulnerabilities of MoE-Based LLMs via Stable Safety-critical Expert Identification
  20. Spec-VLA: Speculative Decoding for Vision-Language-Action Models with Relaxed Acceptance
  21. DiTFastAttn: Attention Compression for Diffusion Transformer Models
    NeurIPS 2024 · Zhihang Yuan
  22. Learning High-Frequency Functions Made Easy with Sinusoidal Positional Encoding
  23. PB-LLM: Partially Binarized Large Language Models
    ICLR 2024 · Zhihang Yuan