PPaperPicks

Siteng Huang

16 papers at tracked venues · 13 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Filter, Correlate, Compress: Training-Free Token Reduction for MLLM Acceleration
  2. Global Compression Commander: Plug-and-Play Inference Acceleration for High-Resolution Large Vision-Language Models
  3. Towards Affordance-Aware Robotic Dexterous Grasping with Human-like Priors
  4. VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model
  5. Accelerating Diffusion Transformers with Token-wise Feature Caching
  6. CARP: Visuomotor Policy Learning via Coarse-to-Fine Autoregressive Prediction
  7. Cobra: Extending Mamba to Multi-Modal Large Language Model for Efficient Inference
  8. Quart-Online: Latency-Free Multimodal Large Language Model for Quadruped Robot Learning
  9. SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning
  10. Check, Locate, Rectify: A Training-Free Layout Calibration System for Text- to- Image Generation
  11. Learning Disentangled Identifiers for Action-Customized Text-to-Image Generation
    CVPR 2024 · Siteng Huang
  12. PiTe: Pixel-Temporal Alignment for Large Video-Language Model
  13. ProFD: Prompt-Guided Feature Disentangling for Occluded Person Re-Identification
  14. Prompt-Based Distribution Alignment for Unsupervised Domain Adaptation
  15. QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
  16. Troika: Multi-Path Cross-Modal Traction for Compositional Zero-Shot Learning
    CVPR 2024 · Siteng Huang