PPaperPicks

Linfeng Zhang

Shanghai Jiao Tong University, China

39 papers at tracked venues · 37 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods
  2. Bypassing Neural Evaluations for Fast Audio Editing via Adaptive Trajectory Extrapolation
  3. D²Pruner: Debiased Importance and Structural Diversity for MLLM Token Pruning
  4. Forecast Then Calibrate: Feature Caching as ODE for Efficient Diffusion Transformers
  5. ImageBindDC: Compressing Multi-modal Data with ImageBind-based Condensation
  6. Mask Tokens as Prophet: Fine-Grained Cache Eviction for Efficient dLLM Inference
  7. MelTrim: Coarse-to-Fine Data Pruning for Speech Classification
  8. MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing
  9. SDAR-VL: Stable and Efficient Block-wise Diffusion for Vision-Language Understanding
  10. SDAR: A Synergistic Diffusion-AutoRegression Paradigm for Scalable Sequence Generation
  11. SageLM: A Multi-aspect and Explainable Large Language Model for Speech Judgement
  12. StreamMeCo: Long-Term Agent Memory Compression for Efficient Streaming Video Understanding
  13. UNSEEN: Enhancing Dataset Pruning from a Generalization Perspective
  14. WaveEx: Accelerating Flow Matching-based Speech Generation via Wavelet-guided Extrapolation
  15. Accelerating Diffusion Transformers with Token-wise Feature Caching
  16. Compute Only 16 Tokens in One Timestep: Accelerating Diffusion Transformers with Cluster-Driven Feature Caching
  17. Data Whisperer: Efficient Data Selection for Task-Specific LLM Fine-Tuning via Few-Shot In-Context Learning
  18. Dataset Distillation with Neural Characteristic Function: A Minmax Perspective
  19. Decouple-Then-Merge: Finetune Diffusion Models as Multi-Task Learning
  20. Don't Just Chase "Highlighted Tokens" in MLLMs: Revisiting Visual Holistic Context Retention
  21. Efficient Multi-modal Large Language Models via Progressive Consistency Distillation
  22. EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models
  23. From Reusing to Forecasting: Accelerating Diffusion Models With Taylorseers
  24. Gnothi Seauton: Empowering Faithful Self-Interpretability in Black-Box Transformers
  25. GraphKV: Breaking the Static Selection Paradigm with Graph-Based KV Cache Eviction
  26. ICT: Image-Object Cross-Level Trusted Intervention for Mitigating Object Hallucination in Large Vision-Language Models
  27. LED-Merging: Mitigating Safety-Utility Conflicts in Model Merging with Location-Election-Disjoint
  28. LEGION: Learning to Ground and Explain for Synthetic Image Detection
  29. LazyMAR: Accelerating Masked Autoregressive Models Via Feature Caching
  30. OmniSAM: Omnidirectional Segment Anything Model for UDA in Panoramic Semantic Segmentation
  31. ProReflow: Progressive Reflow with Decomposed Velocity
  32. REEF: Representation Encoding Fingerprints for Large Language Models
  33. RealRAG: Retrieval-augmented Realistic Image Generation via Self-reflective Contrastive Learning
  34. SpeCa: Accelerating Diffusion Transformers with Speculative Feature Caching
  35. Stop Looking for "Important Tokens" in Multimodal Language Models: Duplication Matters More
  36. Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?
  37. Training-Free and Hardware-Friendly Acceleration for Diffusion Models via Similarity-based Token Pruning
  38. Unlocking Speech Instruction Data Potential with Query Rewriting
  39. DiTFastAttn: Attention Compression for Diffusion Transformer Models