PPaperPicks

Shu-Tao Xia

75 papers at tracked venues · 63 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. C-ReD: A Comprehensive Chinese Benchmark for AI-Generated Text Detection Derived from Real-World Prompts
  2. CASL: Curvature-Augmented Self-supervised Learning for 3D Anomaly Detection
  3. FEDIN: Frequency-Enhanced Deep Interest Network for Click-Through Rate Prediction
  4. From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents
  5. Heterogeneous Uncertainty-Guided Composed Image Retrieval with Fine-Grained Probabilistic Learning
  6. Improving Deepfake Detection with Reinforcement Learning-Based Adaptive Data Augmentation
  7. Infinite Babble: Inflating 3D Vision-Language Model Inference Overhead via Adversarial Geometric Perturbation
  8. MoE-LC: General-Purpose Lossless Compression for Multi-modal Data via Entropy-Aware Multi-Experts
  9. Rank Matters: Understanding and Defending Model Inversion Attacks via Low-Rank Feature Filtering
  10. Retrievals Can Be Detrimental: Unveiling the Backdoor Vulnerability of Retrieval-Augmented Diffusion Models
  11. Vertical Semi-Federated Learning for Efficient Online Advertising
  12. When Efficiency Meets Safety: A Benchmark Security Analysis of KV Cache Compression in Large Language Models
  13. 3D-LMVIC: Learning-based Multi-View Image Compression with 3D Gaussian Geometric Priors
  14. Adapting Pre-trained 3D Models for Point Cloud Video Understanding via Cross-frame Spatio-temporal Perception
  15. An Exploration with Entropy Constrained 3D Gaussians for 2D Video Compression
  16. AutoSSVH: Exploring Automated Frame Sampling for Efficient Self-Supervised Video Hashing
  17. Benchmarking Open-ended Audio Dialogue Understanding for Large Audio-Language Models
  18. CALF: Aligning LLMs for Time Series Forecasting via Cross-modal Fine-Tuning
  19. Cassic: Towards Content-Adaptive State-Space Models for Learned Image Compression
  20. Diffusion Prior Interpolation for Flexibility Real-World Face Super-Resolution
  21. DreamBench++: A Human-Aligned Benchmark for Personalized Image Generation
  22. EDPC: Accelerating Lossless Compression via Lightweight Probability Models and Decoupled Parallel Dataflow
  23. Efficient Differentiable Approximation of Generalized Low-rank Regularization
  24. Efficient Self-Supervised Video Hashing with Selective State Spaces
  25. Embracing Collaboration Over Competition: Condensing Multiple Prompts for Visual In-Context Learning
  26. Enhancing Partially Relevant Video Retrieval with Hyperbolic Learning
  27. Error-quantified Conformal Inference for Time Series
  28. Expert-Enhanced Masked Point Modeling for Point Cloud Self-Supervised Learning
  29. FastVAR: Linear Visual Autoregressive Modeling Via Cached Token Pruning
  30. GCD-Sampling: A General Cross-scale Decoupled Sampling for Point Cloud
  31. Going Beyond Feature Similarity: Effective Dataset distillation based on Class-aware Conditional Mutual Information
  32. Grounding Language with Vision: A Conditional Mutual Information Calibrated Decoding Strategy for Reducing Hallucinations in LVLMs
  33. Hierarchical Features Matter: A Deep Exploration of Progressive Parameterization Method for Dataset Distillation
  34. ICAS: Detecting Training Data from Autoregressive Image Generative Models
  35. IntLoRA: Integral Low-rank Adaptation of Quantized Diffusion Models
  36. MERA: Mixture of Experts with Retrieval-Augmented Representation for Modeling Diversified Stock Patterns
  37. MambaIRv2: Attentive State Space Restoration
  38. MoSEs: Uncertainty-Aware AI-Generated Text Detection via Mixture of Stylistics Experts with Conditional Thresholds
  39. Modeling Uncertainty in Composed Image Retrieval via Probabilistic Embeddings
  40. One Perturbation is Enough: On Generating Universal Adversarial Perturbations Against Vision-Language Pre-Training Models
  41. PMA: Towards Parameter-Efficient Point Cloud Understanding via Point Mamba Adapter
  42. Point Cloud Mixture-of-Domain-Experts Model for 3D Self-supervised Learning
  43. Pre-Trained Vision-Language Models as Noisy Partial Annotators
  44. Protecting Your Video Content: Disrupting Automated Video-based LLM Annotations
  45. ROMA: Recommendation-Oriented Language Model Adaptation Using Multi-Modal Multi-Domain Item Sequences
  46. Stealthy Shield Defense: A Conditional Mutual Information-Based Approach against Black-Box Model Inversion Attacks
  47. TimeBridge: Non-Stationarity Matters for Long-term Time Series Forecasting
  48. TimeFilter: Patch-Specific Spatial-Temporal Graph Filtration for Time Series Forecasting
  49. Your Language Model Can Secretly Write Like Humans: Contrastive Paraphrase Attacks on LLM-Generated Text Detectors
  50. A Closer Look at GAN Priors: Exploiting Intermediate Features for Enhanced Model Inversion Attacks
  51. BadCLIP: Trigger-Aware Prompt Learning for Backdoor Attacks on CLIP
  52. BoostAdapter: Improving Vision-Language Test-Time Adaptation via Regional Bootstrapping
  53. Boundary-aware Decoupled Flow Networks for Realistic Extreme Rescaling
  54. CLIP-Guided Generative Networks for Transferable Targeted Adversarial Attacks
  55. Controller-Guided Partial Label Consistency Regularization with Unlabeled Data
  56. DDN: Dual-domain Dynamic Normalization for Non-stationary Time Series Forecasting
  57. Everyday Object Meets Vision-and-Language Navigation Agent via Backdoor
  58. GMMFormer: Gaussian-Mixture-Model Based Transformer for Efficient Partially Relevant Video Retrieval
  59. GladCoder: Stylized QR Code Generation with Grayscale-Aware Denoising Process
  60. IGSPAD: Inverting 3D Gaussian Splatting for Pose-agnostic Anomaly Detection
  61. Inducing High Energy-Latency of Large Vision-Language Models with Verbose Images
  62. Invertible Residual Rescaling Models
  63. LCM: Locally Constrained Compact Point Cloud Model for Masked Point Modeling
  64. Large Point-to-Gaussian Model for Image-to-3D Generation
  65. MambaIR: A Simple Baseline for Image Restoration with State-Space Model
  66. Not All Prompts Are Secure: A Switchable Backdoor Attack Against Pre-trained Vision Transfomers
  67. Parameter Efficient Adaptation for Image Restoration with Heterogeneous Mixture-of-Experts
  68. Parameter-Efficient and Memory-Efficient Tuning for Vision Transformer: A Disentangled Approach
  69. Periodicity Decoupling Framework for Long-term Series Forecasting
  70. RAT: Retrieval-Augmented Transformer for Click-Through Rate Prediction
  71. ReFIR: Grounding Large Restoration Models with Retrieval Augmentation
  72. ReFer: Retrieval-Enhanced Vertical Federated Recommendation for Full Set User Benefit
  73. Towards Compact 3D Representations via Point Feature Enhancement Masked Autoencoders
  74. Towards Faithful XAI Evaluation via Generalization-Limited Backdoor Watermark
  75. Vision-Language Pre-training with Object Contrastive Learning for 3D Scene Understanding