PPaperPicks

Wenjie Ruan

University of Exeter, UK

17 papers at tracked venues · 13 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Defending LLMs against Jailbreak Attacks via Template-Based ICL with a Defensive Suffix
  2. Dictionary Guided Sparse Logit Editing for Reliable Jailbreak Attacks
  3. Fragile by Design: On the Limits of Adversarial Defenses in Personalized DreamBooth Generation
  4. A Black-Box Evaluation Framework for Semantic Robustness in Bird's Eye View Detection
  5. Adversarial Training for Probabilistic Robustness
  6. FALCON: Fine-grained Activation Manipulation by Contrastive Orthogonal Unalignment for Large Language Model
  7. FAP: A Foveation-Inspired Adversarial Purification Pipeline for Enhancing Robustness in Mammography Classification
  8. Boosting Adversarial Training via Fisher-Rao Norm-Based Regularization
  9. CROWD: Certified Robustness via Weight Distribution for Smoothed Classifiers against Backdoor Attack
  10. PRASS: Probabilistic Risk-averse Robust Learning with Stochastic Search
  11. Position: Building Guardrails for Large Language Models Requires Systematic Design
  12. ProTIP: Probabilistic Robustness Verification on Text-to-Image Diffusion Models Against Stochastic Perturbation
  13. Representation-Based Robustness in Goal-Conditioned Reinforcement Learning
  14. Reward Certification for Policy Smoothed Reinforcement Learning
  15. TARP-VP: Towards Evaluation of Transferred Adversarial Robustness and Privacy on Label Mapping Visual Prompting Models
  16. The Implicit Bias of Gradient Descent toward Collaboration between Layers: A Dynamic Analysis of Multilayer Perceptions
  17. Towards Fairness-Aware Adversarial Learning