PPaperPicks

Xiangyu Qi

10 papers at tracked venues · 9 at CORE A* · active 20242025

Venues

Frequent coauthors

Papers

  1. Defensive Prompt Patch: A Robust and Generalizable Defense of Large Language Models against Jailbreak Attacks
  2. Libra-Leaderboard: Towards Responsible AI through a Balanced Leaderboard of Safety and Capability
  3. On Evaluating the Durability of Safeguards for Open-Weight LLMs
    ICLR 2025 · Xiangyu Qi
  4. SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal
  5. Safety Alignment Should be Made More Than Just a Few Tokens Deep
    ICLR 2025 · Xiangyu Qi
  6. Assessing the Brittleness of Safety Alignment via Pruning and Low-Rank Modifications
  7. BaDExpert: Extracting Backdoor Functionality for Accurate Backdoor Input Detection
  8. BackdoorAlign: Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment
  9. Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!
    ICLR 2024 · Xiangyu Qi
  10. Visual Adversarial Examples Jailbreak Aligned Large Language Models
    AAAI 2024 · Xiangyu Qi