PPaperPicks

Chaowei Xiao

42 papers at tracked venues · 28 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Can Editing LLMs Inject Harm?
  2. Copyright Detective: A Forensic System to Evidence LLMs Flickering Copyright Leakage Risks
  3. Defenses Against Prompt Attacks Learn Surface Heuristics
  4. AGrail: A Lifelong Agent Guardrail with Effective and Adaptive Safety Detection
  5. AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Exploration to Jailbreak LLMs
  6. Benchmarking Vision Language Model Unlearning via Fictitious Facial Identity Dataset
  7. CVE-Bench: Benchmarking LLM-based Software Engineering Agent's Ability to Repair Real-World CVE Vulnerabilities
  8. Can Watermarks be Used to Detect LLM IP Infringement For Free?
  9. DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents
  10. DataGen: Unified Synthetic Dataset Generation via Large Language Models
  11. DreamDrive: Generative 4D Scene Modeling from Street View Images
  12. Eia: Environmental Injection Attack on Generalist Web Agents for Privacy Leakage
  13. LeanAgent: Lifelong Learning for Formal Theorem Proving
  14. MetaAgent: Automatically Constructing Multi-Agent Systems Based on Finite State Machines
  15. MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding
  16. PIGuard: Prompt Injection Guardrail via Mitigating Overdefense for Free
  17. RePD: Defending Jailbreak Attack through a Retrieval-based Prompt Decomposition Process
  18. Robust Representation Consistency Model via Contrastive Denoising
  19. Sample-specific Noise Injection for Diffusion-based Adversarial Purification
  20. SudoLM: Learning Access Control of Parametric Knowledge with Authorization Alignment
  21. T-Stitch: Accelerating Sampling in Pre-Trained Diffusion Models with Trajectory Stitching
  22. Test-time Backdoor Mitigation for Black-Box Large Language Models with Defensive Demonstrations
  23. AdaShield : Safeguarding Multimodal Large Language Models from Structure-Based Attack via Adaptive Shield Prompting
  24. AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases
  25. AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models
  26. BackdoorAlign: Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment
  27. CALICO: Self-Supervised Camera-LiDAR Contrastive Pre-training for BEV Perception
  28. ChatGPT as an Attack Tool: Stealthy Textual Backdoor Attack via Blackbox Generative Model Trigger
  29. Cognitive Overload: Jailbreaking Large Language Models with Overloaded Logical Thinking
  30. Consistency Purification: Effective and Efficient Diffusion Purification towards Certified Robustness
  31. Conversational Drug Editing Using Retrieval and Domain Feedback
  32. Dolphins: Multimodal Language Model for Driving
  33. From Shortcuts to Triggers: Backdoor Defense with Denoised PoE
  34. HaloScope: Harnessing Unlabeled LLM Generations for Hallucination Detection
  35. Instructional Fingerprinting of Large Language Models
  36. Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
  37. Leveraging Hierarchical Feature Sharing for Efficient Dataset Condensation
  38. Perada: Parameter-Efficient Federated Learning Personalization with Generalization Guarantees
  39. Position: TrustLLM: Trustworthiness in Large Language Models
  40. RLHFPoison: Reward Poisoning Attack for Reinforcement Learning with Human Feedback in Large Language Models
  41. RealGen: Retrieval Augmented Generation for Controllable Traffic Scenarios
  42. Reinforcement Learning with Human Feedback for Realistic Traffic Simulation