PPaperPicks

Prateek Mittal

23 papers at tracked venues · 22 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. AcoustoReinforce: Multi-Particle Acoustophoretic Path Planning with Deep Reinforcement Learning
  2. Red-Teaming NSFW Image Classifiers as Text-to-Image Safeguards
  3. Adapting to Evolving Adversaries with Regularized Continual Robust Training
  4. Capturing the Temporal Dependence of Training Data Influence
  5. Data Shapley in One Training Run
  6. Instructional Segment Embedding: Improving LLM Safety with Instruction Hierarchy
  7. On Evaluating the Durability of Safeguards for Open-Weight LLMs
  8. PatchDEMUX: A Certifiably Robust Framework for Multi-label Classifiers Against Adversarial Patches
  9. Privacy Auditing of Large Language Models
  10. ReliabilityRAG: Effective and Provably Robust Defense for RAG-based Web-Search
  11. SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal
  12. Safety Alignment Should be Made More Than Just a Few Tokens Deep
  13. A New Linear Scaling Rule for Private Adaptive Hyperparameter Optimization
  14. Assessing the Brittleness of Safety Alignment via Pruning and Low-Rank Modifications
  15. BaDExpert: Extracting Backdoor Functionality for Accurate Backdoor Input Detection
  16. BrainLM: A foundation model for brain activity recordings
  17. Efficient Data Shapley for Weighted Nearest Neighbor Algorithms
  18. Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!
  19. GREATS: Online Selection of High-Quality Data for LLM Training in Every Iteration
  20. Privacy-Preserving In-Context Learning for Large Language Models
  21. StableLev: Data-Driven Stability Enhancement for Multi-Particle Acoustic Levitation
  22. Teach LLMs to Phish: Stealing Private Information from Language Models
  23. Visual Adversarial Examples Jailbreak Aligned Large Language Models