PPaperPicks

Souradip Chakraborty

18 papers at tracked venues · 14 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Jailbreaks as Inference-Time Alignment: A Framework for Understanding Safety Failures in LLMs
  2. A Technical Report on "Erasing the Invisible": The 2024 NeurIPS Competition on Stress Testing Image Watermarks
  3. Active Preference Optimization for Sample Efficient RLHF
  4. Align-Pro: A Principled Approach to Prompt Optimization for LLM Alignment
  5. Bounded Rationality for LLMs: Satisficing Alignment at Inference-Time
    ICML 2025 ·
    Mohamad Fares El Hajj Chehade
  6. Can Watermarking Large Language Models Prevent Copyrighted Text Generation and Hide Training Data?
    AAAI 2025 ·
    Michael-Andrei Panaitescu-Liess
  7. Collab: Controlled Decoding using Mixture of Agents for LLM Alignment
    ICLR 2025 · Souradip Chakraborty
  8. Does Thinking More Always Help? Mirage of Test-Time Scaling in Reasoning Models
  9. Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment
  10. Is Poisoning a Real Threat to DPO? Maybe More So Than You Think
  11. On the Global Optimality of Policy Gradient Methods in General Utility Reinforcement Learning
  12. On the Vulnerability of LLM/VLM-Controlled Robotics
  13. Uncertainty-Aware Answer Selection for Improved Reasoning in Multi-LLM Systems
  14. MaxMin-RLHF: Alignment with Diverse Human Preferences
    ICML 2024 · Souradip Chakraborty
  15. PARL: A Unified Framework for Policy Alignment in Reinforcement Learning from Human Feedback
    ICLR 2024 · Souradip Chakraborty
  16. Position: On the Possibilities of AI-Generated Text Detection
    ICML 2024 · Souradip Chakraborty
  17. Rethinking Adversarial Policies: A Generalized Attack Formulation and Provable Defense in RL
  18. Transfer Q-star : Principled Decoding for LLM Alignment
    NeurIPS 2024 · Souradip Chakraborty