PPaperPicks

Ming Jin

Virginia Tech, Blacksburg, VA, USA

24 papers at tracked venues · 17 at CORE A* · active 20242025

Venues

Frequent coauthors

Papers

  1. A Black Swan Hypothesis: The Role of Human Irrationality in AI Safety
  2. DiPT: Enhancing LLM Reasoning through Diversified Perspective-Taking
  3. Don't Trade Off Safety: Diffusion Regularization for Constrained Offline RL
  4. From Capabilities to Performance: Evaluating Key Functional Properties of LLM Architectures in Penetration Testing
  5. Improving Novel Anomaly Detection with Domain-Invariant Latent Representations
  6. Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning
  7. LLMs Can Plan Only If We Tell Them
  8. LLMs Can Reason Faster Only If We Let Them
  9. Position: AI Safety Must Embrace an Antifragile Perspective
    ICML 2025 · Ming Jin
  10. Probing Hidden Knowledge Holes in Unlearned LLMs
  11. Reinforcement Learning with Backtracking Feedback
  12. Retracing the Past: LLMs Emit Training Data When They Get Lost
  13. Robust Gymnasium: A Unified Modular Benchmark for Robust Reinforcement Learning
  14. Sycophancy Mitigation Through Reinforcement Learning with Uncertainty-Aware Adaptive Reasoning Trajectories
  15. Algorithm of Thoughts: Enhancing Exploration of Ideas in Large Language Models
  16. Balance Reward and Safety Optimization for Safe Reinforcement Learning: A Perspective of Gradient Manipulation
  17. Boosting Alignment for Post-Unlearning Text-to-Image Generative Models
  18. Can We Trust the Performance Evaluation of Uncertainty Estimation Methods in Text Summarization?
  19. Enhancing Efficiency of Safe Reinforcement Learning via Sample Manipulation
  20. Fairness-Aware Meta-Learning via Nash Bargaining
  21. InternalInspector I²: Robust Confidence Estimation in LLMs through Internal States
  22. Pausing Policy Learning in Non-stationary Reinforcement Learning
  23. Skin-in-the-Game: Decision Making via Multi-Stakeholder Alignment in LLMs
  24. The Mirrored Influence Hypothesis: Efficient Data Influence Estimation by Harnessing Forward Passes