PPaperPicks

Jindong Gu

49 papers at tracked venues · 34 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. AUVIC: Adversarial Unlearning of Visual Concepts for Multi-modal Large Language Models
  2. Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models
  3. Can Editing LLMs Inject Harm?
  4. Knowledge Control for Responsible Generative AI: Bridging Academia, Industry, and Society
  5. You Only Need One Single Token to Refine Safety Alignment
  6. AlignGuard: Scalable Safety Alignment for Text-to-Image Generation
  7. Benchmarking Open-ended Audio Dialogue Understanding for Large Audio-Language Models
  8. CL-Cross VQA: A Continual Learning Benchmark for Cross-Domain Visual Question Answering
  9. Can Knowledge-Graph-based Retrieval Augmented Generation Really Retrieve What You Need?
  10. Can Multimodal Large Language Models Truly Perform Multimodal In-Context Learning?
  11. Can an Individual Manipulate the Collective Decisions of Multi-Agents?
  12. Fair Generation without Unfair Distortions: Debiasing Text-To-Image Generation with Entanglement-Free Attention
  13. FedBiP: Heterogeneous One-Shot Federated Learning with Personalized Latent Diffusion Models
  14. FedPop: Federated Population-based Hyperparameter Tuning
  15. Flaw or Artifact? Rethinking Prompt Sensitivity in Evaluating LLMs
  16. FocalPO: Enhancing Preference Optimizing by Focusing on Correct Preference Rankings
  17. Image Token Matters: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing
  18. Improved Techniques for Optimization-Based Jailbreaking on Large Language Models
  19. Jailbreak-AudioBench: In-Depth Evaluation and Analysis of Jailbreak Threats for Large Audio Language Models
  20. LLM Jailbreak Detection for (Almost) Free!
  21. Localizing Events in Videos with Multimodal Queries
  22. Magnet: Multi-turn Tool-use Data Synthesis and Distillation via Graph Translation
  23. Multimodal Pragmatic Jailbreak on Text-to-image Models
  24. Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models
  25. PlanGEN: A Multi-Agent Framework for Generating Planning and Reasoning Trajectories for Complex Problem Solving
  26. Primitive Vision: Improving Diagram Understanding in MLLMs
  27. REAL: Benchmarking Autonomous Agents on Deterministic Simulations of Real Websites
  28. ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos
  29. Reimagining Safety Alignment with An Image
  30. Transfer Attack for Bad and Good: Explain and Boost Adversarial Transferability across Multimodal Large Language Models
  31. An Image Is Worth 1000 Lies: Transferability of Adversarial Images across Prompts on Vision-Language Models
  32. As Firm As Their Foundations: Creating Transferable Adversarial Examples Across Downstream Tasks with CLIP
  33. Can Large Language Model Agents Simulate Human Trust Behavior?
  34. Dataset Distillation by Automatic Training Trajectories
  35. Discretization-Induced Dirichlet Posterior for Robust Uncertainty Quantification on Regression
  36. Does Few-Shot Learning Suffer from Backdoor Attacks?
  37. FedDAT: An Approach for Foundation Model Finetuning in Multi-Modal Heterogeneous Federated Learning
  38. Hide in Thicket: Generating Imperceptible and Rational Adversarial Perturbations on 3D Point Clouds
  39. Improving Adversarial Transferability via Model Alignment
  40. Inducing High Energy-Latency of Large Vision-Language Models with Verbose Images
  41. Influencer Backdoor Attack on Semantic Segmentation
  42. Initialization Matters for Adversarial Transfer Learning
  43. Latent Guard: A Safety Framework for Text-to-Image Generation
  44. MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language Models
  45. Provably Better Explanations with Optimized Aggregation of Feature Attributions
  46. Self-Discovering Interpretable Diffusion Latent Directions for Responsible Text-to-Image Generation
  47. Unveiling Typographic Deceptions: Insights of the Typographic Vulnerability in Large Vision-Language Models
  48. Visual Question Decomposition on Multimodal Large Language Models
  49. Which Model Generated This Image? A Model-Agnostic Approach for Origin Attribution