PPaperPicks

Hang Su

Tsinghua University, Department of Computer Science and Technology, Beijing, China

42 papers at tracked venues · 33 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Benchmarking Trustworthiness in Multimodal LLMs for Video Understanding
  2. Dual-Seed Evolutionary Algorithm for Noise Optimization in Diffusion Models
  3. H-RDT: Human Manipulation Enhanced Bimanual Robotic Manipulation
  4. LCO: LLM-based Constraint Optimization for Safer Agentic LLMs in Real-world Tasks
  5. Red Teaming Large Reasoning Models
  6. Accelerating PDE-Constrained Optimization by the Derivative of Neural Operators
  7. AdvDreamer Unveils: Are Vision-Language Models Truly Ready for Real-World 3D Variations?
  8. AutoBreach: Universal and Adaptive Jailbreaking with Efficient Wordplay-Guided Optimization via Multi-LLMs
  9. Exploring the Generalizability of Factual Hallucination Mitigation via Enhancing Precise Knowledge Utilization
  10. Graph Diffusion for Robust Multi-Agent Coordination
  11. RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation
  12. Self-Consistent Model-based Adaptation for Visual Reinforcement Learning
  13. Toward Guidance-Free AR Visual Generation via Condition Contrastive Alignment
  14. Visual Generation Without Guidance
  15. Aligning Diffusion Behaviors with Q-functions for Efficient Continuous Control
  16. CRM: Single Image to 3D Textured Mesh with Convolutional Reconstruction Model
  17. Controllable Navigation Instruction Generation with Chain of Thought Prompting
  18. DIFFender: Diffusion-Based Adversarial Defense Against Patch Attacks
  19. DPOT: Auto-Regressive Denoising Operator Transformer for Large-Scale PDE Pre-Training
  20. Diffusion Models are Certifiably Robust Classifiers
  21. Embodied Active Defense: Leveraging Recurrent Feedback to Counter Adversarial Patches
  22. Exploring the Robustness of Decision-Level Through Adversarial Attacks on LLM-Based Embodied Models
  23. Exploring the Transferability of Visual Prompting for Multimodal Large Language Models
  24. FeedFace: Efficient Inference-based Face Personalization via Diffusion Models
  25. Fourier Controller Networks for Real-Time Decision-Making in Embodied Learning
  26. Full-Distance Evasion of Pedestrian Detectors in the Physical World
  27. Grounding DINO: Marrying DINO with Grounded Pre-training for Open-Set Object Detection
  28. Improved Operator Learning by Orthogonal Attention
  29. LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents
  30. Layer-Aware Analysis of Catastrophic Overfitting: Revealing the Pseudo-Robust Shortcut Dependency
  31. Machine Vision Therapy: Multimodal Large Language Models Can Enhance Visual Robustness via Denoising In-Context Learning
  32. Membership Inference on Text-to-Image Diffusion Models via Conditional Likelihood Discrepancy
  33. MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
  34. Noise Contrastive Alignment of Language Models with Explicit Rewards
  35. Omniview-Tuning: Boosting Viewpoint Invariance of Vision-Language Pre-training Models
  36. PEAC: Unsupervised Pre-training for Cross-Embodiment Reinforcement Learning
  37. PINNacle: A Comprehensive Benchmark of Physics-Informed Neural Networks for Solving PDEs
  38. Reference Neural Operators: Learning the Smooth Dependence of Solutions of PDEs on Geometric Deformations
  39. Rethinking Model Ensemble in Transfer-based Adversarial Attacks
  40. Robust Classification via a Single Diffusion Model
  41. Score Regularized Policy Optimization through Diffusion Behavior
  42. Towards Transferable Targeted 3D Adversarial Attack in the Physical World