PPaperPicks

Yu-Gang Jiang

Fudan University, School of Computer Science, Shanghai, China

79 papers at tracked venues · 65 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Actor-Critic for Continuous Action Chunks: A Reinforcement Learning Framework for Long-Horizon Robotic Manipulation with Sparse Reward
  2. Human2Robot: Learning Robot Actions from Paired Human-Robot Videos
  3. Identity-Aware Vision-Language Model for Explainable Face Forgery Detection
  4. MDiff4STR: Mask Diffusion Model for Scene Text Recognition
  5. Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models
  6. AIM: Additional Image Guided Generation of Transferable Adversarial Attacks
  7. Achieving More with Less: Additive Prompt Tuning for Rehearsal-Free Class-Incremental Learning
  8. AdaDiff: Adaptive Step Selection for Fast Diffusion Models
  9. Adaptive Retention & Correction: Test-Time Training for Continual Learning
  10. AgentGym: Evaluating and Training Large Language Model-based Agents across Diverse Environments
  11. Aid: Adapting Image2video Diffusion Models for Instruction-Guided Video Prediction
  12. BadPatch: Diffusion-Based Generation of Physical Adversarial Patches
  13. BlueSuffix: Reinforced Blue Teaming for Vision-Language Models Against Jailbreak Attacks
  14. BrokenVideos: A Benchmark Dataset for Fine-Grained Artifact Localization in AI-Generated Videos
  15. Comprehensive Multi-Modal Prototypes Are Simple and Effective Classifiers for Vast-Vocabulary Object Detection
  16. CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation
  17. Domain-RAG: Retrieval-Guided Compositional Image Generation for Cross-Domain Few-Shot Object Detection
  18. DuMo: Dual Encoder Modulation Network for Precise Concept Erasure
  19. EditMaster: Bridging Text instruction and Visual Example for Multimodal guided Image Editing
  20. EvoWiki: Evaluating LLMs on Evolving Knowledge
  21. FaceA-Net: Facial Attribute-Driven ID Preserving Image Generation Network
  22. FedAPT: Federated Adversarial Prompt Tuning for Vision-Language Models
  23. ForgerySleuth: Empowering Multimodal Large Language Models for Image Manipulation Detection
  24. From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning
  25. HumanoidGen: Data Generation for Bimanual Dexterous Manipulation via LLM Reasoning
  26. INST-IT: Boosting Instance Understanding via Explicit Visual Prompt Instruction Tuning
  27. Ideator: Jailbreaking and Benchmarking Large Vision-Language Models Using Themselves
  28. Look Before You Decide: Prompting Active Deduction of MLLMs for Assumptive Reasoning
  29. MotionFollower: Editing Video Motion via Score-Guided Diffusion
  30. OmniGen-AR: AutoRegressive Any-to-Image Generation
  31. OmniSVG: A Unified Scalable Vector Graphics Generation Model
  32. Optimizing Cross-Client Domain Coverage for Federated Instruction Tuning of Large Language Models
  33. Out of Length Text Recognition with Sub-String Matching
  34. ProLongVid: A Simple but Strong Baseline for Long-context Video Instruction Tuning
  35. RAG-6DPose: Retrieval-Augmented 6D Pose Estimation via Leveraging CAD as Knowledge Base
  36. REDUCIO! Generating 1K Video Within 16 Seconds Using Extremely Compressed Motion Latents
  37. Retrieval Augmented Recipe Generation
  38. SAMA: Towards Multi-Turn Referential Grounded Video Chat with Large Language Models
  39. SVTRv2: CTC Beats Encoder-Decoder Models in Scene Text Recognition
  40. SafeVid: Toward Safety Aligned Video Large Multimodal Models
  41. T2UE: Generating Unlearnable Examples from Text Descriptions
  42. TP-MDDN: Task-Preferenced Multi-Demand-Driven Navigation with Autonomous Decision-Making
  43. Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation
  44. UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding
  45. VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks
  46. You Only Estimate Once: Unified, One-stage, Real-Time Category-Level Articulated Object 6D Pose Estimation for Robotic Grasping
  47. AdvQDet: Detecting Query-Based Adversarial Attacks with Adversarial Contrastive Prompt Tuning
  48. Adversarial Prompt Tuning for Vision-Language Models
  49. AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling
  50. Decoder Pre-Training with only Text for Scene Text Recognition
  51. DeepStack: Deeply Stacking Visual Tokens is Surprisingly Simple and Effective for LMMs
  52. Doubly Abductive Counterfactual Inference for Text-Based Image Editing
  53. DreamMesh: Jointly Manipulating and Texturing Triangle Meshes for Text-to-3D Generation
  54. Fake Alignment: Are LLMs Really Aligned Well?
  55. FreeEnhance: Tuning-Free Image Enhancement via Content-Consistent Noising-and-Denoising Process
  56. GenRec: Unifying Video Generation and Recognition with Diffusion Models
  57. Highly Transferable Diffusion-based Unrestricted Adversarial Attack on Pre-trained Vision-Language Models
  58. Identity-Driven Multimedia Forgery Detection via Reference Assistance
  59. Instance-Aware Multi-Camera 3D Object Detection with Structural Priors Mining and Self-Boosting Learning
  60. LRANet: Towards Accurate and Efficient Scene Text Detection with Low-Rank Approximation Network
  61. Learning to Rank Patches for Unbiased Image Redundancy Reduction
  62. Lumen: Unleashing Versatile Vision-Centric Capabilities of Large Multimodal Models
  63. MMLONGBENCH-DOC: Benchmarking Long-context Document Understanding with Visualizations
  64. MagDiff: Multi-alignment Diffusion for High-Fidelity Video Generation and Editing
  65. ModelLock: Locking Your Model With a Spell
  66. MotionEditor: Editing Video Motion via Content-Aware Diffusion
  67. Navigating Weight Prediction with Diet Diary
  68. NuScenes-QA: A Multi-Modal Visual Question Answering Benchmark for Autonomous Driving Scenario
  69. OmniTokenizer: A Joint Image-Video Tokenizer for Visual Generation
  70. OmniViD: A Generative Framework for Universal Video Understanding
  71. PromptFusion: Decoupling Stability and Plasticity for Continual Learning
  72. ReToMe-VA: Recursive Token Merging for Video Diffusion-based Unrestricted Adversarial Attack
  73. Reliable and Efficient Concept Erasure of Text-to-Image Diffusion Models
  74. SegIC: Unleashing the Emergent Correspondence for In-Context Segmentation
  75. SimDA: Simple Diffusion Adapter for Efficient Video Generation
  76. UnSeg: One Universal Unlearnable Example Generator is Enough against All Image Segmentation
  77. Unlocking Textual and Visual Wisdom: Open-Vocabulary 3D Object Detection Enhanced by Comprehensive Guidance from Text and Image
  78. White-box Multimodal Jailbreaks Against Large Vision-Language Models
  79. Zero-shot High-fidelity and Pose-controllable Character Animation