PPaperPicks

Jingjing Chen

Fudan University, School of Computer Science, Shanghai Key Laboratory of Intelligent Information Processing, Shanghai, China

28 papers at tracked venues · 25 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Actor-Critic for Continuous Action Chunks: A Reinforcement Learning Framework for Long-Horizon Robotic Manipulation with Sparse Reward
  2. Copyright Infringement Detection in Text-to-Image Diffusion Models via Differential Privacy
  3. FreeInpaint: Tuning-free Prompt Alignment and Visual Rationality Enhancement in Image Inpainting
  4. Identity-Aware Vision-Language Model for Explainable Face Forgery Detection
  5. OSCBench: Benchmarking Object State Change in Text-to-Video Generation
  6. Object Fusion via Diffusion Time-step for Customized Image Editing with Single Example
  7. Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models
  8. DuMo: Dual Encoder Modulation Network for Precise Concept Erasure
  9. FaceA-Net: Facial Attribute-Driven ID Preserving Image Generation Network
  10. From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning
  11. IVCR-200K: A Large-Scale Multi-turn Dialogue Benchmark for Interactive Video Corpus Retrieval
  12. Look Before You Decide: Prompting Active Deduction of MLLMs for Assumptive Reasoning
  13. Retrieval Augmented Recipe Generation
  14. TAPT: Test-Time Adversarial Prompt Tuning for Robust Inference in Vision-Language Models
  15. UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding
  16. AdvQDet: Detecting Query-Based Adversarial Attacks with Adversarial Contrastive Prompt Tuning
  17. Doubly Abductive Counterfactual Inference for Text-Based Image Editing
  18. Highly Transferable Diffusion-based Unrestricted Adversarial Attack on Pre-trained Vision-Language Models
  19. Identity-Driven Multimedia Forgery Detection via Reference Assistance
  20. Instance-Aware Multi-Camera 3D Object Detection with Structural Priors Mining and Self-Boosting Learning
  21. Lumen: Unleashing Versatile Vision-Centric Capabilities of Large Multimodal Models
  22. Navigating Weight Prediction with Diet Diary
  23. NuScenes-QA: A Multi-Modal Visual Question Answering Benchmark for Autonomous Driving Scenario
  24. Open-Vocabulary Video Relation Extraction
  25. ReForm-Eval: Evaluating Large Vision Language Models via Unified Re-Formulation of Task-Oriented Benchmarks
  26. ReToMe-VA: Recursive Token Merging for Video Diffusion-based Unrestricted Adversarial Attack
  27. Reliable and Efficient Concept Erasure of Text-to-Image Diffusion Models
  28. Unlocking Textual and Visual Wisdom: Open-Vocabulary 3D Object Detection Enhanced by Comprehensive Guidance from Text and Image