PPaperPicks

Wei Ji

Nanjing University, School of Intelligence Science and Technology, Nanjing, China

29 papers at tracked venues · 27 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Evolving Generalist Virtual Agents with Generative and Associative Memory
  2. Generation-Augmented Video Corpus Moment Retrieval
  3. Towards Unified Vision-Language Models with Incomplete Multi-Modal Inputs
  4. Coarse-to-Fine Cross-Modality Generation for Enhancing Vehicle Re-Identification with High-Fidelity Synthetic Data
  5. Counterfactual Evolution of Multimodal Datasets via Visual Programming
  6. EvolvedGRPO: Unlocking Reasoning in LVLMs via Progressive Instruction Evolution
  7. Few-Shot Incremental Learning via Foreground Aggregation and Knowledge Transfer for Audio-Visual Semantic Segmentation
  8. FormFactory: An Interactive Benchmarking Suite for Multimodal Form-Filling Agents
  9. Generalized Video Moment Retrieval
  10. On Efficiency-Effectiveness Trade-off of Diffusion-based Recommenders
  11. The 1st NIP@IR Workshop on New Interaction Paradigms for Information Retrieval in the Era of Generative AI
  12. Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
  13. VimoRAG: Video-based Retrieval-augmented 3D Motion Generation for Motion Language Models
  14. What Limits Virtual Agent Application? OmniBench: A Scalable Multi-Dimensional Benchmark for Essential Virtual Agent Capabilities
  15. Composed Image Retrieval with Text Feedback via Multi-grained Uncertainty Regularization
  16. De-fine: Decomposing and Refining Visual Programs with Auto-Feedback
  17. Dysen-VDM: Empowering Dynamics-Aware Text-to-Video Diffusion with LLMs
  18. Fine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative Instructions
  19. Hierarchical Debiasing and Noisy Correction for Cross-domain Video Tube Retrieval
  20. I3: Intent-Introspective Retrieval Conditioned on Instructions
  21. NExT-Chat: An LMM for Chat, Detection and Segmentation
  22. NExT-GPT: Any-to-Any Multimodal LLM
  23. Panoptic Scene Graph Generation with Semantics-Prototype Learning
  24. Semantic Alignment for Multimodal Large Language Models
  25. SpeechEE: A Novel Benchmark for Speech Event Extraction
  26. Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation Matching
  27. Towards Small Object Editing: A Benchmark Dataset and A Training-Free Approach
  28. Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition
  29. Weakly Supervised Video Moment Retrieval via Location-irrelevant Proposal Learning
    WWW 2024 · Wei Ji