PPaperPicks

Zhen Li

Chinese University of Hong Kong, Shenzhen Research Institute of Big Data, Shenzhen, China

37 papers at tracked venues · 24 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Composition-Incremental Learning for Compositional Generalization
    AAAI 2026 · Zhen Li
  2. DriveFlow: Rectified Flow Adaptation for Robust 3D Object Detection in Autonomous Driving
  3. MDK12-Bench: A Multi-Discipline Benchmark for Evaluating Reasoning in Multimodal Large Language Models
  4. PiSA: A Self-Augmented Data Engine and Training Strategy for 3D Understanding with Large Models
  5. Advancing Dense Endoscopic Reconstruction with Gaussian Splatting-Driven Surface Normal-Aware Tracking and Mapping
  6. AffordBot: 3D Fine-grained Embodied Reasoning via Multimodal Large Language Models
  7. CLEA: Closed-Loop Embodied Agent for Enhancing Task Execution in Dynamic Environments
  8. CoPESD: A Multi-Level Surgical Motion Dataset for Training Large Vision-Language Models to Co-Pilot Endoscopic Submucosal Dissection
  9. Consistency of Compositional Generalization Across Multiple Levels
  10. DSPNet: Dual-vision Scene Perception for Robust 3D Question Answering
  11. DriveGEN: Generalized and Robust 3D Detection in Driving via Controllable Text-to-Image Diffusion Generation
  12. ETSM: Automating Dissection Trajectory Suggestion and Confidence Map-Based Safety Margin Prediction for Robot-Assisted Endoscopic Submucosal Dissection
  13. Empowering Large Language Models with 3D Situation Awareness
  14. Lumina-Image 2.0: a Unified and Efficient Image Generative Framework
  15. Multi-Sourced Compositional Generalization in Visual Question Answering
  16. Position: Prospective of Autonomous Driving - Multimodal LLMs, World Models, Embodied Intelligence, AI Alignment, and Mamba
  17. SQS: Enhancing Sparse Perception Models via Query-based Splatting in Autonomous Driving
  18. Sekai: A Video Dataset towards World Exploration
    NeurIPS 2025 · Zhen Li
  19. Topo2Seq: Enhanced Topology Reasoning via Topology Sequence Learning
  20. VQA4CIR: Boosting Composed Image Retrieval with Visual Question Answering
  21. VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving
  22. Chained Flexible Capsule Endoscope: Unraveling the Conundrum of Size Limitations and Functional Integration for Gastrointestinal Transitivity
  23. Compositional Substitutivity of Visual Reasoning for Visual Question Answering
  24. CrossBind: Collaborative Cross-Modal Identification of Protein Nucleic-Acid-Binding Residues
  25. DV-3DLane: End-to-end Multi-modal 3D Lane Detection with Dual-view Representation
  26. EndoUIC: Promptable Diffusion Transformer for Unified Illumination Correction in Capsule Endoscopy
  27. In-Context Compositional Generalization for Large Vision-Language Models
  28. Magnetic-Guided Flexible Origami Robot toward Long-Term Phototherapy of H. pylori in the Stomach
  29. MonoTTA: Fully Test-Time Adaptation for Monocular 3D Object Detection
  30. RadOcc: Learning Cross-Modality Occupancy Knowledge through Rendering Assisted Distillation
  31. SearchLVLMs: A Plug-and-Play Framework for Augmenting Large Vision-Language Models by Searching Up-to-Date Internet Knowledge
  32. Towards Flexible 3D Perception: Object-Centric Occupancy Completion Augments 3D Object Detection
  33. Towards a Benchmark for Colorectal Cancer Segmentation in Endorectal Ultrasound Videos: Dataset and Model Development
  34. Unified Generation, Reconstruction, and Representation: Generalized Diffusion with Adaptive Latent Encoding-Decoding
  35. Visual Programming for Zero-Shot Open-Vocabulary 3D Visual Grounding
  36. WeakPCSOD: Overcoming the Bias of Box Annotations for Weakly Supervised Point Cloud Salient Object Detection
  37. X4D-SceneFormer: Enhanced Scene Understanding on 4D Point Cloud Videos through Cross-Modal Knowledge Transfer