PPaperPicks

Jianbing Shen

Beijing Institute of Technology, School of Computer Science and Technology, China

33 papers at tracked venues · 29 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Accelerating Training of Autoregressive Video Generation Models via Local Optimization with Representation Continuity
  2. Compatibility-Aware Dynamic Fine-Tuning for Large Language Models
  3. Less Is More: Vision Representation Compression for Efficient Video Generation with Large Language Models
  4. Multimodal Large Language Models for Multi-Subject In-Context Image Generation
  5. Sim4Seg: Boosting Multimodal Multi-disease Medical Diagnosis Segmentation with Region-Aware Vision-Language Similarity Masks
  6. Towards High-Fidelity 3D Portrait Generation with Rich Details by Cross-View Prior-Aware Diffusion
  7. ALOcc: Adaptive Lifting-Based 3D Semantic Occupancy and Cost Volume-Based Flow Predictions
  8. Alternate Geometric and Semantic Denoising Diffusion for Protein Inverse Folding
  9. DC-ControlNet: Decoupling Inter- and Intra-Element Conditions in Image Generation with Diffusion Models
  10. DME-Driver: Integrating Human Decision Logic and 3D Scene Perception in Autonomous Driving
  11. Decoupling Fine Detail and Global Geometry for Compressed Depth Map Super-Resolution
  12. DrivingSphere: Building a High-fidelity 4D World for Closed-loop Simulation
  13. Improving Medical Large Vision-Language Models with Abnormal-Aware Feedback
  14. LOGICZSL: Exploring Logic-induced Representation for Compositional Zero-shot Learning
  15. Language Prompt for Autonomous Driving
  16. MAM: Modular Multi-Agent Framework for Multi-Modal Medical Diagnosis via Role-Specialized Collaboration
  17. OLiDM: Object-aware LiDAR Diffusion Models for Autonomous Driving
  18. RAGNet: Large-Scale Reasoning-Based Affordance Segmentation Benchmark Towards General Grasping
  19. RLGF: Reinforcement Learning with Geometric Feedback for Autonomous Driving Video Generation
  20. Rethinking Temporal Fusion with a Unified Gradient Descent View for 3D Semantic Occupancy Prediction
  21. Self-Rewarding Large Vision-Language Models for Optimizing Prompts in Text-to-Image Generation
  22. Semantic Causality-Aware Vision-Based 3D Occupancy Prediction
  23. Weak to Strong Generalization for Large Language Models with Multi-capabilities
  24. Compressed Depth Map Super-Resolution and Restoration: AIM 2024 Challenge Results
  25. DI-V2X: Learning Domain-Invariant Representation for Vehicle-Infrastructure Collaborative 3D Object Detection
  26. Fine-Grained Distillation for Long Document Retrieval
  27. High-Precision Self-supervised Monocular Depth Estimation with Rich-Resource Prior
  28. IS-Fusion: Instance-Scene Collaborative Fusion for Multimodal 3D Object Detection
  29. Leveraging Frame Affinity for sRGB-to-RAWVideo De-Rendering
  30. Prior Metadata-Driven RAW Reconstruction: Eliminating the Need for Per-Image Metadata
  31. RepVF: A Unified Vector Fields Representation for Multi-task 3D Perception
  32. TopoMLP: A Simple yet Strong Pipeline for Driving Topology Reasoning
  33. Visual In-Context Learning for Large Vision-Language Models