PPaperPicks

Shanghang Zhang

71 papers at tracked venues · 58 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. FastDriveVLA: Efficient End-to-End Driving via Plug-and-Play Reconstruction-based Token Pruning
  2. MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs
  3. MoLe-VLA: Dynamic Layer-skipping Vision Language Action Model via Mixture-of-Layers for Efficient Robot Manipulation
  4. NavA³: Understanding Any Instruction, Navigating Anywhere, Finding Anything
  5. 4D Visual Pre-Training for Robot Learning
  6. AC-DiT: Adaptive Coordination Diffusion Transformer for Mobile Manipulation
  7. AffordGrasp: In-Context Affordance Reasoning for Open-Vocabulary Task-Oriented Grasping in Clutter
  8. Authentic 4D Driving Simulation with a Video Generation Model
  9. Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs
  10. Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs
  11. Co3Gesture: Towards Coherent Concurrent Co-speech 3D Gesture Generation with Interactive Diffusion
  12. Decouple Distortion from Perception: Region Adaptive Diffusion for Extreme-low Bitrate Perception Image Compression
  13. DesignEdit: Unify Spatial-Aware Image Editing via Training-free Inpainting with a Multi-Layered Latent Diffusion Framework
  14. Draw-and-Understand: Leveraging Visual Prompts to Enable MLLMs to Comprehend What You Want
  15. EMD: Explicit Motion Modeling for High-Quality Street Gaussian Splatting
  16. EmbodiedOcc++: Boosting Embodied 3D Occupancy Prediction with Plane Regularization and Uncertainty Sampler
  17. Empowering World Models with Reflection for Embodied Video Prediction
  18. Fast-in-Slow: A Dual-System VLA Model Unifying Fast Manipulation within Slow Reasoning
  19. FreqMoE: Dynamic Frequency Enhancement for Neural PDE Solvers
  20. High-Quality 3D Creation From a Single Image Using Subject-Specific Knowledge Prior
  21. LiDAR-LLM: Exploring the Potential of Large Language Models for 3D LiDAR Understanding
  22. Lift3D Policy: Lifting 2D Foundation Models for Robust 3D Robotic Manipulation
  23. LongDPO: Unlock Better Long-form Generation Abilities for LLMs via Critique-augmented Stepwise Information
  24. MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine
  25. MapNav: A Novel Memory Representation via Annotated Semantic Maps for VLM-based Vision-and-Language Navigation
  26. MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders
  27. Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation
  28. OmniArch: Building Foundation Model for Scientific Computing
  29. Orochi: Versatile Biomedical Image Processor
  30. PINNsAgent: Automated PDE Surrogation with Large Language Models
  31. Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
  32. Research Challenges and Progress in the End-to-End V2X Cooperative Autonomous Driving Competition
  33. RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete
  34. RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics
  35. RwoR: Generating Robot Demonstrations from Human Hand Collection for Policy Learning without Robot
  36. SAN: Hypothesizing Long-Term Synaptic Development and Neural Engram Mechanism in Scalable Model's Parameter-Efficient Fine-Tuning
  37. SEEA-R1: Tree-Structured Reinforcement Fine-Tuning for Self-Evolving Embodied Agents
  38. Segment Any Motion in Videos
  39. SliceOcc: Indoor 3D Semantic Occupancy Prediction with Vertical Slice Representation
  40. SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference
  41. Subgraph Aggregation for Out-of-Distribution Generalization on Graphs
  42. URDF-Anything: Constructing Articulated Objects with 3D Multimodal Language Model
  43. Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought
  44. BEVUDA: Multi-geometric Space Alignments for Domain Adaptive BEV 3D Object Detection
  45. ChatEval: Towards Better LLM-based Evaluators through Multi-Agent Debate
  46. Cloud-Device Collaborative Learning for Multimodal Large Language Models
  47. Compositional Few-Shot Class-Incremental Learning
  48. Continual-MAE: Adaptive Distribution Masked Autoencoders for Continual Test-Time Adaptation
  49. Distribution-Aware Continual Test-Time Adaptation for Semantic Segmentation
  50. Efficient Deweahter Mixture-of-Experts with Uncertainty-Aware Feature-Wise Linear Modulation
  51. Era3D: High-Resolution Multiview Diffusion using Efficient Row-wise Attention
  52. Exploring Sparse Visual Prompt for Domain Adaptive Dense Prediction
  53. FM-OV3D: Foundation Model-Based Cross-Modal Knowledge Blending for Open-Vocabulary 3D Detection
  54. FreeKD: Knowledge Distillation via Semantic Frequency Prompt
  55. Gradient-based Parameter Selection for Efficient Fine-Tuning
  56. I-MedSAM: Implicit Medical Image Segmentation with Segment Anything
  57. LLM as Dataset Analyst: Subpopulation Structure Discovery with Large Language Model
  58. Learning from Mistakes: Iterative Prompt Relabeling for Text-to-Image Diffusion Model Training
  59. Leveraging Imagery Data with Spatial Point Prior for Weakly Semi-supervised 3D Object Detection
  60. NTO3D: Neural Target Object 3D Reconstruction with Segment Anything
  61. PromptCoT: Align Prompt Distribution via Adapted Chain-of-Thought
  62. RenderOcc: Vision-Centric 3D Occupancy Prediction with 2D Rendering Supervision
  63. RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation
  64. Split-Ensemble: Efficient OOD-aware Ensemble via Task and Model Splitting
  65. Unleashing the Potentials of Likelihood Composition for Multi-modal Language Models
  66. Unsupervised Spike Depth Estimation via Cross-modality Cross-domain Knowledge Transfer
  67. Unveiling the Tapestry of Consistency in Large Vision-Language Models
  68. VeCAF: Vision-language Collaborative Active Finetuning with Training Objective Awareness
  69. ViDA: Homeostatic Visual Domain Adapter for Continual Test Time Adaptation
  70. VoroNav: Voronoi-based Zero-shot Object Navigation with Large Language Model
  71. Weakly-Supervised Emotion Transition Learning for Diverse 3D Co-Speech Gesture Generation