PPaperPicks

Rongtao Xu

17 papers at tracked venues · 11 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Explicit Temporal-Semantic Modeling for Dense Video Captioning via Context-Aware Cross-Modal Interaction
  2. MoFu: Scale-Aware Modulation and Fourier Fusion for Multi-Subject Video Generation
  3. $A_{0}$: An Affordance-Aware Hierarchical Model for General Robotic Manipulation
    ICCV 2025 · Rongtao Xu
  4. 3D-MoRe: Unified Modal-Contextual Reasoning for Embodied Question Answering
    IROS 2025 · Rongtao Xu
  5. Complementary Information Guided Occupancy Prediction via Multi-Level Representation Fusion
    ICRA 2025 · Rongtao Xu
  6. Focus on Local: Finding Reliable Discriminative Regions for Visual Place Recognition
  7. MindTuner: Cross-Subject Visual Decoding with Visual Fingerprint and Semantic Correction
  8. PanoDiT: Panoramic Videos Generation with Diffusion Transformer
  9. PhyBlock: A Progressive Benchmark for Physical Understanding and Planning via 3D Block Assembly
  10. RoBridge: A Hierarchical Architecture Bridging Cognition and Execution for General Robotic Manipulation
  11. Segment Any Primitive: Zero-Shot 3D Primitive Segmentation from Point Cloud
  12. Structured Preference Optimization for Vision-Language Long-Horizon Task Planning
  13. DefFusion: Deformable Multimodal Representation Fusion for 3D Semantic Segmentation
    ICRA 2024 · Rongtao Xu
  14. MIM-HD: Making Smaller Masked Autoencoder Better with Efficient Distillation
  15. NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation
  16. NeuroClips: Towards High-fidelity and Smooth fMRI-to-Video Reconstruction
  17. Spectral Prompt Tuning: Unveiling Unseen Classes for Zero-Shot Semantic Segmentation