PPaperPicks

Federico Tombari

Google, Zurich, Switzerland

62 papers at tracked venues · 39 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Mixed Diffusion for 3D Indoor Scene Synthesis
  2. OracleGS: Grounding Generative Priors for Sparse-View Gaussian Splatting
  3. RiemanLine: Riemannian Manifold Representation of 3D Lines for Factor Graph Optimization
  4. 4D Gaussian Splatting SLAM
  5. Active Data Curation Effectively Distills Large-Scale Multimodal Models
  6. Contrastive Test-Time Composition of Multiple LoRA Models for Image Generation
  7. CubeDiff: Repurposing Diffusion-Based Image Models for Panorama Generation
  8. ESCAPE: Equivariant Shape Completion via Anchor Point Encoding
  9. Gatekeeper: Improving Model Cascades Through Confidence Tuning
  10. Hierarchical 3D Scene Graphs Construction Outdoors
  11. How Good is my Video-LMM? Complex Video Reasoning and Robustness Evaluation Suite for Video-LMMs
  12. LIME: Localized Image Editing via Attention Regularization in Diffusion Models
  13. LODGE: Level-of-Detail Large-Scale Gaussian Splatting with Efficient Rendering
  14. LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models
  15. Learning Neural Exposure Fields for View Synthesis
  16. Learning to Prompt with Text Only Supervision for Vision-Language Models
  17. LiLoc: Lifelong Localization Using Adaptive Submap Joining and Egocentric Factor Graph
  18. LoRACLR: Contrastive Adaptation for Customization of Diffusion Models
  19. MOBIUS: Big-to-Mobile Universal Instance Segmentation via Multi-modal Bottleneck Fusion and Calibrated Decoder Pruning
  20. Object-X: Learning to Reconstruct Multi-Modal 3D Object Representations
  21. Omnia de EgoTempo: Benchmarking Temporal Understanding of Multi-Modal LLMs in Egocentric Videos
  22. One2Any: One-Reference 6D Pose Estimation for Any Object
  23. Prior2former - Evidential Modeling of Mask Transformers for Assumption-Free Open-World Panoptic Segmentation
  24. RelationField: Relate Anything in Radiance Fields
  25. Semantic Library Adaptation: LoRA Retrieval and Fusion for Open-Vocabulary Semantic Segmentation
  26. Splat-SLAM: Globally Optimized RGB-only SLAM with 3D Gaussians
  27. Test-Time Visual In-Context Tuning
  28. TokenFormer: Rethinking Transformer Scaling with Tokenized Model Parameters
  29. Towards Real-Time Open-Vocabulary Video Instance Segmentation
  30. UIP2P: Unsupervised Instruction-Based Image Editing via Edit Reversibility Constraint
  31. UNOPose: Unseen Object Pose Estimation with an Unposed RGB-D Reference Image
  32. Video Perception Models for 3D Scene Synthesis
  33. BRAVE: Broadening the Visual Encoding of Vision-Language Models
  34. CONFORM: Contrast is All You Need For High-Fidelity Text-to-Image Diffusion Models
  35. D-SCo: Dual-Stream Conditional Diffusion for Monocular Hand-Held Object Reconstruction
  36. DNS-SLAM: Dense Neural Semantic-Informed SLAM
  37. Denoising Diffusion via Image-Based Rendering
  38. EchoScene: Indoor Scene Generation via Information Echo Over Scene Graph Diffusion
  39. Extracting Training Data From Document-Based VQA Models
  40. GeoGaussian: Geometry-Aware Gaussian Splatting for Scene Rendering
  41. HyperSDFusion: Bridging Hierarchical Structures in Language and Geometry for Enhanced 3D Text2Shape Generation
  42. KP-RED: Exploiting Semantic Keypoints for Joint 3D Shape Retrieval and Deformation
  43. Know Your Neighbors: Improving Single-View Reconstruction via Spatial Vision-Language Reasoning
  44. LanPose: Language-Instructed 6D Object Pose Estimation for Robotic Assembly
  45. MOHO: Learning Single-View Hand-Held Object Reconstruction with Multi-View Occlusion-Aware Supervision
  46. Neural Semantic Map-Learning for Autonomous Vehicles
  47. OpenNeRF: Open Set 3D Neural Scene Segmentation with Pixel-Wise Features and Rendered Novel Views
  48. P2P-Bridge: Diffusion Bridges for 3D Point Cloud Denoising
  49. PhysAvatar: Learning the Physics of Dressed 3D Avatars from Visual Observations
  50. Physics-Encoded Graph Neural Networks for Deformation Prediction under Contact
  51. SG-Bot: Object Rearrangement via Coarse-to-Fine Robotic Imagination on Scene Graphs
  52. SILC: Improving Vision Language Pretraining with Self-distillation
  53. SceneFun3D: Fine-Grained Functionality and Affordance Understanding in 3D Scenes
  54. SceneGraphLoc: Cross-Modal Coarse Visual Localization on 3D Scene Graphs
  55. SecondPose: SE(3)-Consistent Dual-Stream Feature Fusion for Category-Level Pose Estimation
  56. Segment3D: Learning Fine-Grained Class-Agnostic 3D Segmentation Without Manual Labels
  57. Self-supervised Shape Completion via Involution and Implicit Correspondences
  58. SemiVL: Semi-Supervised Semantic Segmentation with Vision-Language Guidance
  59. Stylebreeder: Exploring and Democratizing Artistic Styles through Text-to-Image Models
  60. Text-Conditioned Resampler For Long Form Video Understanding
  61. UniSDF: Unifying Neural Representations for High-Fidelity 3D Reconstruction of Complex Scenes with Reflections
  62. Zero123-6D: Zero-shot Novel View Synthesis for RGB Category-level 6D Pose Estimation