PPaperPicks

Di Hu

Baidu Research, Big Data Laboratory, Beijing, China

23 papers at tracked venues · 16 at CORE A* · active 20242025

Venues

Frequent coauthors

Papers

  1. Adaptive Unimodal Regulation for Balanced Multimodal Information Acquisition
  2. AnyTouch: Learning Unified Static-Dynamic Representation across Multiple Visuo-tactile Sensors
  3. Crab: A Unified Audio-Visual Scene Understanding Model with Explicit Cooperation
  4. Efficient Quantification of Multimodal Interaction at Sample Level
  5. MGIPF: Multi-Granularity Interest Prediction Framework for Personalized Recommendation
  6. MokA: Multimodal Low-Rank Adaptation for MLLMs
  7. Patch Matters: Training-free Fine-grained Image Caption Enhancement via Local Perception
  8. Phoenix: A Motion-based Self-Reflection Framework for Fine-grained Robotic Action Correction
  9. RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer
  10. Towards Effective and Efficient Continual Pre-training of Large Language Models
  11. Boosting Audio Visual Question Answering via Key Semantic-Aware Cues
  12. Can Textual Semantics Mitigate Sounding Object Segmentation Preference?
  13. Depth Helps: Improving Pre-trained RGB-based Policy with Depth Information Injection
  14. Diagnosing and Re-learning for Balanced Multimodal Learning
  15. Enhancing Multimodal Cooperation via Sample-Level Modality Valuation
  16. Kinematic-aware Prompting for Generalizable Articulated Object Manipulation with LLMs
  17. Learning Manipulation by Predicting Interaction
  18. MMPareto: Boosting Multimodal Learning with Innocent Unimodal Assistance
  19. Prompting Segmentation with Sound Is Generalizable Audio-Visual Source Localizer
  20. Quantifying and Enhancing Multi-modal Robustness with Modality Preference
  21. Ref-AVS: Refer and Segment Objects in Audio-Visual Scenes
  22. Stepping Stones: A Progressive Training Strategy for Audio-Visual Semantic Segmentation
  23. Unveiling and Mitigating Bias in Audio Visual Segmentation