PPaperPicks

Weidong Cai

University of Sydney, Australia

39 papers at tracked venues · 21 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. ART-ASyn: Anatomy-aware Realistic Texture-based Anomaly Synthesis Framework for Chest X-Rays
  2. Gene-DML: Dual-Pathway Multi-Level Discrimination for Gene Expression Prediction from Histopathology Images
  3. Gotta Hear Them All: Towards Sound Source Aware Audio Generation
  4. HiFusion: Hierarchical Intra-Spot Alignment and Regional Context Fusion for Spatial Gene Expression Prediction from Histopathology
  5. Through the Magnifying Glass: Adaptive Perception Magnification for Hallucination-Free VLM Decoding
  6. UniME-V2: MLLM-as-a-Judge for Universal Multimodal Embedding Learning
  7. AMNCutter: Affinity-Attention-Guided Multi-View Normalized Cutter for Unsupervised Surgical Instrument Segmentation
  8. Breaking the Modality Barrier: Universal Embedding Learning with Multimodal LLMs
  9. CA-W3D: Leveraging Context-Aware Knowledge for Weakly Supervised Monocular 3D Detection
  10. CLIP-CID: Efficient CLIP Distillation via Cluster-Instance Discrimination
  11. ChoreoMuse: Robust Music-to-Dance Video Generation with Style Transfer and Beat-Adherent Motion
  12. Dance any Beat: Blending Beats with Visuals in Dance Video Generation
  13. Diversity-Augmented Diffusion Network With LLM Assistance For Radiology Report Generation
  14. LLM-UM: The 1st Workshop on Large Language Model Using Multi-modal Data for User Modeling
  15. Multimodal Causal Reasoning Benchmark: Challenging Multimodal Large Language Models to Discern Causal Links Across Modalities
  16. ORID: Organ-Regional Information Driven Framework for Radiology Report Generation
  17. RealSyn: An Effective and Scalable Multimodal Interleaved Document Transformation Paradigm
  18. ScSAM: Debiasing Morphology and Distributional Variability in Subcellular Semantic Segmentation
  19. Seek Inner: LLM-Enhanced Information Mining for Medical Visual Question Answering
  20. VRM: Knowledge Distillation via Virtual Relation Matching
  21. Accurate Fetal Head Descent Assessment During Labor Using Video Swin Transformer and Wavelet-Based Multitask Learning for 2024 MICCAI Challenge IUGC
  22. Advancements in 3D Lane Detection Using LiDAR Point Clouds: From Data Collection to Model Development
  23. Controllable Contextualized Image Captioning: Directing the Visual Narrative Through User-Defined Highlights
  24. Cross-Domain Fiber Cluster Shape Analysis for Language Performance Cognitive Score Prediction
  25. Cross-View Consistency Regularisation for Knowledge Distillation
  26. Device-Wise Federated Network Pruning
  27. EgoSG: Learning 3D Scene Graphs from Egocentric RGB-D Sequences
  28. Enhancing Advanced Visual Reasoning Ability of Large Language Models
  29. LaPA: Latent Prompt Assist Model for Medical Visual Question Answering
  30. LaneCMKT: Boosting Monocular 3D Lane Detection with Cross-Modal Knowledge Transfer
  31. PaintHuman: Towards High-Fidelity Text-to-3D Human Texturing via Denoised Score Distillation
  32. RWKV-CLIP: A Robust Vision-Language Representation Learner
  33. Rethinking Domain Adaptive Optic Disc and Cup Segmentation in Fundus Image through Dynamic Diffusion Flow
  34. Revisiting Adaptive Cellular Recognition Under Domain Shifts: A Contextual Correspondence View
  35. SAT-Morph: Unsupervised Deformable Medical Image Registration Using Vision Foundation Models with Anatomically Aware Text Prompt
  36. Seeing Unseen: Discover Novel Biomedical Concepts via Geometry-Constrained Probabilistic Modeling
  37. Symmetry Awareness Encoded Deep Learning Framework for Brain Imaging Analysis
  38. Unsupervised Domain Adaptation for Tubular Structure Segmentation Across Different Anatomical Sources
  39. V2A-Mapper: A Lightweight Solution for Vision-to-Audio Generation by Connecting Foundation Models