PPaperPicks

Zongyuan Ge

IBM Research - Australia, Carlton, VIC, Australia

40 papers at tracked venues · 22 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. CHiRPE: A Step Towards Real-World Clinical NLP with Clinician-Oriented Model Explanations
  2. PsychEthicsBench: Evaluating Large Language Models Against Australian Mental Health Ethics
  3. TAGS: A Test-Time Generalist-Specialist Framework with Retrieval-Augmented Reasoning and Verification
  4. Tears or Cheers? Benchmarking LLMs via Culturally Elicited Distinct Affective Responses
  5. Controllable Skin Synthesis via Lesion-Focused Vector Autoregression Model
  6. Decoding Causal Structure: End-to-End Mediation Pathways Inference
  7. Delving Into Out-of-Distribution Detection with Medical Vision-Language Models
  8. Derm1M: A Million-Scale Vision-Language Dataset Aligned with Clinical Ontology Knowledge for Dermatology
  9. Enhancing Interpretable Image Classification Through LLM Agents and Conditional Concept Bottleneck Models
  10. Generalized Category Discovery under Domain Shift: A Frequency Domain Perspective
  11. Knowledge Tree Driven Contextualized Instruction Tuning of Foundation Models for Epilepsy Drug Recommendation
  12. Local Masked Reconstruction for Efficient Self-Supervised Learning on High-Resolution Images
  13. MAKE: Multi-Aspect Knowledge-Enhanced Vision-Language Pretraining for Zero-Shot Dermatological Assessment
  14. MMRC: A Large-Scale Benchmark for Understanding Multimodal Large Language Model in Real-World Conversation
  15. MSWAL: 3D Multi-class Segmentation of Whole Abdominal Lesions Dataset
  16. MoRE: Unlocking Scalability in Reinforcement Learning for Quadruped Vision-Language-Action Models
  17. Neighbor Does Matter: Density-Aware Contrastive Learning for Medical Semi-supervised Segmentation
  18. OphCLIP: Hierarchical Retrieval-Augmented Learning for Ophthalmic Surgical Video-Language Pretraining
  19. Ophora: A Large-Scale Data-Driven Text-Guided Ophthalmic Surgical Video Generation Model
  20. PD-VLA: Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding
  21. Privacy-Centric Seizure Diagnosis via Relation-Aware Fusion of Minimally-Invasive Modalities
  22. ReactDiff: Fundamental Multiple Appropriate Facial Reaction Diffusion Model
  23. Robust Multimodal Learning for Ophthalmic Disease Grading via Disentangled Representation
  24. Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding
  25. SynFER: Towards Boosting Facial Expression Recognition With Synthetic Data
  26. Toward Modality Gap: Vision Prototype Learning for Weakly-supervised Semantic Segmentation with CLIP
  27. Towards Dynamic 3D Reconstruction of Hand-Instrument Interaction in Ophthalmic Surgery
  28. Towards Realistic Semi-supervised Medical Image Classification
  29. UniViT: Unifying Image and Video Understanding in One Vision Encoder
  30. WISE: Weak-Supervision-Guided Step-by-Step Explanations for Multimodal LLMs in Image Classification
  31. CARES: A Comprehensive Benchmark of Trustworthiness in Medical Vision Language Models
  32. Combining Graph Transformers Based Multi-Label Active Learning and Informative Data Augmentation for Chest Xray Classification
  33. Diversified and Personalized Multi-Rater Medical Image Segmentation
  34. EventRPG: Event Data Augmentation with Relevance Propagation Guidance
  35. Fundus2Video: Cross-Modal Angiography Video Generation from Static Fundus Photography with Clinical Knowledge Guidance
  36. Generalizing to Unseen Domains in Diabetic Retinopathy with Disentangled Representations
  37. Hunting Attributes: Context Prototype-Aware Learning for Weakly Supervised Semantic Segmentation
  38. OphNet: A Large-Scale Video Benchmark for Ophthalmic Surgical Workflow Understanding
  39. TP-DRSeg: Improving Diabetic Retinopathy Lesion Segmentation with Explicit Text-Prompts Assisted SAM
  40. Universal Semi-supervised Learning for Medical Image Classification