PPaperPicks

Huaxiu Yao

52 papers at tracked venues · 40 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Can Editing LLMs Inject Harm?
  2. MedVerse: Efficient and Reliable Medical Reasoning via DAG-Structured Parallel Execution
  3. PEANuT: Parameter-Efficient Adaptation with Weight-aware Neural Tweakers
  4. SimpleOCR: Rendering Visual Questions to Teach MLLMs to Read
  5. SynthAgent: Adapting Web Agents with Synthetic Supervision
  6. Anyprefer: An Agentic Framework for Preference Data Synthesis
  7. CARMO: Dynamic Criteria Generation for Context Aware Reward Modelling
  8. CREAM: Consistency Regularized Self-Rewarding Language Models
  9. Embodiment-agnostic Action Planning via Object-Part Scene Flow
  10. Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
  11. FactTest: Factuality Testing in Large Language Models with Finite-Sample and Distribution-Free Guarantees
  12. Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment
  13. GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?
  14. Grounded Chest X-Ray Reasoning: Leveraging Visual Tools to Improve Medical Multimodal LLMs
  15. Improving Alignment in LVLMs with Debiased Self-Judgment
  16. LIFTED: Multimodal Clinical Trial Outcome Prediction via Large Language Models and Mixture-of-Experts
  17. MEIT: Multimodal Electrocardiogram Instruction Tuning on Large Language Models for Report Generation
  18. MJ-Bench: Is Your Multimodal Reward Model Really a Good Judge for Text-to-Image Generation?
  19. MJ-Video: Benchmarking and Rewarding Video Generation with Fine-Grained Video Preference
  20. MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models
  21. MMed-RAG: Versatile Multimodal RAG System for Medical Vision Language Models
  22. MMedPO: Aligning Medical Vision-Language Models with Clinical-Aware Multimodal Preference Optimization
  23. Physics-Guided Fair Graph Sampling for Water Temperature Prediction in River Networks
  24. Re-Align: Aligning Vision Language Models via Retrieval-Augmented Direct Preference Optimization
  25. ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
  26. SAFREE: Training-Free and Adaptive Guard for Safe Text-to-Image And Video Generation
  27. Synergistic Weak-Strong Collaboration by Aligning Preferences
  28. Token Level Routing Inference System for Edge Devices
  29. Uncertainty Propagation on LLM Agent
  30. Verifiable Format Control for Large Language Model Generations
  31. WOMD-Reasoning: A Large-Scale Dataset for Interaction Reasoning in Driving
  32. Analyzing and Mitigating Object Hallucination in Large Vision-Language Models
  33. AutoPRM: Automating Procedural Supervision for Multi-Step Reasoning via Controllable Question Decomposition
  34. CARES: A Comprehensive Benchmark of Trustworthiness in Medical Vision Language Models
  35. CAT: Interpretable Concept-based Taylor Additive Models
  36. Calibrated Self-Rewarding Vision Language Models
  37. Conformal Prediction for Deep Classifier via Label Ranking
  38. Fine-Tuning Language Models for Factuality
  39. Generalizing to Unseen Domains in Diabetic Retinopathy with Disentangled Representations
  40. Generating Chain-of-Thoughts with a Pairwise-Comparison Approach to Searching for the Most Promising Intermediate Thought
  41. HALC: Object Hallucination Reduction via Adaptive Focal-Contrast Decoding
  42. How Many Are in This Image A Safety Evaluation Benchmark for Vision LLMs
  43. Improving Domain Generalization with Domain Relations
    ICLR 2024 · Huaxiu Yao
  44. Mementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image Sequences
  45. Multimodal Representation Learning by Alternating Unimodal Adaptation
  46. One Meta-tuned Transformer is What You Need for Few-shot Learning
  47. Position: TrustLLM: Trustworthiness in Large Language Models
  48. RULE: Reliable Multimodal RAG for Factuality in Medical Vision Language Models
  49. S2FT: Efficient, Scalable and Generalizable LLM Fine-tuning by Structured Sparsity
  50. Test-time Adaptation in Non-stationary Environments via Adaptive Representation Alignment
  51. Towards Reliable Learning in the Wild: Generalization and Adaptation
    AAAI 2024 · Huaxiu Yao
  52. VHELM: A Holistic Evaluation of Vision Language Models