PPaperPicks

Xiaojun Chang

32 papers at tracked venues · 27 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Correspondence Coverage Matters for Multi-Modal Dataset Distillation
  2. Dual Conditional Diffusion for Sequential Recommendation
  3. MDK12-Bench: A Multi-Discipline Benchmark for Evaluating Reasoning in Multimodal Large Language Models
  4. Measuring Social Bias in Vision-Language Models with Face-Only Counterfactuals from Real Photos
  5. Think Before You Segment: An Object-aware Reasoning Agent for Referring Audio-Visual Segmentation
  6. Token Painter: Training-Free Text-Guided Image Inpainting via Mask Autoregressive Models
  7. Dense Audio-Visual Event Localization Under Cross-Modal Consistency and Multi-Temporal Granularity Collaboration
  8. Flexiffusion: Training-Free Segment-Wise Neural Architecture Search for Efficient Diffusion Models
  9. HC-LLM: Historical-Constrained Large Language Models for Radiology Report Generation
  10. Let LLM Tell What to Prune and How Much to Prune
  11. MIRAGE25: ACM MM25 Multimodal Interleaved Reasoning and Generation Challenge
  12. Neural-Driven Image Editing
  13. OpenING: A Comprehensive Benchmark for Judging Open-ended Interleaved Image-Text Generation
  14. RoomTour3D: Geometry-Aware Video-Instruction Tuning for Embodied Navigation
  15. Shot2Story: A New Benchmark for Comprehensive Understanding of Multi-shot Videos
  16. Sitcom-Crafter: A Plot-Driven Human Motion Generation System in 3D Scenes
  17. Towards Efficient General Feature Prediction in Masked Skeleton Modeling
  18. Towards Open-Vocabulary Audio-Visual Event Localization
  19. Contrastive Learning with Counterfactual Explanations for Radiology Report Generation
  20. Generating Action-conditioned Prompts for Open-vocabulary Video Action Recognition
  21. In-Context Learning for Zero-shot Medical Report Generation
  22. Label-Anticipated Event Disentanglement for Audio-Visual Video Parsing
  23. LongVLM: Efficient Long Video Understanding via Large Language Models
  24. MLP Can Be a Good Transformer Learner
  25. Masked Distillation Advances Self-Supervised Transformer Architecture Search
  26. MatchNAS: Optimizing Edge AI in Sparse-Label Data Contexts via Automating Deep Neural Network Porting for Mobile Deployment
  27. Maximum Entropy Heterogeneous-Agent Reinforcement Learning
  28. Noisy Correspondence Learning with Self-Reinforcing Errors Mitigation
  29. ProAgent: Building Proactive Cooperative Agents with Large Language Models
  30. SSMG: Spatial-Semantic Map Guided Diffusion Model for Free-Form Layout-to-Image Generation
  31. SWAP-NAS: Sample-Wise Activation Patterns for Ultra-fast NAS
  32. Video Recognition in Portrait Mode