PPaperPicks

Changsheng Xu

50 papers at tracked venues · 46 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Duplex Rewards Optimization for Test-Time Composed Image Retrieval
  2. I2CD: An Invertible Causal Framework for Compositional Zero-Shot Learning via Disentangle-Compose-Disentangle
  3. Multi-modal Bipartite Graph Structure Learning with Information Bottleneck for Micro-video Recommendation
  4. SoMe: A Realistic Benchmark for LLM-based Social Media Agents
  5. A Large-Scale Dataset for Short-Video Topic Peak Prediction and a Large Heterogeneous Graph Model
  6. Building Embodied EvoAgent: A Brain-inspired Paradigm for Bridging Multimodal Large Models and World Models
  7. Customized Condition Controllable Generation for Video Soundtrack
  8. DMC3: Dual-Modal Counterfactual Contrastive Construction for Egocentric Video Question Answering
  9. EgoPrompt: Prompt Learning for Egocentric Action Recognition
  10. Evidential Knowledge Distillation
  11. FORGET ME: Federated Unlearning for Face Generation Models
  12. Fine-tuning Bias Neurons for Fair Text-to-Image Generation
  13. Granular Music Attribute Transformation with Proximal Policy Optimization Adapters for Diffusion Model
  14. Graph Prompts: Adapting Video Graph for Video Question Answering
  15. Language Guided Concept Bottleneck Models for Interpretable Continual Learning
  16. LiveStar: Live Streaming Assistant for Real-World Online Video Understanding
  17. Locality Preserving Markovian Transition for Instance Retrieval
  18. Look Before You Leap: A GUI-Critic-R1 Model for Pre-Operative Error Diagnosis in GUI Automation
  19. NavMorph: A Self-Evolving World Model for Vision-and-Language Navigation in Continuous Environments
  20. Overcoming Dual Drift for Continual Long-Tailed Visual Question Answering
  21. Pilot: Building the Federated Multimodal Instruction Tuning Framework
  22. Pseudo Informative Episode Construction for Few-Shot Class-Incremental Learning
  23. Rethinking the Temperature for Federated Heterogeneous Distillation
  24. SVBench: A Benchmark with Temporal Multi-Turn Dialogues for Streaming Video Understanding
  25. StreamingCoT: A Dataset for Temporal Dynamics and Multimodal Chain-of-Thought Reasoning in Streaming VideoQA
  26. When Open-Vocabulary Visual Question Answering Meets Causal Adapter: Benchmark and Approach
  27. Cluster-Aware Similarity Diffusion for Instance Retrieval
  28. CoIn: A Lightweight and Effective Framework for Story Visualization and Continuation
  29. Conjugated Semantic Pool Improves OOD Detection with Pre-trained Vision-Language Models
  30. Cross-Modal Meta Consensus for Heterogeneous Federated Learning
  31. Enhancing Storage and Computational Efficiency in Federated Multimodal Learning for Large-Scale Models
  32. Fast-Slow Test-Time Adaptation for Online Vision-and-Language Navigation
  33. FedVAD: Enhancing Federated Video Anomaly Detection with GPT-Driven Semantic Distillation
  34. Few-Shot Multimodal Explanation for Visual Question Answering
  35. HiVG: Hierarchical Multimodal Fine-grained Modulation for Visual Grounding
  36. LDRE: LLM-based Divergent Reasoning and Ensemble for Zero-Shot Composed Image Retrieval
  37. Libra: Building Decoupled Vision System on Large Language Models
  38. Modality-Collaborative Test-Time Adaptation for Action Recognition
  39. Music Style Transfer with Time-Varying Inversion of Diffusion Models
  40. OneRef: Unified One-tower Expression Grounding and Segmentation with Mask Referring Modeling
  41. Open-Vocabulary Video Scene Graph Generation via Union-aware Semantic Alignment
  42. Overcoming the Pitfalls of Vision-Language Model for Image-Text Retrieval
  43. R-EDL: Relaxing Nonessential Settings of Evidential Deep Learning
  44. Semantic Editing Increment Benefits Zero-Shot Composed Image Retrieval
  45. SignGen: End-to-End Sign Language Video Generation with Latent Diffusion
  46. StoryImager: A Unified and Efficient Framework for Coherent Story Visualization and Completion
  47. T3RD: Test-Time Training for Rumor Detection on Social Media
  48. TCP: Textual-Based Class-Aware Prompt Tuning for Visual-Language Model
  49. Text-Guided Attention is All You Need for Zero-Shot Robustness in Vision-Language Models
  50. Three Heads Are Better than One: Complementary Experts for Long-Tailed Semi-supervised Learning