P
PaperPicks
Conferences
Shengqiong Wu
19 papers at tracked venues · 19 at CORE A* · active 2024–2026
DBLP profile ↗
ORCID search ↗
Venues
ACM MM
×4
ICML
×4
CVPR
×3
NeurIPS
×3
AAAI
×2
ACL
×1
ICLR
×1
WWW
×1
Frequent coauthors
Hao Fei
DBLP profile ↗
ORCID search ↗
×4
Meng Luo
DBLP profile ↗
ORCID search ↗
×2
Wei Liu
DBLP profile ↗
ORCID search ↗
×1
Kai Liu
DBLP profile ↗
ORCID search ↗
×1
Haojian Huang
DBLP profile ↗
ORCID search ↗
×1
Zixiang Meng
DBLP profile ↗
ORCID search ↗
×1
Tao Zhang
DBLP profile ↗
ORCID search ↗
×1
Meishan Zhang
DBLP profile ↗
ORCID search ↗
×1
Li Zheng
DBLP profile ↗
ORCID search ↗
×1
Bin Wang
DBLP profile ↗
ORCID search ↗
×1
Papers
Orthogonal Spatial-temporal Distributional Transfer for 4D Generation
AAAI 2026
·
Wei Liu
DBLP profile ↗
ORCID search ↗
Combating Multimodal LLM Hallucination via Bottom-Up Holistic Reasoning
AAAI 2025
·
Shengqiong Wu
JavisGPT: A Unified Multi-modal LLM for Sounding-Video Comprehension and Generation
NeurIPS 2025
·
Kai Liu
DBLP profile ↗
ORCID search ↗
Learning 4D Panoptic Scene Graph Generation from Rich 2D Visual Scene
CVPR 2025
·
Shengqiong Wu
On Path to Multimodal Generalist: General-Level and General-Bench
ICML 2025
·
Hao Fei
DBLP profile ↗
ORCID search ↗
The ACM Multimedia 2025 Grand Challenge of Multimodal Conversational Aspect-based Sentiment Analysis
ACM MM 2025
·
Meng Luo
DBLP profile ↗
ORCID search ↗
Towards Semantic Equivalence of Tokenization in Multimodal LLM
ICLR 2025
·
Shengqiong Wu
Universal Scene Graph Generation
CVPR 2025
·
Shengqiong Wu
VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models
ICML 2025
·
Haojian Huang
DBLP profile ↗
ORCID search ↗
Dysen-VDM: Empowering Dynamics-Aware Text-to-Video Diffusion with LLMs
CVPR 2024
·
Hao Fei
DBLP profile ↗
ORCID search ↗
MMLSCU: A Dataset for Multi-modal Multi-domain Live Streaming Comment Understanding
WWW 2024
·
Zixiang Meng
DBLP profile ↗
ORCID search ↗
NExT-GPT: Any-to-Any Multimodal LLM
ICML 2024
·
Shengqiong Wu
OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding
NeurIPS 2024
·
Tao Zhang
DBLP profile ↗
ORCID search ↗
PanoSent: A Panoptic Sextuple Extraction Benchmark for Multimodal Conversational Aspect-based Sentiment Analysis
ACM MM 2024
·
Meng Luo
DBLP profile ↗
ORCID search ↗
Recognizing Everything from All Modalities at Once: Grounded Multimodal Universal Information Extraction
ACL 2024
·
Meishan Zhang
DBLP profile ↗
ORCID search ↗
Self-Adaptive Fine-grained Multi-modal Data Augmentation for Semi-supervised Muti-modal Coreference Resolution
ACM MM 2024
·
Li Zheng
DBLP profile ↗
ORCID search ↗
SpeechEE: A Novel Benchmark for Speech Event Extraction
ACM MM 2024
·
Bin Wang
DBLP profile ↗
ORCID search ↗
Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition
ICML 2024
·
Hao Fei
DBLP profile ↗
ORCID search ↗
Vitron: A Unified Pixel-level Vision LLM for Understanding, Generating, Segmenting, Editing
NeurIPS 2024
·
Hao Fei
DBLP profile ↗
ORCID search ↗