PPaperPicks

Qin Jin

37 papers at tracked venues · 27 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. A Survey of Deep Learning for Geometry Problem Solving
  2. A Survey of Large Models in Sports
  3. ChangJuan: A Comprehensive Benchmark for Book-Length Chinese Story Evaluation
  4. ChartEditor: A Reinforcement Learning Framework for Robust Chart Editing
  5. Exploring Attention Attractors in Large Language Models
  6. HowToNarrate: A General-Domain Benchmark for Synchronized Video Narration with External Knowledge
  7. LongMP-Bench: A Benchmark for Multimodal Persona Understanding in Long-Term Dialogues
  8. Mem-PAL: Towards Memory-based Personalized Dialogue Assistants for Long-term User-Agent Interaction
  9. POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
  10. ChartM3: Benchmarking Chart Editing with Multimodal Instructions
  11. Do Egocentric Video-Language Models Truly Understand Hand-Object Interactions?
  12. EgoDTM: Towards 3D-Aware Egocentric Video-Language Pretraining
  13. IntentionESC: An Intention-Centered Framework for Enhancing Emotional Support in Dialogue Systems
  14. MotionCtrl: A Real-Time Controllable Vision-Language-Motion Model
  15. Movie101v2: Improved Movie Narration Benchmark
  16. Scaling Large Motion Models with Million-Level Human Motions
  17. Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
  18. VC4VG: Optimizing Video Captions for Text-to-Video Generation
  19. What Matters in Evaluating Book-Length Stories? A Systematic Study of Long Story Evaluation
  20. WritingBench: A Comprehensive Benchmark for Generative Writing
  21. mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding
  22. ECR-Chain: Advancing Generative Language Models to Better Emotion-Cause Reasoners through Reasoning Chains
  23. ESCoT: Towards Interpretable Emotional Support Dialogue Systems
  24. Edit As You Wish: Video Caption Editing with Multi-grained User Control
  25. Less is More: Mitigating Multimodal Hallucination from an EOS Decision Perspective
  26. Muskits-ESPnet: A Comprehensive Toolkit for Singing Voice Synthesis in New Paradigm
  27. Respond in my Language: Mitigating Language Inconsistency in Response Generation based on Large Language Models
  28. Revealing Personality Traits: A New Benchmark Dataset for Explainable Personality Recognition on Dialogues
  29. Reversed in Time: A Novel Temporal-Emphasized Benchmark for Cross-Modal Video-Text Retrieval
  30. SingOMD: Singing Oriented Multi-resolution Discrete Representation Construction from Speech Models
  31. Singing Voice Data Scaling-up: An Introduction to ACE-Opencpop and ACE-KiSing
  32. Synchronized Video Storytelling: Generating Video Narrations with Structured Storyline
  33. The Interspeech 2024 Challenge on Speech Processing Using Discrete Units
  34. TinyChart: Efficient Chart Understanding with Program-of-Thoughts Learning and Visual Token Merging
  35. TokSing: Singing Voice Synthesis based on Discrete Tokens
  36. Unveiling Visual Biases in Audio-Visual Localization Benchmarks
  37. mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding