PPaperPicks

Jun Du

University of Science and Technology of China, USTC, School of Information Science and Technology, Hefei, Anhui, China

25 papers at tracked venues · 14 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Angkorian-KSI: A Multi-task Benchmark for Khmer Stone Inscription Analysis
  2. Binary-Gaussian: Compact and Progressive Representation for 3D Gaussian Segmentation
  3. READ: Real-time and Efficient Asynchronous Diffusion for Audio-driven Talking Head Generation
  4. Step Potential Advantage Estimation: Harnessing Intermediate Confidence and Correctness for Efficient Mathematical Reasoning
  5. Adaptive Radical Similarity Learning for Chinese Character Recognition
  6. AudioAtlas: A Comprehensive and Balanced Benchmark Towards Movie-Oriented Text-to-Audio Generation
  7. DAWN: Dynamic Frame Avatar with Non-autoregressive Diffusion Framework for Talking head Video Generation
  8. DocMamba: Efficient Document Pre-training with State Space Model
  9. EmotiveTalk: Expressive Talking Head Generation through Audio Information Decoupling and Emotional Video Diffusion
  10. Enhancing the Geometric Problem-Solving Ability of Multimodal LLMs via Symbolic-Neural Integration
  11. Latent Swap Joint Diffusion for 2D Long-Form Latent Generation
  12. MISP-Meeting: A Real-World Dataset with Multimodal Cues for Long-form Meeting Transcription and Summarization
  13. MISP-QEKS: A Large-Scale Dataset with Multimodal Cues for Query-by-Example Keyword Spotting
  14. PALM-LAY: A Multi-script Cross-Regional Dataset for Layout Analysis of Palm Leaf Manuscripts
  15. QA-MDT: Quality-aware Masked Diffusion Transformer for Enhanced Music Generation
  16. RFL: Simplifying Chemical Structure Recognition with Ring-Free Language
  17. SPS-CG: Shape, Pronunciation, and Semantic Joint Modeling for Chinese Character Generation
  18. The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition
  19. A Study of Dropout-Induced Modality Bias on Robustness to Missing Video Frames for Audio-Visual Speech Recognition
  20. AS-70: A Mandarin stuttered speech dataset for automatic speech recognition and stuttering event detection
  21. Enhancing Voice Wake-Up for Dysarthria: Mandarin Dysarthria Speech Corpus Release and Customized System Design
  22. NAMER: Non-autoregressive Modeling for Handwritten Mathematical Expression Recognition
  23. SEMv3: A Fast and Robust Approach to Table Separation Line Detection
  24. SRFUND: A Multi-Granularity Hierarchical Structure Reconstruction Benchmark in Form Understanding
  25. UniTabNet: Bridging Vision and Language Models for Enhanced Table Structure Recognition