PPaperPicks

Xing Sun

Tencent Youtu Lab, Shanghai, China

36 papers at tracked venues · 33 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Breaking the Evaluation Paradox: Evaluating High-Entropy Search with Computationally Irreducible Constraints
  2. Collision to Cognition: Hash-Driven Graph Construction for Efficient RAG
  3. HiChunk: Evaluating and Enhancing Retrieval Augmented Generation with Hierarchical Chunking
  4. Query-Aware Knowledge Retrieval via Hyperbolic Structuring
  5. DREAM: Document Reconstruction via End-to-end Autoregressive Model
  6. DS-VLM: Diffusion Supervision Vision Language Model
  7. FlexiReID: Adaptive Mixture of Expert for Multi-Modal Person Re-Identification
  8. Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM
  9. Incentivizing Reasoning for Advanced Instruction-Following of Large Language Models
  10. LTD-Bench: Evaluating Large Language Models by Letting Them Draw
  11. Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
  12. MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
  13. Probability-Density-aware Semi-supervised Learning
  14. RocketEval: Efficient automated LLM evaluation via grading checklist
  15. RoleMRC: A Fine-Grained Composite Benchmark for Role-Playing and Instruction-Following
  16. RolePlot: A Systematic Framework for Evaluating and Enhancing the Plot-Progression Capabilities of Role-Playing Agents
  17. Sequential-NIAH: A Needle-In-A-Haystack Benchmark for Extracting Sequential Needles from Long Contexts
  18. Tell Me What You Don't Know: Enhancing Refusal Capabilities of Role-Playing Agents via Representation Space Analysis and Editing
  19. Towards Universal Perception through Language-Guided Open-World Object Detection
  20. TransMLA: Migrating GQA Models to MLA with Full DeepSeek Compatibility and Speedup
  21. VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction
  22. VITA-Audio: Fast Interleaved Audio-Text Token Generation for Efficient Large Speech-Language Model
  23. Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
  24. Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs
  25. A General and Efficient Training for Transformer via Token Expansion
  26. Aligning and Prompting Everything All at Once for Universal Visual Perception
  27. Cantor: Inspiring Multimodal Chain-of-Thought of MLLM
  28. Eliminating Biased Length Reliance of Direct Preference Optimization via Down-Sampled KL Divergence
  29. Enhancing Visual Document Understanding with Contrastive Learning in Large Visual-Language Models
  30. Grab What You Need: Rethinking Complex Table Structure Recognition with Flexible Components Deliberation
  31. HRVDA: High-Resolution Visual Document Assistant
  32. Multimodal Inplace Prompt Tuning for Open-set Object Detection
  33. Multimodal Label Relevance Ranking via Reinforcement Learning
  34. SPD-DDPM: Denoising Diffusion Probabilistic Models in the Symmetric Positive Definite Space
  35. SoftCLIP: Softer Cross-Modal Alignment Makes CLIP Stronger
  36. Visual Hallucination Elevates Speech Recognition