PPaperPicks

Shengyu Zhang

Zhejiang University, Department of Computer Science, Hangzhou, China

40 papers at tracked venues · 34 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. A Rolling Stone Gathers No Moss: Adaptive Policy Optimization for Stable Self-Evaluation in Large Multimodal Models
  2. AccKV: Towards Efficient Audio-Video LLMs Inference via Adaptive-Focusing and Cross-Calibration KV Cache Optimization
  3. DAC-Bench: A Decision-Aware Benchmark for Compositional Mobile GUI Tasks
  4. EcoAgent: An Efficient Device-Cloud Collaborative Multi-Agent Framework for Mobile Automation
  5. InfiGUI-G1: Advancing GUI Grounding with Adaptive Exploration Policy Optimization
  6. InfiGUIAgent: A Multimodal Generalist GUI Agent with Native Reasoning and Reflection
  7. Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding
  8. RASTP: Representation-Aware Semantic Token Pruning for Generative Recommendation with Semantic Identifiers
  9. RetentiveKV: State-Space Memory for Uncertainty-Aware Multimodal KV Cache Eviction
  10. ThinkRec: Thinking-based recommendation via LLM
  11. Towards Meta-Cognitive Knowledge Editing for Multimodal LLMs
  12. CHORD: Customizing Hybrid-precision On-device Model for Sequential Recommendation with Device-cloud Collaboration
  13. Collaboration of Large Language Models and Small Recommendation Models for Device-Cloud Recommendation
  14. Cuff-KT: Tackling Learners' Real-time Learning Pattern Adjustment via Tuning-Free Knowledge State Guided Model Updating
  15. Device-Cloud Collaborative Correction for On-Device Recommendation
  16. Disentangled Knowledge Tracing for Alleviating Cognitive Bias
  17. EcoFace: Audio-Visual Emotional Co-Disentanglement Speech-Driven 3D Talking Face Generation
  18. Evaluating the Robustness of Multimodal Agents Against Active Environmental Injection Attacks
  19. ExpTalk: Diverse Emotional Expression via Adaptive Disentanglement and Refined Alignment for Speech-Driven 3D Facial Animation
  20. FedCFA: Alleviating Simpson's Paradox in Model Aggregation with Counterfactual Federated Learning
  21. Forward Once for All: Structural Parameterized Adaptation for Efficient Cloud-coordinated On-device Recommendation
  22. MS-Bench: Evaluating LMMs in Ancient Manuscript Study through a Dunhuang Case Study
  23. MadaKV: Adaptive Modality-Perception KV Cache Eviction for Efficient Multimodal Long-Context Inference
  24. MergeNet: Knowledge Migration Across Heterogeneous Models, Tasks, and Modalities
  25. OS Agents: A Survey on MLLM-based Agents for Computer, Phone and Browser Use
  26. Optimize Incompatible Parameters Through Compatibility-aware Knowledge Integration
  27. Preliminary Evaluation of the Test-Time Training Layers in Recommendation System (Student Abstract)
  28. Tackling Device Data Distribution Real-time Shift via Prototype-based Parameter Editing
  29. Towards Advanced Mathematical Reasoning for LLMs via First-Order Logic Theorem Proving
  30. AuG-KD: Anchor-Based Mixup Generation for Out-of-Domain Knowledge Distillation
  31. CoreRec: A Counterfactual Correlation Inference for Next Set Recommendation
  32. Cross-modal Observation Hypothesis Inference
  33. DIET: Customized Slimming for Incompatible Networks in Sequential Recommendation
  34. GaussianTalker: Speaker-specific Talking Head Synthesis via 3D Gaussian Splatting
  35. Intelligent Model Update Strategy for Sequential Recommendation
  36. LLMCO4MR: LLMs-Aided Neural Combinatorial Optimization for Ancient Manuscript Restoration from Fragments with Case Studies on Dunhuang
  37. MART: Learning Hierarchical Music Audio Representations with Part-Whole Transformer
  38. MPOD123: One Image to 3D Content Generation Using Mask-Enhanced Progressive Outline-to-Detail Optimization
  39. PhiloGPT: A Philology-Oriented Large Language Model for Ancient Chinese Manuscripts with Dunhuang as Case Study
  40. Semantic Codebook Learning for Dynamic Recommendation Models