PPaperPicks

Yang Yang

University of Electronic Science and Technology of China, Center for Future Media, Chengdu, China

66 papers at tracked venues · 57 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Agent-GWO: Collaborative Agents for Dynamic Prompt Optimization in Large Language Models
  2. Beyond the Single Path: Divergent Reasoning for LLM-based Recommendation
  3. CARD: Non-Uniform Quantization of Visual Semantic Unit for Generative Recommendation
  4. DWTSG: Parameter-Efficient Fine-Tuning of Large Pre-trained Models via Discrete Wavelet Transform and Subband Guidance
  5. From Dialogue to Destination: Geography-Aware Large Language Models with Multimodal Fusion for Conversational Recommendation
  6. Lightweight LLM Agent Memory with Small Language Models
  7. Not All Information Brings Benefits: Personalization-Driven Agent Debate for Conversational Recommendation
  8. ScotRec: Social Chain-of-Thought LLM Reasoning for Recommendation
  9. Seeing Beyond Illusion: Generalized and Efficient Mirror Detection
  10. ThinkTank-ME: A Multi-Expert Framework for Middle East Event Forecasting
  11. Unleashing the Potential of Neighbors: Diffusion-based Latent Neighbor Generation for Session-based Recommendation
  12. Views Attention Fusion of Granular-ball Fuzzy Representations Split for Improved Multi-view Clustering
  13. A Soft Active Surface Gripper for Safe In Hand Manipulation of Fragile Objects
  14. An Effective and Secure Federated Multi-View Clustering Method with Information-Theoretic Perspective
  15. AttentionAR: AR Adaptation and Warning for Real-World Safety via Attention Modeling and MLLM Reasoning
  16. BSO: Binary Spiking Online Optimization Algorithm
  17. Beyond Whole Dialogue Modeling: Contextual Disentanglement for Conversational Recommendation
  18. Binary Event-Driven Spiking Transformer
  19. Bipolar Self-attention for Spiking Transformers
  20. Brain Activation Mapping Based on Regional Synchronization of fMRI Signals Embedded in Graph Eigenmodes
  21. CDTR: Semantic Alignment for Video Moment Retrieval Using Concept Decomposition Transformer
  22. Chain-of-Focus Prompting: Leveraging Sequential Visual Cues to Prompt Large Autoregressive Vision Models
  23. Dendritic Resonate-and-Fire Neuron for Effective and Efficient Long Sequence Modeling
  24. Efficient Adaptation of Pre-Trained Vision Transformer Underpinned by Approximately Orthogonal Fine-Tuning Strategy
  25. Implicit Counterfactual Learning for Audio-Visual Segmentation
  26. InteractGuide: LLM-Enhanced Multimodal Reasoning for User-Centric Interaction Recommendations in AR-HRI Authoring
  27. International Workshop on Multimodal Generative Search and Recommendation (MMGenSR@CIKM 2025)
  28. KDA: Knowledge Diffusion Alignment with Enhanced Context for Video Temporal Grounding
  29. Leveraging Asynchronous Spiking Neural Networks for Ultra Efficient Event-Based Visual Processing
  30. Local Conditional Controlling for Text-to-Image Diffusion Models
  31. MSCRS: Multi-modal Semantic Graph Prompt Learning Framework for Conversational Recommender Systems
  32. Multi-View Graph Clustering via Node-Guided Contrastive Encoding
  33. PSCon: Product Search Through Conversations
  34. QP-SNN: Quantized and Pruned Spiking Neural Networks
  35. Quantized Spike-driven Transformer
  36. S2NN: Sub-bit Spiking Neural Networks
  37. Spiking Vision Transformer with Saccadic Attention
  38. SyncGaussian: Stable 3D Gaussian-Based Talking Head Generation with Enhanced Lip Sync via Discriminative Speech Features
  39. Table2LaTeX-RL: High-Fidelity LaTeX Code Generation from Table Images via Reinforced Multimodal Language Models
  40. Temporal-coded Spiking Transformer
  41. Towards Accurate Binary Spiking Neural Networks: Learning with Adaptive Gradient Modulation Mechanism
  42. Unveiling the Spatial-temporal Effective Receptive Fields of Spiking Neural Networks
  43. Adaptive Uncertainty-Based Learning for Text-Based Person Retrieval
  44. Ask or Recommend: An Empirical Study on Conversational Product Search
  45. Bridging Gaps: Federated Multi-View Clustering in Heterogeneous Hybrid Views
  46. CDPNet: Cross-Modal Dual Phases Network for Point Cloud Completion
  47. Cascaded Adversarial Attack: Simultaneously Fooling Rain Removal and Semantic Segmentation Networks
  48. Diffusion Models as Optimizers for Efficient Planning in Offline RL
  49. Efficient Adaptation of Pre-trained Vision Transformer via Householder Transformation
  50. Emotion Recognition in HMDs: A Multi-task Approach Using Physiological Signals and Occluded Faces
  51. Ensemble Diversity Facilitates Adversarial Transferability
  52. GalleryGPT: Analyzing Paintings with Large Multimodal Models
  53. Generalizing ISP Model by Unsupervised Raw-to-raw Mapping
  54. Improving Interaction Comfort in Authoring Task in AR-HRI through Dynamic Dual-Layer Interaction Adjustment
  55. Independency Adversarial Learning for Cross-Modal Sound Separation
  56. JoReS-Diff: Joint Retinex and Semantic Priors in Diffusion Model for Low-light Image Enhancement
  57. Leveraging Weak Cross-Modal Guidance for Coherence Modelling via Iterative Learning
  58. Low-Rank Rescaled Vision Transformer Fine-Tuning: A Residual Design Approach
  59. MM-Forecast: A Multimodal Approach to Temporal Event Forecasting with Large Language Models
  60. Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models
  61. Q-SNNs: Quantized Spiking Neural Networks
  62. Region-Aware Distribution Contrast: A Novel Approach to Multi-task Partially Supervised Learning
  63. ScanERU: Interactive 3D Visual Grounding Based on Embodied Reference Understanding
  64. Spike-based Neuromorphic Model for Sound Source Localization
  65. Unsupervised Domain Adaptative Temporal Sentence Localization with Mutual Information Maximization
  66. Weakly-Supervised Mirror Detection via Scribble Annotations