PPaperPicks

Heng Tao Shen

University of Electronic Science and Technology of China, School of Computer Science and Engineering, Chengdu, China

61 papers at tracked venues · 58 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Agent-GWO: Collaborative Agents for Dynamic Prompt Optimization in Large Language Models
  2. De-biased Natural Language Egocentric Task Verification via Prototypical Evidence Learning
  3. FGIM: a Fast Graph-based Indexes Merging Framework for Approximate Nearest Neighbor Search
  4. Hyper-Opinion Vagueness Quantification for Robust Multimodal Learning
  5. RISER: Orchestrating Latent Reasoning Skills for Adaptive Activation Steering
  6. SINDI: An Efficient Index for Sparse Vector Approximate Maximum Inner Product Search
  7. Unleashing the Potential of Neighbors: Diffusion-based Latent Neighbor Generation for Session-based Recommendation
  8. AICL: Action In-Context Learning for Text-to-Video Generation
  9. Analytical Construction on Geometric Architectures: Transitioning from Static to Temporal Link Prediction
  10. AttentionAR: AR Adaptation and Warning for Real-World Safety via Attention Modeling and MLLM Reasoning
  11. CDTR: Semantic Alignment for Video Moment Retrieval Using Concept Decomposition Transformer
  12. CoSMIC: Continual Self-Supervised Learning for Multi-Domain Medical Imaging Via Conditional Mutual Information Maximization
  13. Efficient Adaptation of Pre-Trained Vision Transformer Underpinned by Approximately Orthogonal Fine-Tuning Strategy
  14. From Observation to Understanding: Front-Door Adjustments with Uncertainty Calibration for Enhancing Egocentric Reasoning in LVLMs
  15. Geometric Gradient Divergence Modulation for Imbalanced Multimodal Learning
  16. Implicit Counterfactual Learning for Audio-Visual Segmentation
  17. Infinite Stream Estimation under Personalized w-Event Privacy
  18. InteractGuide: LLM-Enhanced Multimodal Reasoning for User-Centric Interaction Recommendations in AR-HRI Authoring
  19. MMEvol: Empowering Multimodal Large Language Models with Evol-Instruct
  20. PHGC: Procedural Heterogeneous Graph Completion for Natural Language Task Verification in Egocentric Videos
  21. PSCon: Product Search Through Conversations
  22. RadLAS: A Foundation Model for Interpretable Radiography Image Analysis with Lesion-Aware Self-Supervised Pre-training
  23. SaP-Bot: A Multimodal Large-Language Model for End-to-End Same-Product Identification
  24. SafePTR: Token-Level Jailbreak Defense in Multimodal LLMs via Prune-then-Restore Mechanism
  25. Self-Supervised Anatomical Consistency Learning for Vision-Grounded Medical Report Generation
  26. Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves
  27. TAU-106K: A New Dataset for Comprehensive Understanding of Traffic Accident
  28. Table2LaTeX-RL: High-Fidelity LaTeX Code Generation from Table Images via Reinforced Multimodal Language Models
  29. Towards Explicit Geometry-Reflectance Collaboration for Generalized LiDAR Segmentation in Adverse Weather
  30. VSAG: An Optimized Search Framework for Graph-based Approximate Nearest Neighbor Search
  31. ACT-Diffusion: Efficient Adversarial Consistency Training for One-Step Diffusion Models
  32. Adaptive Uncertainty-Based Learning for Text-Based Person Retrieval
  33. Alleviating Hallucinations in Large Vision-Language Models through Hallucination-Induced Optimization
  34. An Efficient Membership Inference Attack for the Diffusion Model by Proximal Initialization
  35. Cascaded Adversarial Attack: Simultaneously Fooling Rain Removal and Semantic Segmentation Networks
  36. Caterpillar: A Pure-MLP Architecture with Shifted-Pillars-Concatenation
  37. CoIN: A Benchmark of Continual Instruction Tuning for Multimodel Large Language Models
  38. ConU: Conformal Uncertainty in Large Language Models with Correctness Coverage Guarantees
  39. Counterfactually Augmented Event Matching for De-biased Temporal Sentence Grounding
  40. Cross-Insight Trader: A Trading Approach Integrating Policies with Diverse Investment Horizons for Portfolio Management
  41. DePT: Decoupled Prompt Tuning
  42. Diffusion Models as Optimizers for Efficient Planning in Offline RL
  43. Efficient Adaptation of Pre-trained Vision Transformer via Householder Transformation
  44. Embracing Unimodal Aleatoric Uncertainty for Robust Multimodal Fusion
  45. Emotion Recognition in HMDs: A Multi-task Approach Using Physiological Signals and Occluded Faces
  46. Enhanced Experts with Uncertainty-Aware Routing for Multimodal Sentiment Analysis
  47. Ensemble Diversity Facilitates Adversarial Transferability
  48. GalleryGPT: Analyzing Paintings with Large Multimodal Models
  49. HIT: Solving Partial Index Tracking via Hierarchical Reinforcement Learning
  50. Improving Interaction Comfort in Authoring Task in AR-HRI through Dynamic Dual-Layer Interaction Adjustment
  51. JoReS-Diff: Joint Retinex and Semantic Priors in Diffusion Model for Low-light Image Enhancement
  52. Leveraging Weak Cross-Modal Guidance for Coherence Modelling via Iterative Learning
  53. MPT: Multi-grained Prompt Tuning for Text-Video Retrieval
  54. ProS: Prompting-to-Simulate Generalized Knowledge for Universal Cross-Domain Retrieval
  55. SI-BiViT: Binarizing Vision Transformers with Spatial Interaction
  56. ScanERU: Interactive 3D Visual Grounding Based on Embodied Reference Understanding
  57. Self-Supervised Heterogeneous Graph Learning: a Homophily and Heterogeneity View
  58. T-SciQ: Teaching Multimodal Chain-of-Thought Reasoning via Large Language Model Signals for Science Question Answering
  59. Towards Dynamic-Prompting Collaboration for Source-Free Domain Adaptation
  60. Unsupervised Cross-Domain Image Retrieval with Semantic-Attended Mixture-of-Experts
  61. Weakly-Supervised Mirror Detection via Scribble Annotations