PPaperPicks

Yaowei Wang

Peng Cheng Laboratory, Shenzhen, China

63 papers at tracked venues · 53 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Exo2Ego: Exocentric Knowledge Guided MLLM for Egocentric Video Understanding
  2. From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents
  3. HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models
  4. Latent-Condensed Transformer for Efficient Long Context Modeling
  5. A Survey on the Feedback Mechanism of LLM-based AI Agents
  6. A Unified Agentic Framework for Evaluating Conditional Image Generation
  7. Agent-MER: A Cognitive Agent with Hierarchical Deliberation for Open-Vocabulary Multimodal Emotion Recognition
  8. An Exploration with Entropy Constrained 3D Gaussians for 2D Video Compression
  9. AutoSSVH: Exploring Automated Frame Sampling for Efficient Self-Supervised Video Hashing
  10. Building Vision Models upon Heat Conduction
  11. Cassic: Towards Content-Adaptive State-Space Models for Learned Image Compression
  12. Continual Adaptation: Environment-Conditional Parameter Generation for Object Detection in Dynamic Scenarios
  13. Core Context Aware Transformers for Long Context Language Modeling
  14. DS-Det: Single-Query Paradigm and Attention Disentangled Learning for Flexible Object Detection
  15. DSPNet: Dual-vision Scene Perception for Robust 3D Question Answering
  16. DiffPC: Diffusion-based High Perceptual Fidelity Image Compression with Semantic Refinement
  17. EMMA: Empowering Multi-modal Mamba with Structural and Hierarchical Alignment
  18. Efficient Safety Alignment of Large Language Models via Preference Re-ranking and Representation-based Reward Modeling
  19. Embracing Collaboration Over Competition: Condensing Multiple Prompts for Visual In-Context Learning
  20. Enhancing Partially Relevant Video Retrieval with Hyperbolic Learning
  21. FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation
  22. LaneDiffusion: Improving Centerline Graph Learning via Prior Injected BEV Feature Generation
  23. Learning Compatible Multi-Prize Subnetworks for Asymmetric Retrieval
  24. Learning Fine-Grained Representations through Textual Token Disentanglement in Composed Video Retrieval
  25. Learning Spatial-Semantic Features for Robust Video Object Segmentation
  26. LoRATv2: Enabling Low-Cost Temporal Modeling in One-Stream Trackers
  27. Modeling Uncertainty in Composed Image Retrieval via Probabilistic Embeddings
  28. NN-Former: Rethinking Graph Structure in Neural Architecture Representation
  29. PTQ1.61: Push the Real Limit of Extremely Low-Bit Post-Training Quantization Methods for Large Language Models
  30. Perceptually Constrained Precipitation Nowcasting Model
  31. Pilot: Building the Federated Multimodal Instruction Tuning Framework
  32. Prior-Free Augmentation for Cloth-Changing Person Re-Identification
  33. RS-vHeat: Heat Conduction Guided Efficient Remote Sensing Foundation Model
  34. Sound Bridge: Associating Egocentric and Exocentric Videos via Audio Cues
  35. Spatial Understanding from Videos: Structured Prompts Meet Simulation Data
  36. Video Language Model Pretraining with Spatio-temporal Masking
  37. VideoVista-CulturalLingo: 360° Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension
  38. Your Language Model Can Secretly Write Like Humans: Contrastive Paraphrase Attacks on LLM-Generated Text Detectors
  39. Calibration for Long-tailed Scene Graph Generation
  40. CoIn: A Lightweight and Effective Framework for Story Visualization and Continuation
  41. CoTuning: A Large-Small Model Collaborating Distillation Framework for Better Model Generalization
  42. CricaVPR: Cross-Image Correlation-Aware Representation Learning for Visual Place Recognition
  43. HARDVS: Revisiting Human Activity Recognition with Dynamic Vision Sensors
  44. HiVG: Hierarchical Multimodal Fine-grained Modulation for Visual Grounding
  45. Hierarchical Prompt Learning for Scene Graph Generation
  46. LG-VQ: Language-Guided Codebook Learning
  47. LSVOS Challenge Report: Large-Scale Complex and Long Video Object Segmentation
  48. MLP-DINO: Category Modeling and Query Graphing with Deep MLP for Object Detection
  49. Modality-Collaborative Test-Time Adaptation for Action Recognition
  50. Motion-aware Latent Diffusion Models for Video Frame Interpolation
  51. Multi-Factor Adaptive Vision Selection for Egocentric Video Question Answering
  52. OneRef: Unified One-tower Expression Grounding and Segmentation with Mask Referring Modeling
  53. PVUW 2024 Challenge on Complex Video Understanding: Methods and Results
  54. Prompt-Driven Dynamic Object-Centric Learning for Single Domain Generalization
  55. RTracker: Recoverable Tracking via PN Tree Structured Memory
  56. Regressor-Segmenter Mutual Prompt Learning for Crowd Counting
  57. Reshaping the Online Data Buffering and Organizing Mechanism for Continual Test-Time Adaptation
  58. StoryImager: A Unified and Efficient Framework for Coherent Story Visualization and Completion
  59. The Second Visual Object Tracking Segmentation VOTS2024 Challenge Results
  60. Towards Robust and Efficient Cloud-Edge Elastic Model Adaptation via Selective Entropy Distillation
  61. Towards Seamless Adaptation of Pre-trained Models for Visual Place Recognition
  62. Tracking Meets LoRA: Faster Training, Larger Model, Stronger Performance
  63. VMamba: Visual State Space Model