PPaperPicks

Shijian Lu

36 papers at tracked venues · 32 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Enhancing Retrieval-Augmented Large Vision Language Models via Knowledge Conflict Mitigation
  2. MuSASplat: Efficient Sparse-View 3D Gaussian Splats via Lightweight Multi-Scale Adaptation
  3. Backdoor Attacks Against No-Reference Image Quality Assessment Models via a Scalable Trigger
  4. Boosting Knowledge Utilization in Multimodal Large Language Models via Adaptive Logits Fusion and Attention Reallocation
  5. DivAvatar: Diverse 3D Avatar Generation with a Single Prompt
  6. Face Retouching with Diffusion Data Generation and Spectral Restorement
  7. MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation
  8. MTL-UE: Learning to Learn Nothing for Multi-Task Learning
  9. Mitigating Object Hallucinations in Large Vision-Language Models with Assembly of Global and Local Attention
  10. PCR-GS: COLMAP-Free 3D Gaussian Splatting via Pose Co-Regularizations
  11. PacGDC: Label-Efficient Generalizable Depth Completion with Projection Ambiguity and Consistency
  12. R1-VL: Learning to Reason with Multimodal Large Language Models via Step-Wise Group Relative Policy Optimization
  13. Rethinking Evaluation of Infrared Small Target Detection
  14. SMStracker: Tri-Path Score Mask Sigma Fusion for Multi-Modal Tracking
  15. SOGS: Second-Order Anchor for Advanced 3D Gaussian Splatting
  16. Spatial Preference Rewarding for MLLMs Spatial Understanding
  17. The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio
  18. Timeexpert: an Expert-Guided Video Llm for Video Temporal Grounding
  19. UniMRSeg: Unified Modality-Relax Segmentation via Hierarchical Self-Supervised Compensation
  20. Versatile Transition Generation with Image-to-Video Diffusion
  21. CAT-SAM: Conditional Tuning for Few-Shot Adaptation of Segment Anything Model
  22. Cross-Domain Few-Shot Segmentation via Iterative Support-Query Correspondence Mining
  23. DA-BEV: Unsupervised Domain Adaptation for Bird's Eye View Perception
  24. Domain Adaptation for Large-Vocabulary Object Detectors
  25. Efficient Test-Time Adaptation of Vision-Language Models
  26. FreGS: 3D Gaussian Splatting with Progressive Frequency Regularization
  27. Historical Test-time Prompt Tuning for Vision Foundation Models
  28. LLMs Meet VLMs: Boost Open Vocabulary Object Detection with Fine-grained Descriptors
  29. Masked AutoDecoder is Effective Multi-Task Vision Generalist
  30. Mitigating Object Hallucination via Concentric Causal Attention
  31. Mitigating Object Hallucinations in Large Vision-Language Models through Visual Contrastive Decoding
  32. Modeling Continuous Motion for 3D Point Cloud Object Tracking
  33. MonoMAE: Enhancing Monocular 3D Detection through Depth-Aware Masked Autoencoders
  34. Open-Vocabulary Object Detection via Language Hierarchy
  35. Purify Unlearnable Examples via Rate-Constrained Variational Autoencoders
  36. Weakly Supervised Monocular 3D Detection with a Single-View Image