PPaperPicks

Huchuan Lu

Dalian University of Technology, School of Information and Communication Engineering, China

70 papers at tracked venues · 55 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. CADTrack: Learning Contextual Aggregation with Deformable Alignment for Robust RGBT Tracking
  2. SAM3-I: Segment Anything with Instructions
  3. Seek-and-Solve: Benchmarking MLLMs for Visual Clue-Driven Reasoning in Daily Scenarios
  4. X-ReID: Multi-granularity Information Interaction for Video-Based Visible-Infrared Person Re-Identification
  5. Automated Evaluation of Large Vision-Language Models on Self-Driving Corner Cases
  6. Autoregressive Video Generation without Vector Quantization
  7. Bootstraping Clustering of Gaussians for View-consistent 3D Scene Understanding
  8. CAT: A Unified Click-and-Track Framework for Realistic Tracking
  9. CCL-LGS: Contrastive Codebook Learning for 3D Language Gaussian Splatting
  10. CLIMB-ReID: A Hybrid CLIP-Mamba Framework for Person Re-Identification
  11. DefMamba: Deformable Visual State Space Model
  12. EVEv2: Improved Baselines for Encoder-Free Vision-Language Models
  13. Efficient Motion Prompt Learning for Robust Visual Tracking
  14. End-to-End Vision Tokenizer Tuning
  15. FineRS: Fine-grained Reasoning and Segmentation of Small Objects with Reinforcement Learning
  16. From Forecasting to Planning: Policy World Model for Collaborative State-Action Prediction
  17. GFM-Planner: Perception-Aware Trajectory Planning with Geometric Feature Metric
  18. GLDesigner: Leveraging Multi-Modal LLMs as Designer for Enhanced Aesthetic Text Glyph Layouts
  19. High-Precision Dichotomous Image Segmentation via Probing Diffusion Capacity
  20. IDEA: Inverted Text with Cooperative Deformable Aggregation for Multi-modal Object Re-Identification
  21. Learning Spatial-Semantic Features for Robust Video Object Segmentation
  22. MambaPro: Multi-Modal Object Re-identification with Mamba Aggregation and Synergistic Prompt
  23. Mono2Stereo: A Benchmark and Empirical Study for Stereo Conversion
  24. ReNeg: Learning Negative Embedding with Reward Guidance
  25. Regularizing Subspace Redundancy of Low-Rank Adaptation
  26. Rethinking Evaluation of Infrared Small Target Detection
  27. SUTrack: Towards Simple and Unified Single Object Tracking
  28. Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge
  29. The Devil is in Temporal Token: High Quality Video Reasoning Segmentation
  30. The Third Visual Object Tracking Segmentation VOTS2025 Challenge Results
  31. Towards Real-Time Open-Vocabulary Video Instance Segmentation
  32. TrackDiffusion: Tracklet-Conditioned Video Generation via Diffusion Models
  33. Two-stream Beats One-stream: Asymmetric Siamese Network for Efficient Visual Tracking
  34. UniMRSeg: Unified Modality-Relax Segmentation via Hierarchical Self-Supervised Compensation
  35. UniSegDiff: Boosting Unified Lesion Segmentation via a Staged Diffusion Model
  36. VLIPP: Towards Physically Plausible Video Generation with Vision and Language Informed Physical Prior
  37. Boosting Continual Learning of Vision-Language Models via Mixture-of-Experts Adapters
  38. CriDiff: Criss-Cross Injection Diffusion Framework via Generative Pre-train for Prostate Segmentation
  39. Customizing Text-to-Image Generation with Inverted Interaction
  40. DCPT: Darkness Clue-Prompted Tracking in Nighttime UAVs
  41. DME: Unveiling the Bias for Better Generalized Monocular Depth Estimation
  42. EvSign: Sign Language Recognition and Translation with Streaming Events
  43. Event-Guided Rolling Shutter Correction with Time-Aware Cross-Attentions
  44. Fantastic Animals and Where to Find Them: Segment Any Marine Animal with Dual SAM
  45. Hybrid-SORT: Weak Cues Matter for Online Multi-Object Tracking
  46. LLMs Can Evolve Continually on Modality for X-Modal Reasoning
  47. LOVD: Large-and-Open Vocabulary Object Detection
  48. Large Occluded Human Image Completion via Image-Prior Cooperating
  49. MAS-SAM: Segment Any Marine Animal with Aggregated Features
  50. Magic Tokens: Select Diverse Tokens for Multi-modal Object Re-Identification
  51. MaskMentor: Unlocking the Potential of Masked Self-Teaching for Missing Modality RGB-D Semantic Segmentation
  52. MoTrans: Customized Motion Transfer with Text-driven Video Diffusion Models
  53. Multi-Modal Instruction Tuned LLMs with Fine-Grained Visual Perception
  54. Multi-Scale and Detail-Enhanced Segment Anything Model for Salient Object Detection
  55. Multi-View Aggregation Network for Dichotomous Image Segmentation
  56. Open-Vocabulary Camouflaged Object Segmentation
  57. PIXART-Σ: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation
  58. PixArt-α: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis
  59. PsySafe: A Comprehensive Framework for Psychological-based Attack, Defense, and Evaluation of Multi-agent System Safety
  60. SHERL: Synthesizing High Accuracy and Efficient Memory for Resource-Limited Transfer Learning
  61. Safety-First Tracker: A Trajectory Planning Framework for Omnidirectional Robot Tracking
  62. SelM: Selective Mechanism based Audio-Visual Segmentation
  63. Spatial-Temporal Multi-level Association for Video Object Segmentation
  64. Spider: A Unified Framework for Context-dependent Concept Segmentation
  65. TF-CLIP: Learning Text-Free CLIP for Video-Based Person Re-identification
  66. TOP-ReID: Multi-Spectral Object Re-identification with Token Permutation
  67. The Second Visual Object Tracking Segmentation VOTS2024 Challenge Results
  68. Towards Automatic Power Battery Detection: New Challenge, Benchmark Dataset and Baseline
  69. UniPT: Universal Parallel Tuning for Transfer Learning with Efficient Parameter and Memory
  70. Unveiling Encoder-Free Vision-Language Models