PPaperPicks

Xilin Chen

Chinese Academy of Sciences, Institute of Computing Technology, Beijing, China

38 papers at tracked venues · 27 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. INFACT: A Diagnostic Benchmark for Induced Faithfulness and Factuality Hallucinations in Video-LLMs
  2. M4U: Evaluating Multilingual Understanding and Reasoning for Large Multimodal Models
  3. Tell as You Want: Customizing Image Narrative with Knowledge and Thoughts
  4. A Closer Look at Skeleton-Based Continuous Sign Language Recognition
  5. CogCM: Cognition-Inspired Contextual Modeling for Audio-Visual Speech Enhancement
  6. CtrLoRA: An Extensible and Efficient Framework for Controllable Image Generation
  7. Dysca: A Dynamic and Scalable Benchmark for Evaluating Perception Ability of LVLMs
  8. EfficientMT: Efficient Temporal Adaptation for Motion Transfer in Text-To-Video Diffusion Models
  9. Feature Decomposition-Recomposition in Large Vision-Language Model for Few-Shot Class-Incremental Learning
  10. G2PDiffusion: Cross-Species Genotype-to-Phenotype Prediction Via Evolutionary Diffusion
  11. KnowMol: Advancing Molecular Large Language Models with Multi-Level Chemical Knowledge
  12. Leveraging Unpaired Feedback for Long-Term LLM-based Recommendation Tuning
  13. MATS: An Audio Language Model under Text-only Supervision
  14. Not Only Vision: Evolve Visual Speech Recognition via Peripheral Information
  15. OV3D-CG: Open-Vocabulary 3D Instance Segmentation with Contextual Guidance
  16. ProtInvTree: Deliberate Protein Inverse Folding with Reward-guided Tree Search
  17. R2C: Mapping Room to Chessboard to Unlock LLM As Low-Level Action Planner
  18. Revisiting Logit Distributions for Reliable Out-of-Distribution Detection
  19. Robotic Programmer: Video Instructed Policy Code Generation for Robotic Manipulation
  20. Synthetic View Augmentation for Sign Language Recognition
  21. Task-Oriented Token Pruning for Efficient Object Detection and Segmentation
  22. UniPose: A Unified Multimodal Framework for Human Pose Comprehension, Generation and Editing
  23. Wavelet-Driven Masked Image Modeling: A Path to Efficient Visual Representation
  24. un2CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP
  25. A Simple Romance Between Multi-Exit Vision Transformer and Token Reduction
  26. An Information Theoretical View for Out-of-Distribution Detection
  27. Blocks as Probes: Dissecting Categorization Ability of Large Multimodal Models
  28. ES3: Evolving Self-Supervised Learning of Robust Audio-Visual Speech Representations
  29. HPNet: Dynamic Trajectory Forecasting with Historical Prediction Attention
  30. HiFi-Score: Fine-Grained Image Description Evaluation with Hierarchical Parsing Graphs
  31. Point2Real: Bridging the Gap between Point Cloud and Realistic Image for Open-World 3D Recognition
  32. PreLAR: World Model Pre-training with Learnable Action Representation
  33. Rethinking the Evaluation of Out-of-Distribution Detection: A Sorites Paradox
  34. Scalable Modular Network: A Framework for Adaptive Learning via Agreement Routing
  35. T2IShield: Defending Against Backdoors on Text-to-Image Diffusion Models
  36. Think Before Placement: Common Sense Enhanced Transformer for Object Placement
  37. UMFC: Unsupervised Multi-Domain Feature Calibration for Vision-Language Models
  38. Visual Alignment Pre-training for Sign Language Translation