PPaperPicks

Xuelong Li

China Telecom Corp Ltd, Institute of Artificial Intelligence, TeleAI, Beijing, China

84 papers at tracked venues · 66 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Awakening Dormant Experts: Counterfactual Routing to Mitigate MoE Hallucinations
  2. CEMT: Controllable Element-Oriented Machine Translation via Structured Linguistic Reasoning
  3. D-QRELO: Training- and Data-Free Delta Compression for Large Language Models via Quantization and Residual Low-Rank Approximation
  4. DIFFA: Large Language Diffusion Models Can Listen and Understand
  5. FusAD: Time-Frequency Fusion with Adaptive Denoising for General Time Series Analysis
  6. Hallucinations as Orthogonal Noise: Inference-Time Manifold Alignment via Dynamic Contextual Orthogonalization
  7. Introducing Visual Scenes and Reasoning: A More Realistic Benchmark for Spoken Language Understanding
  8. OmniVDiff: Omni Controllable Video Diffusion for Generation and Understanding
  9. Table-R1: Region-based Reinforcement Learning for Table Understanding
  10. The Mark Fades: Adaptive Evolutionary Paraphrase-based Attack against LLM Watermarks
  11. Visual Attention Reasoning via Hierarchical Search and Self-Verification
  12. When Safe Unimodal Inputs Collide: Optimizing Reasoning Chains for Cross-Modal Safety in Multimodal Large Language Models
  13. Adversarial Locomotion and Motion Imitation for Humanoid Policy Learning
  14. AerialVG: A Challenging Benchmark for Aerial Visual Grounding by Exploring Positional Relations
  15. AlignBot: Aligning VLM-Powered Customized Task Planning with User Reminders Through Fine-Tuning for Household Robots
  16. CAS-Spec: Cascade Adaptive Self-Speculative Decoding for On-the-Fly Lossless Inference Acceleration of LLMs
  17. CCIN: Compositional Conflict Identification and Neutralization for Composed Image Retrieval
  18. COHERENT: Collaboration of Heterogeneous Multi-Robot System with Large Language Models
  19. Clustering-Oriented Generative Attribute Graph Imputation
  20. Cocube: a Tabletop Modular Multi-Robot Platform for Education and Research
  21. Discriminator-Guided Embodied Planning for LLM Agent
  22. Efficient Diffusion as Low Light Enhancer
  23. Enhance Vision-Language Alignment with Noise
  24. From Captions to Rewards (CaReVL): Leveraging Large Language Model Experts for Enhanced Reward Modeling in Large Vision-Language Models
  25. G3Flow: Generative 3D Semantic Flow for Pose-aware and Generalizable Object Manipulation
  26. Humanoid Whole-Body Locomotion on Narrow Terrain via Dynamic Balance and Reinforcement Learning
  27. INT: Establishing Information Transfer for Multilingual Intent Detection and Slot Filling
  28. Improve LLM-as-a-Judge Ability as a General Ability
  29. InterSyn: Interleaved Learning for Dynamic Motion Synthesis in the Wild
  30. JTD-UAV: MLLM-Enhanced Joint Tracking and Description Framework for Anti-UAV Systems
  31. KAID: Knowledge-Aware Interactive Distillation for Vision-Language Models
  32. KungfuBot: Physics-Based Humanoid Whole-Body Control for Learning Highly-Dynamic Skills
  33. LLMs Caught in the Crossfire: Malware Requests and Jailbreak Challenges
  34. Leader is Guided: Interactive Motion Generation via Lead-Follow Paradigm and Trajectory Guidance
  35. Learn Beneficial Noise as Graph Augmentation
  36. Logic-Regularized Verifier Elicits Reasoning from LLMs
  37. MAGiC: An LLM-Powered Multi-Agent Framework for Unleashing Visual Creativity
  38. Mixture of Noise for Pre-Trained Model-Based Class-Incremental Learning
  39. MoMa-Kitchen: A 100K+ Benchmark for Affordance-Grounded Last-Mile Navigation in Mobile Manipulation
  40. Multi-Task Curriculum Graph Contrastive Learning with Clustering Entropy Guidance
  41. NFIG: Multi-Scale Autoregressive Image Generation via Frequency Ordering
  42. Online Preference Alignment for Language Models via Count-based Exploration
  43. Open-Vocabulary Octree-Graph for 3D Scene Understanding
  44. PUO-Bench: A Panel Understanding and Operation Benchmark with A Privacy-Preserving Framework
  45. Preference Aligned Diffusion Planner for Quadrupedal Locomotion Control
  46. SVGen: Interpretable Vector Graphics Generation with Large Language Models
  47. Safe Semantics, Unsafe Interpretations: Tackling Implicit Reasoning Safety in Large Vision-Language Models
  48. Secure Tug-of-War (SecTOW): Iterative Defense-Attack Training with Reinforcement Learning for Multimodal Model Security
  49. SmartFreeEdit: Mask-Free Spatial-Aware Image Editing with Complex Instruction Understanding
  50. StitchFusion: Weaving Any Visual Modalities to Enhance Multimodal Semantic Segmentation
  51. T2R-BENCH: A Benchmark for Real World Table-to-Report Task
  52. Think Small, Act Big: Primitive Prompt Learning for Lifelong Robot Manipulation
  53. Towards Efficient LLM Grounding for Embodied Multi-Agent Collaboration
  54. Towards Learnable Anchor for Deep Multi-View Clustering
  55. Towards Reliable LLM-based Robots Planning via Combined Uncertainty Estimation
  56. WebUIBench: A Comprehensive Benchmark for Evaluating Multimodal Large Language Models in WebUI-to-Code
  57. Why Does Dropping Edges Usually Outperform Adding Edges in Graph Contrastive Learning?
  58. Any2Point: Empowering Any-Modality Large Models for Efficient 3D Understanding
  59. CNN to GNN: Unsupervised Multi-level Knowledge Learning
  60. CREST: Cross-modal Resonance through Evidential Deep Learning for Enhanced Zero-Shot Learning
  61. Causal Deciphering and Inpainting in Spatio-Temporal Dynamics via Diffusion Model
  62. Color Event Enhanced Single-Exposure HDR Imaging
  63. Constrained Ensemble Exploration for Unsupervised Skill Discovery
  64. Contrastive Representation for Data Filtering in Cross-Domain Offline Reinforcement Learning
  65. DAG-Aware Variational Autoencoder for Social Propagation Graph Generation
  66. Deep Contrastive Graph Learning with Clustering-Oriented Guidance
  67. Depth Helps: Improving Pre-trained RGB-based Policy with Depth Information Injection
  68. Dual Prompt Tuning based Contrastive Learning for Hierarchical Text Classification
  69. Empowering Smart Glasses with Large Language Models: Towards Ubiquitous AGI
  70. GS-SLAM: Dense Visual SLAM with 3D Gaussian Splatting
  71. Graph Attention Based Multi-Channel U-Net for Speech Dereverberation With Ad-Hoc Microphone Arrays
  72. HPL-ESS: Hybrid Pseudo-Labeling for Unsupervised Event-based Semantic Segmentation
  73. Implicit Event-RGBD Neural SLAM
  74. Kinematic-aware Prompting for Generalizable Articulated Object Manipulation with LLMs
  75. Learning Manipulation by Predicting Interaction
  76. Learning an Actionable Discrete Diffusion Policy via Large-Scale Actionless Video Pre-Training
  77. LiveScene: Language Embedding Interactive Radiance Fields for Physical Scene Control and Rendering
  78. On the Role of General Function Approximation in Offline Reinforcement Learning
  79. Point-PEFT: Parameter-Efficient Fine-Tuning for 3D Pre-trained Models
  80. Regularized Conditional Diffusion Model for Multi-Task Preference Alignment
  81. Robust Quadrupedal Locomotion via Risk-Averse Policy Learning
  82. SAM-E: Leveraging Visual Foundation Model with Sequence Imitation for Embodied Manipulation
  83. Textual-Driven Adversarial Purification for Speaker Verification
  84. Two in One Go: Single-stage Emotion Recognition with Decoupled Subject-context Transformer