PPaperPicks

Tong Xu

University of Science and Technology of China, Hefei, China

47 papers at tracked venues · 34 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. How Foundational Skills Influence VLM-based Embodied Agents: A Native Perspective
  2. LLM-EDT: Large Language Models Enhanced Cross-domain Sequential Recommendation with Dual-phase Training
  3. Learning How and What to Memorize: Cognition-Inspired Two-Stage Optimization for Evolving Memory
  4. Look as You Think: Unifying Reasoning and Visual Evidence Attribution for Verifiable Document RAG via Reinforcement Learning
  5. Memory-Augmented LLM-based Multi-Agent System for Automated Feature Generation on Tabular Data
  6. Mock Worlds, Real Skills: Building Small Agentic Language Models with Synthetic Tasks, Simulated Environments, and Rubric-Based Rewards
  7. MolSafeEval: A Benchmark for Uncovering Safety Risks in AI-Generated Molecules
    ACL 2026 · Tong Xu
  8. PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering
  9. ProEchoMem: Enhancing Long Video Understanding via Multi-Trace Probe-Echo Memory
  10. STRIDE: Strategic Iterative Decision-Making for Retrieval-Augmented Multi-Hop Question Answering
  11. To Paraphrase or Not: Efficient Comment Detoxification with Unsupervised Detoxifiability Discrimination
  12. Token-level Collaborative Alignment for LLM-based Generative Recommendation
  13. Uncertainty-Aware Planning for Disambiguating User Intent in Interactive LLM Agents: Application to Baidu Maps
  14. VIGIL: Defending LLM Agents Against Tool-Stream Injection via Verify-Before-Commit
  15. AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models
  16. DepFormer: A Unified Framework with Bimodal Collaborative Transformer for Depression Detection
  17. Following Occam's Razor: Dynamic Combination of Structured Knowledge for Multi-Hop Question Answering using LLMs
  18. From Long Videos to Engaging Clips: A Human-Inspired Video Editing Framework with Multimodal Narrative Understanding
  19. GLINT-RU: Gated Lightweight Intelligent Recurrent Units for Sequential Recommender Systems
  20. Harnessing Large Language Models for Knowledge Graph Question Answering via Adaptive Multi-Aspect Retrieval-Augmentation
  21. ImageScope: Unifying Language-Guided Image Retrieval via Large Multimodal Model Collective Reasoning
  22. Multi-Branch Self-Drafting for LLM Inference Acceleration
  23. NoteLLM-2: Multimodal Large Representation Models for Recommendation
  24. PaRT: Enhancing Proactive Social Chatbots with Personalized Real-Time Retrieval
  25. SGN: Shifted Window-Based Hierarchical Variable Grouping for Multivariate Time Series Classification
  26. Streamlining the Collaborative Chain of Models into A Single Forward Pass in Generation-Based Tasks
  27. Think Wider, Detect Sharper: Reinforced Reference Coverage for Document-Level Self-Contradiction Detection
  28. Think and Recall: Layer-Level Prompting for Lifelong Model Editing
  29. Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
  30. iPET: An Interactive Emotional Companion Dialogue System with LLM-Powered Virtual Pet World Simulation
  31. A Multi-scale Feature Learning Network with Optical Flow Correction for Micro- and Macro-expression Spotting
  32. Bridging Gaps in Content and Knowledge for Multimodal Entity Linking
  33. Collaboration-Aware Hybrid Learning for Knowledge Development Prediction
  34. Double-Checker: Large Language Model as a Checker for Few-shot Named Entity Recognition
  35. Editing Factual Knowledge and Explanatory Ability of Medical Large Language Models
  36. FastMem: Fast Memorization of Prompt Improves Context Awareness of Large Language Models
  37. Granular Entity Mapper: Advancing Fine-grained Multimodal Named Entity Recognition and Grounding
  38. In-Context Former: Lightning-fast Compressing Context for Large Language Model
  39. Large Language Model based Long-tail Query Rewriting in Taobao Search
  40. Mitigating Hallucinations of Large Language Models in Medical Information Extraction via Contrastive Decoding
  41. NoteLLM: A Retrievable Large Language Model for Note Recommendation
  42. Retrieve-Plan-Generation: An Iterative Planning and Answering Framework for Knowledge-Intensive LLM Generation
  43. Scaling Up Multivariate Time Series Pre-Training with Decoupled Spatial-Temporal Representations
  44. UniMEL: A Unified Framework for Multimodal Entity Linking with Large Language Models
  45. VideoLLM-MoD: Efficient Video-Language Streaming with Mixture-of-Depths Vision Computation
  46. Visualization Recommendation with Prompt-based Reprogramming of Large Language Models
  47. When Box Meets Graph Neural Network in Tag-aware Recommendation