PPaperPicks

Jian Luan

Xiaomi, Inc

43 papers at tracked venues · 26 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. AV-Edit: Multimodal Generative Sound Effect Editing via Audio-Visual Semantic Joint Control
  2. Attention Basin: Why Contextual Position Matters in Large Language Models
  3. C2-Cite: Contextual-Aware Citation Generation for Attributed Large Language Models
  4. Doc-V*: Coarse-to-Fine Interactive Visual Reasoning for Multi-Page Document VQA
  5. End-to-End Optimization of LLM-Driven Multi-Agent Search Systems via Heterogeneous-Group-Based Reinforcement Learning
  6. MobileBench-OL: A Comprehensive Chinese Benchmark for Evaluating Mobile GUI Agents in Real-World Environment
  7. Revisiting Entropy in Reinforcement Learning for Large Reasoning Models
  8. STEP: Success-Rate-Aware Trajectory-Efficient Policy Optimization
  9. VecInfer: Efficient LLM Inference with Low-Bit KV Cache via Outlier-Suppressed Vector Quantization
  10. BTL-UI: Blink-Think-Link Reasoning Model for GUI Agent
  11. BacktrackAgent: Enhancing GUI Agent with Error Detection and Backtracking Mechanism
  12. Browsing Like Human: A Multimodal Web Agent with Experiential Fast-and-Slow Thinking
  13. Demystifying Small Language Models for Edge Deployment
  14. Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders
  15. GLCLAP: A Novel Contrastive Learning Pre-trained Model for Contextual Biasing in ASR
  16. Global Eye: Breaking the "Fixed Thinking Pattern" during the Instruction Expansion Process
  17. HoPE: A Novel Positional Encoding Without Long-Term Decay for Enhanced Context Awareness and Extrapolation
  18. Let Your Car Listen to Your Respiration Contactlessly with Ubiquitous Acoustic Signals
  19. MAKAR: a Multi-Agent framework based Knowledge-Augmented Reasoning for Grounded Multimodal Named Entity Recognition
  20. MobileSteward: Integrating Multiple App-Oriented Agents with Self-Evolution to Automate Cross-App Instructions
  21. More is not always better? Enhancing Many-Shot In-Context Learning with Differentiated and Reweighting Objectives
  22. Multilingual Machine Translation with Open Large Language Models at Practical Scale: An Empirical Study
  23. Optimize Quantization for Large Language Models via Progressive Training
  24. Q-Frame: Query-Aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs
  25. ReachAgent: Enhancing Mobile Agent via Page Reaching and Operation
  26. SPO: Self Preference Optimization with Self Regularization
  27. Stability and Generalization of Zeroth-Order Decentralized Stochastic Gradient Descent with Changing Topology
  28. StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion
  29. TailorKV: A Hybrid Framework for Long-Context Inference via Tailored KV Cache Optimization
  30. Text-Enhanced Audio Encoder for Large Language Model based Speech Recognition via Cross-Modality Pre-training with Unpaired Audio-Text Data
  31. Theoretical Insights into Fine-Tuning Attention Mechanism: Generalization and Optimization
  32. Think Silently, Think Fast: Dynamic Latent Compression of LLM Reasoning Chains
  33. Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
  34. Weaving Context Across Images: Improving Vision-Language Models through Focus-Centric Visual Chains
  35. X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance
  36. A Comprehensive Evaluation of Quantization Strategies for Large Language Models
  37. DetermLR: Augmenting LLM-based Logical Reasoning from Indeterminacy to Determinacy
  38. Mixture of Diverse Size Experts
  39. Mobile-Bench: An Evaluation Benchmark for LLM-based Mobile Agents
  40. MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understanding
  41. Pruning Large Language Models to Intra-module Low-rank Architecture with Transitional Activations
  42. SUBLLM: A Novel Efficient Architecture with Token Sequence Subsampling for LLM
  43. ToolPlanner: A Tool Augmented LLM for Multi Granularity Instructions with Path Planning and Feedback