PPaperPicks

Yu Wang

Tsinghua University, Department of Electronic Engineering, TNList, Beijing, China

55 papers at tracked venues · 40 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. GENMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration
  2. VocabTailor: Dynamic Vocabulary Selection for Downstream Tasks in Small Language Models
  3. Accelerating Auto-regressive Text-to-Image Generation with Training-free Speculative Jacobi Decoding
  4. AgentRecBench: Benchmarking LLM Agent-based Personalized Recommender Systems
  5. AgentSociety Challenge: Designing LLM Agents for User Modeling and Recommendation on Web Platforms
  6. CityLight: A Neighborhood-inclusive Universal Model for Coordinated City-scale Traffic Signal Control
  7. DHCP: Detecting Hallucinations by Cross-modal Attention Pattern in Large Vision-Language Models
  8. DLFR-VAE: Dynamic Latent Frame Rate VAE for Video Generation
  9. DiTFastAttnV2: Head-Wise Attention Compression for Multi-Modality Diffusion Transformers
  10. Distilled Decoding 1: One-step Sampling of Image Auto-regressive Models with Flow Matching
  11. Distilled Decoding 2: One-step Sampling of Image Auto-regressive Models with Conditional Score Distillation
  12. Dlfr-Gen: Diffusion-Based Video Generation With Dynamic Latent Frame Rate
  13. Dynamic Multimodal Evaluation with Flexible Complexity by Vision-Language Bootstrapping
  14. Efficient Inference for Large Language Models -Algorithm, Model, and System
  15. Enhancing Contrastive Learning Inspired by the Philosophy of "The Blind Men and the Elephant"
  16. Evaluating LLMs Across Multi-Cognitive Levels: From Medical Knowledge Mastery to Scenario-Based Problem Solving
  17. Fighting Fire with Fire (F3): A Training-free and Efficient Visual Adversarial Example Purification Method in LVLMs
  18. FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models
  19. Human-Robot Cooperative Distribution Coupling for Hamiltonian-Constrained Social Navigation
  20. Learning Strategic Language Agents in the Werewolf Game with Iterative Latent Space Policy Optimization
  21. Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network
  22. Linear Combination of Saved Checkpoints Makes Consistency and Diffusion Models Better
  23. MBQ: Modality-Balanced Quantization for Large Vision-Language Models
  24. Multi-UAV Formation Control with Static and Dynamic Obstacle Avoidance via Reinforcement Learning
  25. NTIRE 2025 XGC Quality Assessment Challenge: Methods and Results
  26. PAROAttention: Pattern-Aware ReOrdering for Efficient Sparse and Quantized Attention in Visual Generation Models
  27. QAVA: Query-Agnostic Visual Attack to Large Vision-Language Models
  28. R2R: Efficiently Navigating Divergent Reasoning Paths with Small-Large Model Token Routing
  29. ReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning
  30. SG-Filter: Enhancing Similar Text Retrieval via Hierarchical Summarized-Semantic Index and Adaptive Filtering
  31. SOLA: Optimizing SLO Attainment for Large Language Model Serving with State-Aware Scheduling
  32. Spec-VLA: Speculative Decoding for Vision-Language-Action Models with Relaxed Acceptance
  33. Speculative Jacobi-Denoising Decoding for Accelerating Autoregressive Text-to-image Generation
  34. The Security Threat of Compressed Projectors in Large Vision-Language Models
  35. ViDiT-Q: Efficient and Accurate Quantization of Diffusion Transformers for Image and Video Generation
  36. VolleyBots: A Testbed for Multi-Drone Volleyball Game Combining Motion Control and Strategic Play
  37. What Can RL Bring to VLA Generalization? An Empirical Study
  38. A Unified Sampling Framework for Solver Searching of Diffusion Probabilistic Models
  39. Accelerate Multi-Agent Reinforcement Learning in Zero-Sum Games with Subgame Curriculum Learning
  40. Can LLMs Learn by Teaching for Better Reasoning? A Preliminary Study
  41. Cross-Domain Few-Shot Object Detection via Enhanced Open-Set Object Detector
  42. DeSCo: Towards Generalizable and Scalable Deep Subgraph Counting
  43. DiP-GO: A Diffusion Pruner via Few-step Gradient Optimization
  44. DiTFastAttn: Attention Compression for Diffusion Transformer Models
  45. Evaluating Quantized Large Language Models
  46. FlashDecoding++: Faster Large Language Model Inference with Asynchronization, Flat GEMM Optimization, and Heuristics
  47. FlashEval: Towards Fast and Accurate Evaluation of Text-to-Image Diffusion Generative Models
  48. LLM-Powered Hierarchical Language Agent for Real-time Human-AI Coordination
  49. Language Agents with Reinforcement Learning for Strategic Play in the Werewolf Game
  50. MixDQ: Memory-Efficient Few-Step Text-to-Image Diffusion Models with Metric-Decoupled Mixed Precision Quantization
  51. PIP: Detecting Adversarial Examples in Large Vision-Language Models via Attention Patterns of Irrelevant Probe Questions
  52. Position: Towards Implicit Prompt For Text-To-Image Models
  53. Rad-NeRF: Ray-decoupled Training of Neural Radiance Field
  54. Skeleton-of-Thought: Prompting LLMs for Efficient Parallel Generation
  55. Towards an End-to-End Framework for Invasive Brain Signal Decoding with Large Language Models