PPaperPicks

Xiu Li

Tsinghua University, Tsinghua Shenzhen International Graduate School, Shenzhen, China

80 papers at tracked venues · 61 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. GenPRM: Scaling Test-Time Compute of Process Reward Models via Generative Reasoning
  2. Heterogeneous Multi-treatment Uplift Modeling for Trade-off Optimization in Short-Video Recommendation
  3. RoTE: Coarse-to-Fine Multi-Level Rotary Time Embedding for Sequential Recommendation
  4. Zo3T: Zero-Shot 3D-Aware Trajectory-Guided Image-to-Video Generation via Test-Time Training
  5. A Motion is Worth a Hybrid Sentence: Taming Language Model for Unified Motion Generation by Fine-grained Planning
  6. A Plug-And-Play Physical Motion Restoration Approach for In-The-Wild High-Difficulty Motions
  7. ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning
  8. ART: Anonymous Region Transformer for Variable Multi-Layer Transparent Image Generation
  9. AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward
  10. Audio-Visual Controlled Video Diffusion with Masked Selective State Spaces Modeling for Natural Talking Head Generation
  11. CDSA: Conservative Denoising Score-based Algorithm for Offline Reinforcement Learning
  12. Combinatorial Optimization Perspective based Framework for Multi-behavior Recommendation
  13. Cross-Domain Offline Policy Adaptation with Optimal Transport and Dataset Constraint
  14. Densely Connected Parameter-Efficient Tuning for Referring Image Segmentation
  15. Dora: Sampling and Benchmarking for 3D Shape Variational Auto-Encoders
  16. Enhancing Online Video Recommendation via a Coarse-to-fine Dynamic Uplift Modeling Framework
  17. GIVEPose: Gradual Intra-class Variation Elimination for RGB-based Category-Level Object Pose Estimation
  18. Gamma: Toward Generic Image Assessment with Mixture of Assessment Experts
  19. HunyuanPortrait: Implicit Condition Control for Enhanced Portrait Animation
  20. ICE: Intercede Concept Erasure in Text-to-Image Diffusion Models
  21. InstantSwap: Fast Customized Concept Swapping across Sharp Shape Differences
  22. InterAnimate: Taming Region-Aware Diffusion Model for Realistic Human Interaction Animation
  23. InterSyn: Interleaved Learning for Dynamic Motion Synthesis in the Wild
  24. Leveraging Score-based Models for Generating Penalization in Model-based Offline Reinforcement Learning
  25. Linear Differential Vision Transformer: Learning Visual Contrasts via Pairwise Differentials
  26. LoRA-Gen: Specializing Large Language Model via Online LoRA Generation
  27. MVPortrait: Text-Guided Motion and Emotion Control for Multi-view Vivid Portrait Animation
  28. MaTe: Images are All You Need for Material Transfer via Diffusion Transformer
  29. MagicArticulate: Make Your 3D Models Articulation-Ready
  30. MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO
  31. MultiBooth: Towards Generating All Your Concepts in an Image from Text
  32. Puppeteer: Rig and Animate Your 3D Models
  33. REPARO: Compositional 3D Assets Generation with Differentiable 3D Layout Alignment
  34. Reti-Diff: Illumination Degradation Image Restoration with Retinex-based Latent Diffusion Model
  35. Revisiting Multi-Agent World Modeling from a Diffusion-Inspired Perspective
  36. SAM-R1: Leveraging SAM for Reward Feedback in Multimodal Segmentation via Reinforcement Learning
  37. SUMO: Search-Based Uncertainty Estimation for Model-Based Offline Reinforcement Learning
  38. Separate to Collaborate: Dual-Stream Diffusion Model for Coordinated Piano Hand Motion Synthesis
  39. SkillMimic: Learning Basketball Interaction Skills from Demonstrations
  40. TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making
  41. Taming Rectified Flow for Inversion and Editing
  42. Towards Efficient LLM Grounding for Embodied Multi-Agent Collaboration
  43. VLP: Vision-Language Preference Learning for Embodied Manipulation
  44. World Models with Hints of Large Language Models for Goal Achieving
  45. BATON: Aligning Text-to-Audio Model Using Human Preference Feedback
  46. Bridging the Divide: Reconsidering Softmax and Linear Attention
  47. Bridging the Gap: A Unified Video Comprehension Framework for Moment Retrieval and Highlight Detection
  48. COVE: Unleashing the Diffusion Feature Correspondence for Consistent Video Editing
  49. Chain of Generation: Multi-Modal Gesture Synthesis via Cascaded Conditional Control
  50. CoST: Contrastive Quantization based Semantic Tokenization for Generative Recommendation
  51. Consistent123: One Image to Highly Consistent 3D Asset Using Case-Aware Diffusion Priors
  52. Cross-Domain Policy Adaptation by Capturing Representation Mismatch
  53. Cross-Modal Match for Language Conditioned 3D Object Grounding
  54. Deep Pattern Network for Click-Through Rate Prediction
  55. Dual Mapping of 2D StyleGAN for 3D-Aware Image Generation and Manipulation (Student Abstract)
  56. Efficient Diffusion Transformer with Step-Wise Dynamic Attention Mediators
  57. Exploration and Anti-Exploration with Distributional Random Network Distillation
  58. FAFA: Frequency-Aware Flow-Aided Self-supervision for Underwater Object Pose Estimation
  59. Follow Your Pose: Pose-Guided Text-to-Video Generation Using Pose-Free Videos
  60. GRA: Detecting Oriented Objects Through Group-Wise Rotating and Attention
  61. IncMSR: An Incremental Learning Approach for Multi-Scenario Recommendation
  62. Lodge: A Coarse to Fine Diffusion Network for Long Dance Generation Guided by the Characteristic Dance Primitives
  63. MambaTalk: Efficient Holistic Gesture Synthesis with Selective State Space Models
  64. MambaTree: Tree Topology is All You Need in State Space Model
  65. Mind the Interference: Retaining Pre-trained Knowledge in Parameter Efficient Continual Learning of Vision-Language Models
  66. Mind the Model, Not the Agent: The Primacy Bias in Model-Based RL
  67. Modeling Domains as Distributions with Uncertainty for Cross-Domain Recommendation
  68. Normalization Enhances Generalization in Visual Reinforcement Learning
  69. ODRL: A Benchmark for Off-Dynamics Reinforcement Learning
  70. PEARL: Zero-shot Cross-task Preference Alignment and Robust Reward Learning for Robotic Manipulation
  71. Real-world Image Dehazing with Coherence-based Pseudo Labeling and Cooperative Unfolding Network
  72. Realistic Human Motion Generation with Cross-Diffusion Models
  73. Robust Quadrupedal Locomotion via Risk-Averse Policy Learning
  74. SAM-E: Leveraging Visual Foundation Model with Sequence Imitation for Embodied Manipulation
  75. SEABO: A Simple Search-Based Method for Offline Imitation Learning
  76. STViT: Improving Self-Supervised Multi-Camera Depth Estimation with Spatial-Temporal Context and Adversarial Geometry Regularization (Student Abstract)
  77. Strategic Preys Make Acute Predators: Enhancing Camouflaged Object Detectors by Generating Camouflaged Objects
  78. Towards Understanding How to Reduce Generalization Gap in Visual Reinforcement Learning
  79. UW-SDF: Exploiting Hybrid Geometric Priors for Neural SDF Reconstruction from Underwater Multi-view Monocular Images
  80. Using Human Feedback to Fine-tune Diffusion Models without Any Reward Model