PPaperPicks

Di Zhang

Kuaishou Technology, Beijing, China

58 papers at tracked venues · 50 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Boosting Resolution Generalization of Diffusion Transformers with Randomized Positional Encodings
  2. Faithful-First Reasoning, Planning, and Acting for Multimodal LLMs
  3. FilmWeaver: Weaving Consistent Multi-Shot Videos with Cache-Guided Autoregressive Diffusion
  4. TIME: Temporal-Sensitive Multi-Dimensional Instruction Tuning and Robust Benchmarking for Video-LLMs
  5. 3DTrajMaster: Mastering 3D Trajectory for Multi-Entity Motion in Video Generation
  6. Biology-Instructions: A Dataset and Benchmark for Multi-Omics Sequence Understanding Capability of Large Language Models
  7. Cafe-Talk: Generating 3D Talking Face Animation with Multimodal Coarse- and Fine-grained Control
  8. ChemVLM: Exploring the Power of Multimodal Large Language Models in Chemistry Area
  9. Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning
    CVPR 2025 · Di Zhang
  10. DSMoE: Matrix-Partitioned Experts with Dynamic Routing for Computation-Efficient Dense LLMs
  11. Decoupling Contrastive Decoding: Robust Hallucination Mitigation in Multimodal Large Language Models
  12. Diffusion Model as a Noise-Aware Latent Reward Model for Step-Level Preference Optimization
  13. Flow-GRPO: Training Flow Matching Models via Online RL
  14. FullDiT: Video Generative Foundation Models with Multimodal Control via Full Attention
  15. GGTalker: Talking Head Systhesis with Generalizable Gaussian Priors and Identity-Specific Adaptation
  16. GPAvatar: High-fidelity Head Avatars by Learning Efficient Gaussian Projections
  17. GameFactorly: Creating New Games with Generative Interactive Videos
  18. HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models
  19. How Far are AI-Generated Videos from Simulating the 3D Visual World: A Learned 3D Evaluation Approach
  20. Imbalance in Balance: Online Concept Balancing in Generation Models
  21. Improving Video Generation with Human Feedback
  22. Koala-36M: A Large-scale Video Dataset Improving Consistency between Fine-grained Conditions and Video Content
  23. LLaMA-Berry: Pairwise Optimization for Olympiad-level Mathematical Reasoning via O1-like Monte Carlo Tree Search
    NAACL 2025 · Di Zhang
  24. Libra-Merging: Importance-redundancy and Pruning-merging Trade-off for Acceleration Plug-in in Large Vision-Language Model
  25. MM-RLHF: The Next Step Forward in Multimodal LLM Alignment
  26. MODA: MOdular Duplex Attention for Multimodal Perception, Cognition, and Emotion Understanding
  27. MUSE: Multi-Subject Unified Synthesis Via Explicit Layout Semantic Expansion
  28. Mavors: Multi-granularity Video Representation for Multimodal Large Language Model
  29. OmniSync: Towards Universal Lip Synchronization via Diffusion Transformers
  30. PatchVSR: Breaking Video Diffusion Resolution Limits with Patch-wise Video Super-Resolution
  31. Recammaster: Camera-Controlled Generative Rendering From a Single Video
  32. Retrieval is Not Enough: Enhancing RAG through Test-Time Critique and Optimization
  33. SPPD: Self-training with Process Preference Learning Using Dynamic Value Margin
  34. Scene Graph Guided Generation: Enable Accurate Relations Generation in Text-to-Image Models via Textural Rectification
  35. SketchVideo: Sketch-based Video Generation and Editing
  36. Solving Token Gradient Conflict in Mixture-of-Experts for Large Vision-Language Model
  37. Stable Segment Anything Model
  38. StyleMaster: Stylize Your Video with Artistic Generation and Translation
  39. SynCamMaster: Synchronizing Multi-Camera Video Generation from Diverse Viewpoints
  40. TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types
  41. Towards Precise Scaling Laws for Video Diffusion Transformers
  42. Unleashing the Potential of Multi-modal Foundation Models and Video Diffusion for 4D Dynamic Physical Scene Simulation
  43. VLM as Policy: Common-Law Content Moderation Framework for Short Video Platform
  44. VidCapBench: A Comprehensive Benchmark of Video Captioning for Controllable Text-to-Video Generation
  45. VidEmo: Affective-Tree Reasoning for Emotion-Centric Video Foundation Models
  46. iMOVE : Instance-Motion-Aware Video Understanding
  47. DialogBench: Evaluating LLMs as Human-like Dialogue Systems
  48. Evaluating Readability and Faithfulness of Concept-based Explanations
  49. Improving Large Language Models via Fine-grained Reinforcement Learning with Minimum Editing Constraint
  50. Inductive-Deductive Strategy Reuse for Multi-Turn Instructional Dialogues
  51. Just Ask One More Time! Self-Agreement Improves Reasoning of Language Models in (Almost) All Scenarios
  52. Learning Multi-Dimensional Human Preference for Text-to-Image Generation
  53. Parrot: Enhancing Multi-Turn Instruction Following for Large Language Models
  54. PlacidDreamer: Advancing Harmony in Text-to-3D Generation
  55. Small Agent Can Also Rock! Empowering Small Language Models as Hallucination Detector
  56. Unified Language-Vision Pretraining in LLM with Dynamic Discrete Visual Tokenization
  57. Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual-Motional Tokenization
  58. VideoTetris: Towards Compositional Text-to-Video Generation