PPaperPicks

Jun Huang

Alibaba Group, Hangzhou, China

31 papers at tracked venues · 17 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. AgenticQwen: Training Small Agentic Language Models with Dual Data Flywheels for Industrial-Scale Tool Use
  2. Reasoning with OmniThought: A Large CoT Dataset with Verbosity and Cognitive Difficulty Annotations
  3. Zero-to-Hero: Empowering Video Appearance Transfer with Zero-Shot Initialization and Holistic Restoration
  4. AdaptEdit: An Adaptive Correspondence Guidance Framework for Reference-Based Video Editing
  5. Data-Juicer 2.0: Cloud-Scale Adaptive Data Processing for and with Foundation Models
  6. DistilQwen2.5: Industrial Practices of Training Distilled Open Lightweight Language Models
  7. DocLayLLM: An Efficient Multi-modal Extension of Large Language Models for Text-rich Document Understanding
  8. EasyAnimate: High-Performance Video Generation Framework with Hybrid Windows Attention and Reward Backpropagation
  9. EasyDistill: A Comprehensive Toolkit for Effective Knowledge Distillation of Large Language Models
  10. Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis
  11. Enhancing Reasoning Abilities of Small LLMs with Cognitive Alignment
  12. Evaluating Semantic Variation in Text-to-Image Synthesis: A Causal Perspective
  13. FastBlend: Enhancing Video Stylization Consistency via Model-Free Patch Blending
  14. Fingerprinting Denoising Diffusion Probabilistic Models
  15. Hallucination-Aware Prompt Optimization for Text-to-Video Synthesis
  16. Thinking with DistilQwen: A Tale of Four Distilled Reasoning and Reward Model Series
  17. Attentive Linguistic Tracking in Diffusion Models for Training-free Text-guided Image Editing
  18. DAFNet: Dynamic Auxiliary Fusion for Sequential Model Editing in Large Language Models
  19. DiffChat: Learning to Chat with Text-to-Image Synthesis Models for Interactive Image Creation
  20. DiffSynth: Latent In-Iteration Deflickering for Realistic Video Synthesis
  21. Diffutoon: High-Resolution Editable Toon Shading via Diffusion Models
  22. Distilling Instruction-following Abilities of Large Language Models with Task-aware Curriculum Planning
  23. DualToken-ViT: Position-aware Efficient Vision Transformer with Dual Token Fusion
  24. Knowledgeable In-Context Tuning: Exploring and Exploiting Factual Knowledge for In-Context Learning
  25. M2Doc: A Multi-Modal Fusion Approach for Document Layout Analysis
  26. Making Small Language Models Better Multi-task Learners with Mixture-of-Task-Adapters
  27. On the Role of Long-tail Knowledge in Retrieval Augmented Large Language Models
  28. PAI-Diffusion: Constructing and Serving a Family of Open Chinese Diffusion Models for Text-to-image Synthesis on the Cloud
  29. R4: Reinforced Retriever-Reorder-Responder for Retrieval-Augmented Large Language Models
  30. Towards Understanding Cross and Self-Attention in Stable Diffusion for Text-Guided Image Editing
  31. VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models