PPaperPicks

Shaohan Huang

29 papers at tracked venues · 23 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Learning to Refine: Self-Refinement of Parallel Reasoning in LLMs
  2. Reasoning with Exploration: An Entropy Perspective
  3. SPPO: Sequence-Level PPO for Long-Horizon Reasoning Tasks
  4. Shorten After You're Right: Lazy Length Penalties for Reasoning RL
  5. Towards Stable and Effective Reinforcement Learning for Mixture-of-Experts
  6. VFA: Empowering Multilingual MLLMs via Vision-Free Adaptation
  7. Context-DPO: Aligning Language Models for Context-Faithfulness
  8. GeAR: Generation Augmented Retrieval
  9. NL2Lean: Translating Natural Language into Lean 4 through Multi-Aspect Reinforcement Learning
  10. On Domain-Adaptive Post-Training for Multimodal Large Language Models
  11. Rethinking DPO-Style Diffusion Aligning Frameworks
  12. Reward Reasoning Models
  13. Textual Aesthetics in Large Language Models
  14. Think Only When You Need with Large Hybrid-Reasoning Models
  15. Adapting Large Language Models via Reading Comprehension
  16. Boosting Text-to-Video Generative Model with MLLMs Feedback
  17. Grounding Multimodal Large Language Models to the World
  18. HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition
  19. Instruction Pre-Training: Language Models are Supervised Multitask Learners
  20. KOSMOS-E : Learning to Follow Instruction for Robotic Grasping
  21. Kosmos-G: Generating Images in Context with Multimodal Large Language Models
  22. Mixture of LoRA Experts
  23. Multi-Head Mixture-of-Experts
  24. Multimodal Large Language Models Make Text-to-Image Generative Models Align Better
  25. ResLoRA: Identity Residual Mapping in Low-Rank Adaption
  26. Scaling Sentence Embeddings with Large Language Models
  27. Se²: Sequential Example Selection for In-Context Learning
  28. Text Diffusion with Reinforced Conditioning
  29. You Only Cache Once: Decoder-Decoder Architectures for Language Models