PPaperPicks

Jie Fu

Shanghai AI Lab, China

38 papers at tracked venues · 27 at CORE A* · active 20242025

Venues

Frequent coauthors

Papers

  1. A Closer Look into Mixture-of-Experts in Large Language Models
  2. COIG-CQIA: Quality is All You Need for Chinese Instruction Fine-tuning
  3. Enhancing Language Model Hypernetworks with Restart: A Study on Optimization
  4. Finite State Automata Inside Transformers with Chain-of-Thought: A Mechanistic Study on State Tracking
  5. Huatuo-26M, a Large-scale Chinese Medical QA Dataset
  6. Layerwise Recurrent Router for Mixture-of-Experts
  7. MAP: Low-compute Model Merging with Amortized Pareto Fronts via Quadratic Approximation
  8. MIO: A Foundation Model on Multimodal Tokens
  9. MuPT: A Generative Symbolic Music Pretrained Transformer
  10. OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models
  11. PopAlign: Diversifying Contrasting Patterns for a More Comprehensive Alignment
  12. T3D: Advancing 3D Medical Vision-Language Pre-Training by Learning Multi-View Visual Consistency
  13. Thinker: Learning to Think Fast and Slow
  14. VCR: A Task for Pixel-Level Complex Reasoning in Vision Language Models via Restoring Occluded Text
  15. AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling
  16. AutoAgents: A Framework for Automatic Agent Generation
  17. CIF-Bench: A Chinese Instruction-Following Benchmark for Evaluating the Generalizability of Large Language Models
  18. Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs
  19. ChatEval: Towards Better LLM-based Evaluators through Multi-Agent Debate
  20. ChatMusician: Understanding and Generating Music Intrinsically with LLM
  21. D-CPT Law: Domain-specific Continual Pre-Training Scaling Law for Large Language Models
  22. Defending Against Weight-Poisoning Backdoor Attacks for Parameter-Efficient Fine-Tuning
  23. E2-LLM: Efficient and Extreme Length Extension of Large Language Models
  24. Empirical Study on Updating Key-Value Memories in Transformer Feed-forward Layers
  25. HyperMoE: Towards Better Mixture of Experts via Transferring Among Experts
  26. MERT: Acoustic Music Understanding Model with Large-Scale Self-supervised Training
  27. Massive Editing for Large Language Models via Meta Learning
  28. OpenCodeInterpreter: Integrating Code Generation with Execution and Refinement
  29. PositionID: LLMs can Control Lengths, Copy and Paste with Explicit Positional Awareness
  30. ReForm-Eval: Evaluating Large Vision Language Models via Unified Re-Formulation of Task-Oriented Benchmarks
  31. RoleLLM: Benchmarking, Eliciting, and Enhancing Role-Playing Abilities of Large Language Models
  32. Scalable Geometric Fracture Assembly via Co-creation Space among Assemblers
  33. SciMMIR: Benchmarking Scientific Multi-modal Information Retrieval
  34. Stacking Your Transformers: A Closer Look at Model Growth for Efficient LLM Pre-Training
  35. Think Before You Act: Decision Transformers with Working Memory
  36. UniIR: Training and Benchmarking Universal Multimodal Information Retrievers
  37. Unlocking Continual Learning Abilities in Language Models
  38. Unlocking Emergent Modularity in Large Language Models