许多小型语言模型训练框架在效率和性能上难以兼顾,而 Sample Efficient GPT 致力于突破小模型样本效率的极限,提供了一套前沿的训练方法和技术。
这个开源项目集成了多项最新研究成果,包括:
- Gated Attention 门控注意力机制
- Value Residual Learning 价值残差学习
- Muon + Triton 高效实现
- LayerNorm Scaling 层归一化缩放
- QK-Norm 和高效 Flash Attention 内核
- muP 参数化技术
- SuperBPE 分词器与 HuggingFace 兼容
此外,还结合了动量预热、权重衰减调度等多种优化技巧,极大提升训练效率和模型表现。
适合对小型语言模型预训练有更高样本效率需求的研究者和开发者。
GitHub 地址:
github.com/thepowerfuldeez/sample_efficient_gpt
主要功能:
- 领先的样本效率训练框架
- 支持 Tokenizer 训练和数据预处理
- 可配置的训练脚本,支持多卡训练
- 集成多项前沿论文技术,提升模型效果
- 适配 RTX 50 系列显卡,性能强劲
欢迎感兴趣的小伙伴们前往体验和贡献,一起探索高效训练的未来!
发布于 河北
