Marin开源框架发布:面向基础模型全流程预训练
摘要
Marin研究项目发布开源基础模型训练框架,支持数据整理、分词、预训练及评估全流程。当前聚焦5000亿参数混合专家模型,已获GitHub 3000星标,并成功训练出超越Llama 3.1 8B的模型。
Marin是一个集研究计划、软件平台与社区于一体的开源项目,致力于基础模型的研发。该项目由斯坦福CRFM与Open Athena团队核心参与,其核心价值在于开放开发,完整记录从原始数据到最终模型的每一步过程,包括失败的实验记录。
Marin当前的重点是从零开始预训练一个大规模混合专家模型,该模型拥有超过5000亿总参数,计算量达5e24 FLOPs,旨在服务科学家和研究者的关键任务。此外,Marin还被用于构建音频文本、DNA及蛋白质模型,体现了其作为通用库的扩展性。
项目包含一个名为Delphi的开放扩展套件,灵感源自Pythia,其扩展了从3e18到1e23 FLOPs的LLM配方。Delphi由三部分组成:将计算预算映射到模型配置的扩展配方、基于该配方在Google TPU研究云上训练的扩展套件,以及利用较小Delphi模型预测较大模型的扩展定律。
在已有成果方面,Marin此前训练的80亿参数模型在基础模型基准测试套件上超越了Llama 3.1 8B,相关训练脚本和回顾文档均已公开。项目还提供了详细的文档和示例脚本,用户可通过类似Makefile的拓扑顺序执行依赖步骤,快速上手训练小型模型。
Marin在GitHub上已获得3000星标和244次分叉,拥有超过10200次提交。项目鼓励通过将Marin作为库使用来扩展其应用场景,并提供了加载式代理技能指南,以支持社区贡献和持续开发。
本文由新大陆基于公开信息编辑整理
信息来源:GitHubTrending GitHubTrending ↗