斯坦福这个 Marin 535B 有点东西。训练还没跑完,Loss 曲线、数据配方、代码全扔网上了,失败的实验也不藏着。
5350 亿总参数的 MoE,每个 token 实际激活 230 亿。11 套 GB200 跑三个月,2.7e24 FLOPs。
但说实话参数数字没什么好聊的,MoE 训练才是真的坑多。之前实验里上下文从 4K 拉到 65K,token 丢弃率直接从 7% 干到 40%。最后没办法退回 4K 启动,自己手写了一套 JAX 专家并行,把丢弃率压到 3% 左右。
就是不知道这套通信系统能不能稳稳跑完 100 天,蹲一个后续。
原文:http://t.cn/AXpYgi97
#大模型训练# #MoE# #AI基础设施#
发布于 北京
