蚁工厂
26-10-05 20:14 微博认证:科技博主

如何在不浪费大量 GPU 试错成本的情况下,把一个 MoE 大模型训练从 16 张 GPU 高效扩展到 512 张 GPU?
http://t.cn/AXWBx8QS
作者Jordan Sassoon,是欧洲为数不多的开源模型厂商Aleph Alpha的员工。 ​

发布于 山东