如何在不浪费大量 GPU 试错成本的情况下,把一个 MoE 大模型训练从 16 张 GPU 高效扩展到 512 张 GPU?
http://t.cn/AXWBx8QS
作者Jordan Sassoon,是欧洲为数不多的开源模型厂商Aleph Alpha的员工。
发布于 山东
如何在不浪费大量 GPU 试错成本的情况下,把一个 MoE 大模型训练从 16 张 GPU 高效扩展到 512 张 GPU?
http://t.cn/AXWBx8QS
作者Jordan Sassoon,是欧洲为数不多的开源模型厂商Aleph Alpha的员工。