陈怡然-杜克大学
23-04-30 21:47 微博认证:杜克大学电子与计算机工程系教授 校园博主

前几天去ETH Onur的组里转了转,他正好带着一些学生去伊斯坦布尔开会去了,没见到。只和他组里的博后和学生们聊了聊。谈到了存内计算在大模型计算中的应用的问题。我说了几点自己的看法:

1. 大模型训练太贵了,经常要求几千上万个GPU一起训练。现在出现了很多针对大模型训练的软件框架层面的计算优化,但硬件层面的优化还不多。由于计算量和参数量大,对于并行度的要求高,对于数据流的调度要求更加多样,很多公司今后会把精力放在优化加速大模型训练与推理的并行度和调度上,和NVIDA竞争。

2. 存内计算在计算范式上相比于传统的冯诺伊曼体系,在很多应用上是具有优势的。现在遇到的问题是存内计算内核的并发度全开之后,存储器带宽往往不能支持,造成存内计算内核的使用率过低。这可能得通过加强数据再利用和设计对于存内计算更友好得存储器接口来解决。

3. 很多人觉得大模型和端侧(edge)无关,只是和云有关。这个想法是错的。现在很多人在开始研究如何在端侧或者云端结合来部署中(等规模)或者大模型,至少是推理部分,从而满足各种复杂条件的要求。尤其是多模态的大模型出现后,用户对于反应速度和模型能力的需求几乎是无上限的。

发布于 美国