《”囤”点内存?》AI基础设施的一个矛盾是内存容量和带宽严重落后于不断增长的模型、GPU算力和AI应用的需求,撞上了内存墙:内存已成为生成式人工智能发展的卡脖子环节。
2018年到2025年,Transformer模型规模每两年增长约20倍,而每片GPU的内存容量每两年才增长不到2倍。
内存瓶颈不仅在于容量不够,更在于带宽无法满足计算需求。过去20年,计算峰值速度增长了约6万倍,但DRAM带宽仅增长了100倍,互连带宽才增长了30倍。
结果就是,即使内存能装下所有模型参数,也无法足够快地将数据从内存输送到计算单元。处理器经常处于闲置状态等待数据,无米下锅,浪费了宝贵的计算资源,影响了应用性能。
这种”内存墙”现象对推理的影响尤为严重。
大模型参数加上激活值和状态数据通常是模型参数本身大小的3到4倍,无法完全放到在单个计算单元的内存中。而在GPU之间移动权重、激活值和KV缓存的速度,远低于芯片能够提供的算力。这大大制约了推理的性能和效率。
内存墙的存在要求AI训练和推理软件,从系统架构设计到实现,从部署到运行,都需要深度的优化。这些目前还离不开有经验的”肉身”工程师,搞AI系统软件的同学暂时还不会”失业”。
不管如何,先”囤”点内存?
#人工智能撞上内存墙#
发布于 美国
