【吃灰老卡再战三年!大神魔改P100显卡:跑35B大模型提速88%】一名开发者分享自研优化技术成果:其通过复刻魔改GitHub平台上的ik-llama.cpp项目,为Pascal和Volta两类老架构编写定制计算内核,可重新利用此前被浪费的闲置算力。 该技术可让英伟达Tesla P100 16GB显存计算卡运行35B参数大模型时,预填速度提升88%,解码速度提升30%,配合量化压缩处理后,单张P100的16GB显存可装入对应MoE大模型。
发布于 广东
