内存的容量,直接决定了你装得下多大的模型和多长的上下文;
内存的带宽,直接决定了每个字能多快被重新搬一遍,也就是模型吐token的速度。
结论是,只要token的消耗量在持续增长,对芯片吞吐量的追求就不会停止,那么HBM(高带宽内存)容量和带宽翻倍的追求也不会停止。
#恋与深空回应争议#
发布于 云南
内存的容量,直接决定了你装得下多大的模型和多长的上下文;
内存的带宽,直接决定了每个字能多快被重新搬一遍,也就是模型吐token的速度。
结论是,只要token的消耗量在持续增长,对芯片吞吐量的追求就不会停止,那么HBM(高带宽内存)容量和带宽翻倍的追求也不会停止。
#恋与深空回应争议#