【2.78万亿参数模型跑在8GB内存上:这到底是黑科技还是极客冷笑话?】开发者Fareed Khan用不到200KB的纯C语言代码实现了一个壮举:让拥有2.78万亿参数的Kimi K3在只有8.24GB内存的普通笔记本上跑通了推理。其核心逻辑是绕过GPU和复杂框架,将1.56TB的模型权重留在硬盘里,推理时仅根据需要把MoE专家权重流式读入内存。这意味着即便没有顶级显卡集群,只要硬盘空间够大,普通设备也能吐出和云端完全一致的结果。社区对此褒贬不一,不少人吐槽每30秒蹦出一个Token的速度慢得像看日出,甚至调侃这是在测试硬盘寿命。但这种尝试的价值在于它把大模型的运行门槛从显存容量这一死指标,变成了推理带宽的调节阀。它证明了MoE架构的稀疏性可以让参数规模与内存占用实现解耦,让推理变成一个有多少钱买多少速度的动态游戏。虽然目前实用性极低,但它却是一次极佳的架构实验,提醒我们当算力不再是唯一门槛时,存储I/O才是限制AI走向个人终端的终极瓶颈。 repo: FareedKhan-dev/kimi-k3-in-c
发布于 北京
