【在MacBook上跑2.8万亿参数模型?Kimi K3本地推理实验】开发者在搭载128GB内存的M5 Max MacBook Pro上,通过外接四块SSD实现了Kimi K3(2.8T MoE模型)的完整本地运行。该实验放弃了常见的权重量化压缩,坚持使用Moonshot发布的原始专家权重,通过ARGODRIVE存储优化技术,将推理速度推到了1.00 token/s。这并非一个面向大众的生产力工具,而是一场极限硬件压榨实验。它证明了即便没有数百万美元的算力集群,个人用户也能以时间换空间,在消费级硬件上触碰大模型的天花板。虽然目前预填充512个token需要长达6分钟的等待,且KV Cache限制了上下文长度,但其核心价值在于揭示了存储带宽与推理性能的非线性关系:多盘并行并非简单的带宽叠加,而是受限于最慢专家读取的木桶效应。对于那些对隐私极度敏感、且能接受非实时异步任务(如深夜自动生成报表)的极客来说,这种“以硬盘换显存”的路径,为本地运行超大规模模型撕开了一道裂缝。
发布于 北京
