Simon的白日梦
26-09-25 11:46 微博认证:科技博主

分享一个单机 DGX Spark 跑 DeepSeek V4Flash 的方案。就是速度有点慢,即便优化过,也只能到20~30多 Token 一秒。

deepseek-v41-flash-spark,一块 DGX Spark 上跑满质量 DeepSeek-V4.1-Flash

0xBakeer 要解决的事很硬:V4.1-Flash 盘上 510 GB,15,360 个 FP4 专家,一块 GB10(大约 128 GB 统一内存)塞不下。别人的单机方案是把权重压到能住进内存。这套不 requant、不剪枝,把测过的热专家常驻,miss 的用 O_DIRECT 从 NVMe 流进来,质量跟原 checkpoint。还带着模型自己的 DSpark 草稿器,作者测过无损、大约 1.5 倍。对外是 OpenAI 兼容接口,推理过程能直接进 Open WebUI 的折叠栏。

v0.5.0 写于 2026-09-14,标明 measured、有限度。早期流式解码大约每秒 2.7 token,瓶颈几乎全在 SSD;后来按路由显著性做常驻集合,代码类任务能到每秒二十多到三十多 token,但更大的常驻池第二天会被内存看门狗杀掉。长文生成、打开 thinking 的非英语,作者自己列在 LIMITATIONS 里。

🔗 链接:http://t.cn/AXOmAiz9
📄 测量:http://t.cn/AXOmAizN
📄 做不到的:http://t.cn/AXOmAizC

这是单机配方,不是四卡全专家常驻。吞吐数字都带着命中率和每 token 读了多少 GB,单独报 tok/s 作者自己也不认。

发布于 广西