【DeepSeek V4 Flash 单机极限:384k 超长上下文的“瘦身”奇迹】MiaAI-Lab 近期发布的项目( MiaAI-Lab/DeepSeek-v4-Flash-One-DGX-Spark )展示了如何在单台 NVIDIA DGX Spark 设备上跑通 DeepSeek V4 Flash 0731 版本。通过 EXL3 3.0 bpw 量化方案和 DSpark 投机采样技术,该方案在仅 128GB 统一内存的单节点上实现了 TP1 张量并行,直接打破了官方原本需要两台设备做 TP2 才能运行的限制。实测在 384k 超长上下文下仍能保持 44-47 Token/s 的生成速度,且在 370k 长度的“大海捞针”测试中实现了 100% 的准确召回。这套方案的核心价值在于极致的内存挤压:它通过修复 NVFP4 双缓存预填充漏洞,配合 REAP 专家剪枝和非均匀比特分配,让 3.0 bpw 的量化精度在实际观感上接近 GGUF Q5 的水平。这说明大模型竞赛的下半场正从单纯的算力堆砌转向精细化的内存管理。开发者应该关注其对 KV Cache 的极限压榨——通过回收显存分析中的冗余预留,将单机硬件的效能边界向外推了一大截。对于追求长文本推理又受限于硬件规模的团队来说,这种“软件换空间”的工程实践比单纯追求模型参数更有参考意义。
发布于 北京
