每天玩AI
26-09-21 09:10 微博认证:AI博主

DGX Spark 硬件上常见的大模型运行配置(MiaAI_lab 分享):

🚀 1台 DGX Spark:大多数人运行的是 Qwen3.8 Flash Next。

原始权重(125B 参数+51B N-gram embedding)或官方量化版本可能超过单台 Spark 可用内存(128GB 统一内存),通常通常需要特殊量化和磁盘卸载:如 4-bit 量化、把 N-gram/PLE 表映射到 NVMe、使用 vLLM 或 llama.cpp 的补丁、限制上下文长度或 KV Cache 。

🚀 2 台 DGX Spark:GLM 5.3 Flash(TP=2),或 DeepSeek v4.1 Flash。

使用量化权重、跨节点通信和 vLLM 等组件,如:EXL3/4-bit 量化、Tensor Parallel、ConnectX-7 网络、特定 CUDA/vLLM 镜像、可能需要 DFlash2 或自定义 Kernel。

🚀 3 台 DGX Spark,配置方案 1:

- 2 台 DGX Spark 运行 GLM 5.3 Flash;
- 1 台 DGX Spark 单独运行 Qwen3.8 Flash;
- 分工逻辑:GLM 作为编排器,Qwen 3.8 Flash Next 作为工作模型。

🚀 3 台 DGX Spark,配置方案 2:

- 三台全部运行 GLM 5.3 Flash;或
- 三台全部运行 DeepSeek v4.1 Flash。

🚀 4 台 DGX Spark,配置方案 1:

- 2 台运行 GLM 5.3 Flash;
- 2 台运行 Qwen3.8 Flash;
- 分工逻辑:GLM 作为编排器,Qwen 3.8 Flash Next 作为工作模型。

🚀 4 台 DGX Spark,配置方案 2:

- 四台全部运行 DeepSeek v4.1 Flash;或
- 四台全部运行 GLM 5.3 Flash。

🚀 6 台及以上 DGX Spark:

当你拥有 6 台或更多设备时,可组合的方式就非常灵活了。你可以运行各种不同的配置,很多用户采用下面这套方案:

- 2 台运行 GLM 5.3 Flash;
- 2 台运行 Qwen3.8 Flash;
- 2 台运行 DeepSeek v4 Flash;
- 分工逻辑:
- GLM 5.3 Flash 作为编排器;
- Qwen 3.8 Flash 作为工作模型;
- DeepSeek v4 Flash 作为安全扫描器和网络安全模块。

GLM 5.3 Flash(2x DGX Sparks):github.com/MiaAI-Lab/GLM-5.3-Flash-EXL3-2x-DGX-Sparks

Qwen3.8 Flash Next(单台 Spark):github.com/MiaAI-Lab/Qwen3.8-Flash-Next-Single-DGX-Spark

Qwen3.8 Flash Next(2x DGX Sparks):github.com/MiaAI-Lab/Qwen3.8-Flash-Next-Dual-DGX-Sparks

DeepSeek v4.1 Flash(2x DGX Sparks):github.com/MiaAI-Lab/DeepSeek-v4.1-Flash-EXL3-2x-DGX-Sparks

DeepSeek v4.1 Flash on 3-4x Sparks: github.com/MiaAI-Lab/DeepSeek-v4.1-Flash-DGX-Sparks

发布于 马来西亚