MiaAI_lab 发布了一套专门为单台DGX Spark优化的新配置(recipe),用TensorFold来跑Qwen3.8-Flash-Next🔥
升级后的表现:
-支持超长上下文:默认25.6万tokens(大约能塞进一整本厚书的内容)
-可以同时处理5个请求
-生成速度decode(AI一边思考一边输出文字):
单个请求:约62+ tokens/秒
5个请求同时:约119+ tokens/秒
-处理输入速度(预填充):大概2500 tokens/秒
整体比之前常用的vLLM更快
后续性能还会持续迭代 !
总结:TensorFold + DGX Spark 的这个配方很香——把“大模型本地跑”的门槛从企业级拉到了桌面级,从“需要十几万的服务器”变成“买一台几千美元的桌面机就能本地跑”,成本降了 80%–95%。
补充:TensorFold 是一款面向本地部署的高性能大模型推理引擎,支持 Apple Silicon(MLX)和 NVIDIA GPU(包括 DGX Spark),通过“推测解码 + 批量验证”技术显著提升生成速度,同时保证输出结果与串行计算完全一致,并提供标准的 OpenAI 兼容 API,特别适合在单机上高效运行如 Qwen3.8-Flash-Next 等大规模 MoE 模型。
Github: github.com/MiaAI-Lab/Qwen3.8-Flash-Next-Single-DGX-Spark-TensorFold
发布于 马来西亚
