AIGCLINK
26-10-10 09:53 微博认证:AI博主

企业私有化 token 工厂的看板,有人开源了:sparkDash 2.0,对于我们这种搞私有化算力的从业者来说非常有价值。

自建算力、私有部署、模型主权——这条路上的公司,买卡和下权重都不难,难的是把一堆 GPU 真正当成一座工厂来运营。

工厂要有看板,产线在不在跑、产能多少、良率多少、单位成本多少,推理集群也一样:

1、卡在干什么?
每秒出多少 token,卡在 decode 还是 prefill?
一千个 token 烧多少电、花多少钱?
换模型、换量化、换引擎之后,质量掉没掉?
MiaAI_lab 用自己 4 台 DGX Spark 跑 GLM 5.3 Flash 的真实需求,把这四个问题做成了一个面板 开源出来。

2、产线状态
每台机器一张卡片:GPU、CPU、统一内存、存储、网络、当前服务的模型。任何带 N 卡的 Linux 机器都能接,多卡主机每张卡一个块,从 UI 加机器不重启。

3、产能
直接读 vLLM / SGLang / llama.cpp / TensorFold / EXL3 等引擎自己的指标:实时 decode 和 prefill tok/s、KV cache 占用、运行/等待队列、TTFT、ITL p95、抢占、prefix cache 命中、MTP 接受率,这是token生产线仪表盘,不是显卡温度计。

4、良率
内置压测:Decode bench 跑 1/2/4/8 并发的总吞吐和单流吞吐,Prefill bench,Quality bench 直接跑 GSM8K 和 MMLU,Tool Eval Bench 69 个工具调用场景。

每次结果都留着,换模型前后一对比,质量回退一眼看出来,私有化交付的验收环节,就靠这个。

5、成本
Token 总量按模型、按天、生成和读取分开,缓存命中率。Fleet energy 算当前功耗、24 小时耗电、电费、每千 token 多少 Wh。

"自建到底比调 API 便宜多少",这一页截图就是答案。

6、运营
面板上启停模型、整机群优雅关机、Wake-on-LAN、Tailnet 掉线告警、手机端可看、SSH 密码 AES-256-GCM 加密。

它不是替代 DCGM + Prometheus 的万卡监控的方案,大厂方案太重,自己拼 Grafana 太费劲,它刚好面向企业私有化的小型 token 工厂:企业内部算力池、政府部门的内网部署、团队实验机群。

模型主权 = 权重在自己手里 + 推理在自己机器上 + 账在自己脑子里,前两个大家都在做,但第三个一直缺工具,现在sparkDash补齐了这个。
http://t.cn/AXlbq0GQ

发布于 美国