听说你想把一大堆乱七八糟的机器凑在一起跑 Deepseek v4 flash?那么你可以看看这个仓库。🐶
DwarfStar(ds4),不再试图“什么模型都能跑”,而是为少数大模型把本地推理榨到极限
本地推理框架常见的做法,是先兼容尽可能多的 GGUF、模型架构和硬件;DwarfStar 走反方向:它明确只为 DeepSeek V4 Flash 优先优化,也支持 GLM 5.2,以及超高内存机器上的 DeepSeek V4 PRO。模型加载、量化、KV 状态、工具调用、HTTP server 和 coding agent 都绑在一起做——牺牲通用性,换取特定模型与设备组合的性能上限。
它瞄准的是一类正在出现但还不够被照顾的机器:96–128GB 的 Apple Silicon 笔记本、512GB 工作站、DGX Spark、Strix Halo,甚至多台机器拼内存跑更大的模型。模型塞不进内存时,也能在 Metal 路径下把 MoE 专家层按需从 SSD 流式读取;速度会降,但不是直接宣判“跑不了”。
作者给出的公开基准很激进:128GB M5 Max 上,DeepSeek V4 Flash 的 2-bit 量化在 2K context 下为 790 token/s prefill、39 token/s generation;该表是项目自测数据,适合当作方向参考,不该当成跨框架的独立结论。它也支持 CUDA 多卡 micro-batching、两台 Mac 以 tensor/pipeline parallel 分摊模型,以及 DSpark 推测解码。
这里有个很好的工程判断:大模型本地化的胜负,不只取决于“模型能否装下”,而取决于系统是否敢为少数真正重要的模型写得足够深。
代价也很清楚:这是 beta、强绑定特定权重格式和硬件路径的窄引擎,不是下载一个 GGUF 就能通吃的 llama.cpp 替代品。
🔗 链接:http://t.cn/AXJgIn4m
📦 模型权重说明:http://t.cn/AXNM6Mxx
#HOW I AI# #ai生活指南# #效率工具#
