村民F_
26-10-10 23:53 微博认证:数码博主

其实还有一点没说,本地128G统一内存能跑的AI,无非也就是Qwen 3.8 Flash

然而这个模型在云端其实便宜得令人发指,我这三天为了跑模型测试(因为要为这个模型选择合适的Agent测试场景和任务,云端模型满血并且好并发找,比较合适)花掉了3.8亿Token,这么大量的Token其实也只相当于Standard套餐月用量的10%

换句话说,你花了好几万买了个本地推理的机器,最后每个月只能给你省非常有限的钱不说,模型还不是云端满血的,速度还可能比云端慢,而且还做不到并发

本地LLM的故事难讲啊……

发布于 上海