霜叶
26-09-10 16:39 微博认证:2020-2024最具影响力科技大V 微博2019十大电影大V评委 科技博主 头条文章作者

#DeepSeekV4.1Flash发布# DeepSeek今天发了V4.1 Flash。

552B参数的MoE,用了个新的Causal-Encoder-Decoder结构,输入输出不对称:输入激活8B,输出激活16B。参数堆得大,真干活时用的少,成本就下来了。

然后是,把他们自家的V4 Pro干掉了。官方说在性能、费用、速度、总用时上全面超越V4 Pro。
所以9月14号之后,访问V4 Pro的请求全部路由到V4.1 Flash,按Flash的价格计费。

当然价格是重点。
输出4块/百万token,缓存命中0.02元,闲时一律半价。
加上KV Cache比初代压缩了437倍、对HBM的需求降到四分之一,跑Agent和长上下文的人,会实惠很多。

另外,原生多模态视觉,模型名统一成deepseek-flash,旧名字暂时兼容路由过去,迁移成本基本为零。腾讯WorkBuddy、CodeBuddy和OpenCode已经全量接入。我在Lobster上也已经在用了。

以前是小模型又快又便宜,但不够聪明。
现在是最小的那个最便宜,还比旗舰聪明。
梁圣又要卷了。

发布于 北京