AIGC·非著名程序员
26-09-10 14:37 微博认证:微博新知博主 科技博主 头条文章作者 微博原创视频博主

DeepSeek V4.1 Flash 正式发布,552B 参数的大模型,每次推理却只唤醒 8B 的输入激活、16B 的输出激活,读便宜、写稍贵,成本算到了每一层。基准测试里它甚至超过了自家旗舰 V4 Pro,价格却走平民路线,旗舰负责秀肌肉,Flash 负责铺量。

真正值得玩味的是定价表。缓存命中的输入只要 0.02 元每百万 Token,未命中要 1 元,同一批 Token 差价 50 倍。配合 KV Cache 缩到初代的 1/437,官方等于在明说:Agent 时代记忆越复用越便宜,反复调用上下文才是常态。

这套组合拳的信号很清晰:DeepSeek 在赌多模态和 Agent 会吃掉海量高频调用,谁把缓存成本打下来,谁就拿到下一轮流量入口。国产与海外的模型差距或许还在,但价格战的主动权,已经换了主人。

#DeepSeekV4.1Flash发布#

发布于 山东