#DeepSeekV4.1Flash发布#今天 DeepSeek 发了 V4.1 Flash,有个事挺反直觉:它只是新架构里最小尺寸的模型,官方却把原来发往 V4 Pro 的流量悄悄重定向到它了——而且说综合推理能力还超过了 V4 Pro 旗舰。
关键是架构换了。之前多模态是外挂视觉编码器,现在直接把图像和文本在 Transformer 里统一处理,看图、读文档不用再拆两块。输入激活才 8B、输出 16B,但总参数 552B 的 MoE,成本比同尺寸低一截。
对用的人来说最直观的是快。官方实测峰值 427 tokens/s,长链路 Agent 任务端到端耗时砍掉六成。KV Cache 大幅压缩,HBM 需求降到 1/4,跑智能体的缓存成本也跟着下来。
还有个细节:V4.1 Flash 原生支持 100 万上下文,旧版 V4 Flash 和 Vision 实验版已经下线,调用名改成 deepseek-flash 就能用。
我是觉得,DeepSeek 这次不是堆参数,是改结构把成本打下来。中小团队跑 Agent、做 RAG,这版是真的能省。
发布于 河北
