嘉树Plus
26-09-11 08:48 微博认证:数码博主

DeepSeek昨日正式发布V4.1 Flash,模型权重已由官方账号上架Hugging Face。官方模型卡显示,它从零训练于45万亿token的多模态语料,稀疏注意力先在64K序列长度训练,并在训练至34万亿token时把上下文扩展到100万token;目标不只是更快回答,而是提升长任务和智能体工作流能力。

更值得关注的是产品分层变化。DeepSeek称,经内部与外部测试,V4.1 Flash在性能、费用、速度和任务总用时等指标上已全面超过V4 Pro;原计划下线的V4 Pro服务推迟至9月14日12时,之后相关API请求将路由到V4.1 Flash。过去“Pro更强、Flash更省”的直觉,正在被同一家模型的新版本打破。

但厂商给出的综合结论不能代替真实业务验收。长上下文不等于能准确利用全部信息,基准领先也不保证多轮工具调用稳定。开发者应先用自己的代码库、检索链路和失败恢复任务对比,再决定迁移。

大模型竞争已从单纯扩大参数,转向提高每次推理的智能密度。能让更便宜、更快的模型接管旧Pro任务,才是有效升级;若只在榜单上超越,迁移成本和错误率最终仍会把用户送回高价模型。#DeepSeekV4.1Flash#

发布于 新加坡