今天刷AI圈资讯的时候,几个消息叠在一起看,有种“行业真的在按加速键跑”的实感,想随手聊聊最近的几个实打实的动态,没有虚的预判,只说自己看到的变化。
首先是DeepSeek V4-Flash正式版API上线公测的事还在持续发酵:284B总参数仅激活13B,模型骨架没做改动,只是重做了后训练,结果Agent能力就已经超越了三个月前的V4-Pro预览版,缓存命中时价格低至0.2元/百万tokens,还原生支持Responses API和Codex工作流。这点其实挺打破之前的固有认知——之前大家总觉得模型能力提升就得靠堆参数、堆更大的模型,现在看来后训练的优化空间可能比我们之前预想的大得多,相当于“把现有模型的潜力挖透”这条路,还远没走到头,这对整个行业来说其实是个很积极的信号,意味着不用一味拼硬件拼参数,精细化优化就能带来实打实的体验和成本提升。
然后看到DeepSeek自研AI推理芯片项目已经启动约一年了,目前聚焦推理场景性能优化,目标是降低对海外算力芯片的依赖,现在处于早期商务洽谈阶段。其实这事挺务实的,现在大模型落地最大的成本之一就是推理算力,尤其是国内厂商,想把成本打下来、把可控性提上去,自研推理芯片是绕不开的路,而且先聚焦自己模型最需要的推理场景吃透,反而更容易出落地的成果。
还有OpenAI GPT-5.6 Luna直接降价80%,输入价格已经低于DeepSeek,之前大家总觉得AI价格战是国内厂商在卷,现在看来这把火已经烧到全球了。对普通用户和开发者来说肯定是好事,意味着用AI的成本会越来越低,门槛也会越来越低,但反过来也说明,现在大模型行业的竞争已经从“拼谁先做出大模型”变成了“拼谁能把成本控住、把体验做好”,接下来没有核心技术和成本优势的厂商,日子会越来越难。
最后是英伟达联合D-MATRIX推出了针对AI Agent多轮交互场景的定制算力系统,专门解决工具调用、代码执行等高密度交互场景的算力效率损耗。现在AI Agent是真的越来越火了,但之前Agent多轮交互的时候,反复调用工具、执行代码,算力浪费其实挺严重的,这个定制系统相当于精准补了这个场景的短板,也说明现在行业的算力优化已经从“通用算力”往“场景化定制算力”走了,后续Agent的落地速度可能还会再快一步。
其实这几个事放在一起看,能感觉到现在AI行业的几个明确方向:一是模型优化不再一味堆参数,后训练、精细化调优的价值在凸显;二是算力自主和场景化算力优化成了核心竞争力;三是价格战已经全球化,普惠是必然趋势。不知道大家最近用大模型的时候,有没有感觉到成本变低、体验变好的变化?欢迎聊聊你们最近用到的印象深刻的AI产品。
#DeepSeekV4Flash##AI Agent##GPT56降价#
发布于 广东
