#阿里发布Qwen3.8Flash#
Qwen3.8-Flash最有意思的地方,是它看起来有125B主模型,外加51B的N-gram Embedding,体量相当夸张,但每个Token真正激活的参数只有6B。换句话说,阿里不是让所有参数每次都出来干活,而是想办法让模型“需要谁就叫谁”,再用N-gram Embedding去补容量。按照目前公布的信息,这套设计把训练开销压到了Qwen3.7-Plus的大约1/9。
我觉得这比单纯Benchmark又涨了几个点更重要。过去大家卷大模型,很大程度上就是卷GPU、卷集群、卷训练预算;但当模型越来越大以后,真正限制大模型普及的已经不只是“够不够聪明”,而是这么聪明的模型到底用不用得起。 Qwen3.8-Flash的思路很明显:参数可以继续做大,但计算量不能跟着线性膨胀。
而且它其实已经有一点“下一代架构试验田”的味道了。目前公开信息显示,Qwen3.8-Flash采用GDN+QSA混合注意力、Gated Residual、N-gram Embedding以及Muon优化器,并被定位为下一代Qwen架构的一次技术预览。长上下文方面原生支持262K Token,并可扩展到1M Token。
更狠的是价格。目前公布的API价格是每百万Token输入1元、输出3元。如果这个价格对应的实际Coding、办公、多模态和Agent能力能稳定保持在高水平,那Qwen3.8-Flash真正打的可能不是“谁是最强模型”,而是另一个更现实的问题:高能力模型还能便宜到什么程度?
所以我现在越来越觉得,大模型下半场未必是谁参数最大,而是谁能把“智能密度”做得最高——同样一块GPU、同样一块钱、同样一秒钟,能榨出多少智能。
125B只是数字,6B激活和1/9训练开销,可能才是Qwen3.8-Flash真正值得关注的地方。#ai#
