“牛来大模型”表现真可以,是中国大模型又一个重大突破,代表了“极低价格-极高性能”方向的最高水平
新闻里传了一阵子的“牛来大模型”,不出所料是GLM-5.3-Flash,智谱认领了。这个还真有重大技术突破,但需要解释,不太好懂。
图为Artificial Analysis官网的大模型分数排行榜。具体指标非常多,这个评测的公信力算高的。可以来看看分数与性能指标都是些啥。
分数最高的,就是Claude的几个61-63分。GLM-5.3-Flash有57分,其实已经相当厉害了。DeepSeek最强的在图二,53分。GLM-5.3(max)有60分,和Kimi K3一样,代表了中国大模型绝对性能的最高水平。要知道,谷歌最强的Gemini 3.7 Flash (high)也是56分,还不如中国的。
再看价格,就更吓人了。Claude的贵上天,平均每个任务1-3美元。这是Artificial Analysis测试厉害的地方,不是看输出输入token的单价,而是让跑任务,如果能快速解决问题,性能高的说不定更便宜。GLM-5.3-Flash只要0.09美元!比别的高水平的大模型,只有几分之一、几十分之一。DeepSeek V4 Flashs是0.11美元,但分数是52分。
还有1M上下文,GLM-5.3-Flash也支持了。是有不少大模型还做不到1M,例如Qwen3.8-Flash-Next任务单价和性能类似,但只有256K上下文,这差不少。
GLM-5.3-Flash令人震惊的是,规模很小,性能却很强。只有320B 总参数,仅激活 18B,层数从 GLM-4.5 的 92 层砍至 45 层,激活参数和深度几乎减半。Kimi K3是2.8万亿参数, 要大得多,价格要贵10倍了。
据业界分析,GLM-5.3-Flash的架构与Kimi K3高度相似,是开源借鉴,非常好的中国开源圈的“化学反应”。DeepSeek-Kimi-GLM这三家相互学习借鉴,才做得这么好。但GLM-5.3-Flash不是照抄,而是进行了进一步的极致优化,有不少创新。
另外一个值得说的是,GLM-5.3-Flash是用10万个国产卡,就支持了每天100万亿token!OpenRouter上调用量第一,来自全球的真实流量冲击,扛住了。这是一个非常厉害的指标,英伟达CUDA感觉没必要了,起码在推理上,国产卡已经可以起到决定性的作用了。国产卡从年产200万块,搞到年产千万块没问题。加上极致优化,推理算力相当可观,而且智能还不低,真的解决大问题了。
综合来说,GLM-5.3-Flash以320B/18B的轻量架构,打平 Claude Opus 4.8 级别的头部智能。通过学习Kimi K3与极致优化,将长上下文推理成本压到行业最低水平,实现“DeepSeek 级价格,头部级性能”。另外自主可控取得了重大进展,首次用国产芯片集群,大规模承载了全球真实流量,证明国产推理推力的的经济性。
这是非常好的成果,对美国token经济模式提出了重大挑战。
