#智谱##GLM##token价格##开源模型##OpenRouter#
【行业动态:智谱GLM-5.3-FlashX「提速提价」,输出快5倍、定价2.5倍,同一开源模型在分发层出现速度之争】
智谱9月18日上线GLM-5.3-FlashX,把GLM-5.3-Flash的在线推理速度进一步提升,最高输出速度可达200 tokens/s,官方称较原Flash版提升约5倍。GLM-5.3-Flash此前以匿名模型Ox Alpha与开发者见面,8月发布并开源,320B总参数、18B激活的MoE架构,是GLM-5系列首个原生多模态模型。智谱称FlashX是在10万张国产芯片的推理算力上进一步增加基础设施投入、做推理优化后推出的高速版,升级重点不是新基座,而是「提速」。
价格是反常处。在国内厂商今年普遍降价的背景下,FlashX是一次明确提价:据OpenRouter与多家转述,智谱对FlashX列价每百万token输入0.37美元、输出1.25美元、缓存命中0.075美元,约为GLM-5.3-Flash的2.5倍。同一个基座、同一套权重,智谱把「更快」单独拆出来定了一档更贵的价。
更值得记的是分发层的对照。由于Flash开源,OpenRouter上已有十余家第三方供应商在提供它,价格与速度互不相同。抓取时的P50快照显示,Baseten服务的开源Flash吞吐约117 tokens/s,而智谱官方FlashX约83 tokens/s,也就是说这个时点上第三方托管的免费开源版跑得比原厂付费加速版还快。这个数字随时会变,但它把矛盾摆上了台面。
当基座开源、权重人人可得,「速度」就不再天然属于原厂,而变成任何一家有推理优化能力的供应商都能竞争的产品。智谱把速度单独定价,赌的是自家Infra能持续做到最快、值这个溢价,而第三方证明这条护城河并不稳固。可检验的点是接下来一个季度FlashX的调用量流向智谱官方还是更便宜甚至更快的第三方端点,这直接决定「为速度付费」在开源模型上到底成不成立。
发布于 美国
