#智谱GLM5.3FlashX模型上线#9月18日智谱上线GLM-5.3-FlashX并开放API,承接GLM-5.3-Flash需求;Flash曾以“Ox Alpha”匿名在OpenCode/OpenRouter测试,因调用量高、10万张国产芯片集群打满而推提速版。
FlashX沿用320B总参、18B激活、1M上下文、128K输出、文本/图像/视频/文件多模态底座,最高200 tokens/s,较Flash提速5倍、定价2.5倍。
它非换新底座,而是把同智能做低延迟档,适合Agent多轮、代码补全、语音陪伴、实时客服;离线摘要、批处理仍用Flash更省。
国产推理集群与Infra优化值得肯定,但是否“同智不降质”、200 tokens/s在并发下稳定与否,需看第三方实测与长期可用性。
发布于 广东
