一只肉松贝贝
26-09-19 00:04 微博认证:娱乐博主 超话创作官(卢昱晓超话)

#智谱发布GLM5.3Fla#一、 核心参数与定价调整
极致提速:最高输出速度达200 tokens/s,较前代GLM-5.3-Flash提升5倍,主打实时交互与高频调用场景的流畅体验。
价格上调:API定价提升至原版本的2.5倍(输入2元/百万Tokens,输出7元/百万Tokens),形成智能、价格、速度的全面竞争力。
开放调用:API已全面上线,Model Key为GLM-5.3-FlashX,面向企业与开发者开放。
二、 算力底座与架构支撑
国产算力:依托超10万张国产AI芯片组成的推理集群,进一步加大对Infra侧的投入与推理优化。
架构优化:通过EPD(编码-预填充-解码)分离架构及底层算子重构,硬件效率与单token成本已对标主流英伟达GPU水平。 http://t.cn/AXONkyHR

发布于 浙江