柠檬椰子冻-
26-09-18 19:28 微博认证:娱乐博主

#智谱GLM5.3FlashX模型上线#
智谱在 2026-09-18 正式推出 GLM-5.3-FlashX,API 同步开放,定位是「GLM-5.3-Flash 的极速推理版」。

核心信息一句话:

智能水平基本沿用 GLM-5.3-Flash,推理速度拉到最高 200 tokens/s(约 5 倍),价格提到原版 2.5 倍,卖点是“低延迟/Agent/实时对话/代码补全”。

一、和 GLM-5.3-Flash 的区别

基座不变:320B 总参 / 18B 激活,MoE,原生多模态(文本/图片/视频/文件),1M 上下文、128K 最大输出

FlashX 改的是 Infra:推理调度、解码、缓存、国产芯片集群优化,不是重新训个更强模型

速度:FlashX 最高 200 tokens/s,Flash 约 40 tokens/s

价格(元 / 百万 tokens):

Flash:输入 0.8 / 输出 2.8 / 缓存命中 0.23

FlashX:输入 2 / 输出 7 / 缓存命中 0.57

二、适用场景

适合:高并发 Agent、流式对话、AI 编程、实时客服、多步工具调用、对首字/吐字延迟敏感

不适合:离线批量清洗、对成本极敏感、不介意慢的任务(这种用 Flash 更划算)

三、行业含义

智谱这波不是“模型能力大版本”,而是把速度/价格/智能拆成档位卖:

Flash:便宜、能打

FlashX:贵 2.5 倍,但快 5 倍

背后是 10 万张国产芯片推理集群上线即跑满,需求超预期,用“提速提价”承接高时效场景

发布于 天津