【#智谱开源GLM5首个原生多模态模型#GLM-5.3-Flash】
刚刚,智谱正式上线并开源 GLM-5 系列首个原生多模态模型 GLM-5.3-Flash。
据悉,GLM-5.3-Flash 在综合性能持平 Claude Opus 4.8 的同时大幅降低了调用成本,并已实现大规模国产算力集群的全面适配。
据官方披露,GLM-5.3-Flash 总参数量为 3200 亿(320B),通过采用稀疏注意力与线性注意力的混合架构,其激活参数(18B)与层数(45 层)相较上代大幅缩减,注意力计算量与 KV 缓存大小分别降低 3.01 倍和 4.44 倍。
测试数据显示,该模型在 AA 综合智能指数中斩获 57 分,与 Anthropic 旗下最受欢迎的 Claude Opus 4.8 表现持平,且全面超越参数量高出一倍的 GLM-5.2。
在定价策略上,GLM-5.3-Flash 的常规价格仅为 GLM-5.3 的十分之一,相当于 Claude Opus 4.8 的四十分之一。
在软硬件生态层面,该模型首次实现了深度视觉编码(Visual Coding)集成,允许模型在代码、浏览器与图形界面之间协同工作并进行视觉验证反馈。
此外,官方数据显示其推理服务已全部由国产芯片提供算力支撑。开发团队通过在 SGLang 基础上构建专用推理引擎,结合 Encode–Prefill–Decode(EPD)分离式架构,使国产芯片端到端服务性能提升 3 倍,单 Token 硬件成本与效率已达主流英伟达 GPU 的同等水平。
