Cloudflare官方
26-05-22 18:00 微博认证:Cloudflare官方微博

构建运行超大语言模型的基础

我们宣布了 Workers AI 正式进军大型开源模型托管领域,例如托管了 Moonshot 旗下的 Kimi K2.5 模型。自此以后,我们已将 Kimi K2.5 模型的运行速度提高了三倍,并在处理过程中不断增加更多支持的模型。这些模型已成为我们最近所发布的大量智能体产品、开发框架及工具的核心底座。

在硬件配置上,Cloudflare 采用预填充与解码(PD)解耦架构来分别应对计算与内存限制,并利用会话亲和性标头优化提示词缓存;同时结合 Mooncake 框架进行多 GPU 间的 KV 缓存优化,并利用 NVIDIA EAGLE-3 草稿模型实现推测解码,从而降低延迟并提升吞吐量。此外,其用 Rust 编写的专有推理引擎 Infire 扩展了多 GPU 支持(包括管道、张量和专家并行),通过降低内部状态内存开销,实现了在有限硬件上运行超大模型(如 Kimi K2.5)的能力,并显著缩短了冷启动时间,最终最大化释放了硬件潜力。

机器学习社区每周都会涌现出新技术、新研究成果和新模型。Cloudflare 不断优化技术栈,旨在为客户提供更优质、更高性能的推理服务,同时确保我们的 GPU 高效运行。如果您认为这些挑战很有吸引力,欢迎加入我们,我们正在招聘!

招聘网址:http://t.cn/AX6UsEdj

Cloudflare 保护整个企业网络,帮助客户高效构建互联网规模的应用程序,加速任何网站或互联网应用程序,抵御 DDoS 攻击,防止黑客入侵,并能协助您实现 Zero Trust 的部署与实施。

从任何设备访问 1.1.1.1,使用我们的免费应用加速和保护您的互联网。

立即联系我们,获取更多相关信息http://t.cn/A6Tx4yTT

#Cloudflare##ai##workersai##ai大模型#

发布于 辽宁