麻省理工科技评论
26-08-07 10:44 微博认证:《麻省理工科技评论》杂志官方微博

【当大模型开始按Token计价,SSD正在成为AI推理核心】

过去几年,#AI基础设施# 的竞争主要围绕 GPU 和高带宽内存(HBM)展开。随着模型规模不断扩大,训练和推理需要越来越多的算力,GPU 集群、HBM 容量和互连带宽成为衡量系统能力的重要指标。

但进入长上下文、多轮对话和 AI 智能体时代,推理系统面对的问题开始发生变化。一次请求往往不仅涉及模型计算,还需要加载模型权重、读取历史上下文、检索知识、调用工具,再将结果返回模型继续推理。数据需要在 GPU、CPU、内存、存储和网络之间持续流动,只要其中任何一个环节无法及时供给数据,再强的 GPU 也只能等待。

因此,企业评估 AI 基础设施的方式也开始改变。客户真正购买的,并不是一块 GPU ,而是系统能够持续、稳定地完成推理并生成结果的能力。对于在线推理来说,真正被交付的产品,其实是 Token。

企业开始关注的不再只是拥有多少 GPU,而是相同硬件在单位时间内能够交付多少符合服务质量要求(SLO)的 Token,以及完成这些 Token 所需要付出的成本。

戳链接查看详情:http://t.cn/AXNvBK0v