【GPU资源净省82%!北大阿里联手破局算力浪费难题,让单个GPU最多支持7个模型】
每个 GPU 最多可以支持 7 个模型、10 个模型所需 #GPU# 数量从 1192 个减至 213 个、最终节约高达 82% 的 GPU 资源——这便是由#北京大学# 团队和#阿里巴巴# 团队提出的名为 Aegaeon 的多模型服务系统实现的效果。相关论文发表于由美国计算机协会主办的国际顶会 2025 年操作系统原理研讨会(SOSP,Symposium on Operating Systems Principles)上,阿里云 CTO 周靖人也是相关论文的作者之一。
Aegaeon 能在 token 粒度上执行模型自动扩缩容,从而能够实现有效的 GPU 池化(一种通过虚拟化技术将物理 GPU 资源动态分配给多个模型使用的管理方法)。它以每个 token 为基础来调度多模型请求,并能做出自动扩缩容决策,从而可以实现服务质量的最大化。它通过组件重用、显式内存管理和细粒度键值(KV,Key-Value)缓存同步,将自动扩缩容开销降低了 97%。
实验表明,与现有解决方案相比,Aegaeon 能维持高出 2 倍–2.5 的请求到达率,并能实现高出 1.5 倍–9 倍的有效吞吐量。目前,Aegaeon 已经在阿里云 Model Studio 进行 Beta 版部署并已服务于 10 个模型。
下图是 Aegaeon 的架构图,展示了它服务于多个模型的过程。具体来说,Aegaeon 先是通过代理层分发这些模型,代理层通过共享内存机制与底层服务实例同步请求元数据,以便确保负载均衡和容错。Aegaeon 可以将不同模型的请求分发到同一个实例,一旦请求被发送到某个实例,Aegaeon 会在 token 级调度器的指导之下调度它们的执行。
戳链接查看详情:http://t.cn/AXwOSsK6
