绿算技术亮相亚洲创投之夜,揭秘如何让GPU利用率飙至94%?
由elawtime、One Step与新进创投联合发起的高端创投盛会「AI NATIVE NIGHT · 亚洲创投之夜」在上海前滩圆满落幕。在这场汇聚了顶尖投资人、AI独角兽创始人及行业领袖的私密聚会上,绿算技术市场营销管理中心总经理黄飞发表了题为《原生适配NVIDIA G3/3.5:新一代AI推理“CMX——上下文内存”基础设施》的重磅演讲,以前沿视角剖析了AI大模型商业化落地的核心痛点,并展示了绿算技术作为“国内唯一完整适配英伟达G3/3.5存储(CMX)”厂商的硬核实力,成为全场焦点。
直面千亿级瓶颈:破解AI推理的“显存墙”困局
演讲伊始,黄飞直击当下AI推理领域的核心痛点:“随着大模型向长上下文(如百万Token)演进,KV Cache(键值缓存)呈几何级数增长,而昂贵的GPU显存(HBM)却受限于物理容量与成本,线性增长乏力。这导致了严重的‘显存墙’现象,使得GPU算力闲置,高价值的超长文本、高并发应用场景难以落地。”
他指出,英伟达定义G3/3.5 CMX(Context Memory Extension)存储新层级,正是为了解决这一难题。据花旗报告预测,该方案将拉动全球NAND需求,到2027年占比将高达9.3%。这不仅是一次技术优化,更是一场关于AI基础设施的范式革命。
硬核技术拆解:全栈自研构建“永久记忆”
作为国内唯一适配NVIDIA G3/3.5 CMX标准的解决方案厂商,绿算技术展示了其构建AI大模型“永久记忆”基础设施的完整路径。黄飞总详细介绍了绿算的“全自研硬件卸载架构”:
1. 智能调度层(软件定义"大脑")
功能:全局KV Cache资源池化管理、预测性数据调度。
生态适配:已适配NVIDIA Dynamo、华为UCM、腾讯FlexKV。
核心价值:主动调度,而非被动缓存,实现数据在GPU显存与G3存储间的无缝、智能流动。
2. 硬件加速层(自研"数据神经")
核心技术:GP7000采用DPU+ASIC+FPGA异构架构,将RDMA与NVMe-oF协议栈全链路固化于芯片中,实现全硬件协议栈卸载。
核心价值:彻底消除CPU瓶颈,实现端到端<20微秒的极致延迟。
3. 高速存储层(优化"存储肌肉")
功能:针对KV Cache访问模型深度优化的闪存管理与集群架构。
核心价值:提供稳定且极高的IOPS与带宽,满足GPU的数据"吞吐"需求。
算力倍增实证:GPU利用率逼近95%
生态全景:三大技术路线的统一底座
针对当前主流的AI推理架构,黄飞总展示了绿算技术的广泛兼容性:
NVIDIA Dynamo生态:GP7000作为国内首款量产G3.5 CMX平台,构建"调度→决策→传输→硬件执行"四层闭环。GP7000作为L1硬件层载体,原生支持DOCA/BF3/Spectrum-X/GDS全栈生态。
Mooncake(月之暗面):GP7000作为第四级持久化存储(G3.5层),将缓存容量扩展到PB级。在Mooncake中扮演三大核心角色:缓存溢出池(LRU淘汰写入)、长上下文持久化(百万Token分块存入)、跨集群共享池(零成本迁移)。
LMCache(开源社区):一行代码配置,对vLLM模型零侵入。基于GP Spark+LMCache+SupremeRAID
实测数据:首Token延迟从187s降至8s(24倍提升),查询吞吐量提升11倍,KV Cache外部命中率达66.2%。。
展望未来:持续领跑AI存储赛道
谈及未来,黄飞透露绿算技术正在加速研发适配NVIDIA BlueField-4 DPU的GP-8000旗舰平台,以及自研的“擎翼”存储ASIC芯片,旨在进一步降低成本,提升性能,持续巩固在AI推理上下文内存领域的领导地位。
本次亚洲创投之夜,绿算技术不仅向资本市场展示了其深厚的技术底蕴和商业潜力,更传递出中国企业在AI基础设施底层创新上的自信。凭借“国内首家”的独特卡位和全栈自研的技术壁垒,绿算技术正成为解锁千亿级AI推理市场的核心力量。
未来,绿算技术将继续携手合作伙伴,为全球AI产业的蓬勃发展注入强劲动力。
#绿算技术# #GPU# #科技#
