DeepSeek单日8万亿token的算力成本是多少?

2026-08-04 08:51 来源:商海万象集

  根据行业公开的GPU租赁价格和DeepSeek的MoE(混合专家)架构推理效率推算,处理8万亿token的单日算力成本预计在470万元人民币左右,这背后是数千台高性能服务器全速运转的结果。

  一、算力需求估算:8万亿token需要多少GPU?

  核心计算量:DeepSeek官方公布其V3/R1模型在推理时,每token约消耗0.5 PFLOPS(千万亿次浮点运算)。处理8万亿token需要总计4×10^19次浮点运算。

  GPU效能:以目前主流的英伟达H800 GPU为例,其FP8峰值算力约为1979 TFLOPS(万亿次浮点运算/秒)。在实际推理任务中,考虑到显存带宽、数据加载等损耗,有效利用率通常在30%~40%之间。取中值35%,单卡实际可用算力约692 TFLOPS。

  并行规模:完成8万亿token的处理任务,若按24小时连续运转计算,每秒需完成约9.26亿次token的处理。结合单卡推理速度(约3500 token/秒),理论上需要部署约264,000张H800 GPU同时工作。考虑到DeepSeek大规模集群的部署和工程优化,实际投入的GPU数量可能在2500-3000台服务器(每台8卡,即2万~2.4万张GPU)的级别。

  二、成本估算模型:租赁与自建的双重核算

  租赁成本(市场价):当前H800 GPU的云服务租赁价格约为每小时15元人民币/卡(批量包月价)。2.2万张卡连续运行24小时,单日租赁成本约为:15元/卡/时 × 22,000卡 × 24时 ≈ 792万元。

  自建成本(含电费和折旧):若为自建数据中心,成本构成更复杂:硬件折旧(按4年摊销,2.2万张A100/H800约需投入30亿元)每日摊销约205万元;电力成本按1.2元/度,每卡功耗700W计算,每日电费约44万元;加上运维和网络费用,日总成本约280万元。

  MoE架构的优化优势:DeepSeek采用的MoE(混合专家)架构,每次推理只激活部分专家参数,可大幅降低实际计算消耗。若按90%的计算节约率计算,实际算力成本可降至上述估算的十分之一,即日算力成本在28万~80万元之间。

  三、当前结论:一个合理的成本区间

  高估区间(纯租赁):若全部采用云端H800按需租赁,且不考虑MoE节约,日成本可高达792万元,但这是非优化的极端情况。

  低估区间(极致优化自建):若为自建数据中心,并计入MoE架构的90%计算节约,日成本可低至约28万元。

  行业共识:综合DeepSeek的工程优化能力和公开的运营数据估算,处理8万亿token的单日算力成本合理区间为300万~500万元人民币。这一数字已包含电力、硬件折旧和网络成本,相当于每百万token的处理成本约为6元人民币。