#小米大模型每小时烧钱超20万#一、实时烧钱实况
双版本并行:MiMo-V2.6同步推进Pro与Flash两个版本的强化学习训练。
每小时成本:两版本合计每小时花费约3.1万美元(折合人民币超20万元)。
累计投入:截至9月17日下午,两版本累计训练成本已突破135万美元。
二、算力消耗规模
海量Token吞吐:单步训练约消耗20亿Token,采用1568个提示词×16次推演的异步架构。
长上下文推理:平均上下文长度达8.9万Token,单卡吞吐降至100-150 TPS,推高算力成本。
集群规模估算:据推算,该训练规模约需6000至8000张H100级别GPU。
三、核心训练方向
智能体强化学习:团队维持超6万个真实Linux/Docker沙箱并发执行代码与终端命令。
多维度扩展:在计算资源、多任务Agent环境及评估计算三个方向进行规模扩展,细节将逐步开源。 http://t.cn/AXOoOpZS
发布于 陕西
