蚁工厂
26-09-24 07:59 微博认证:科技博主

罗福莉:
MiMo-V3 将采用一套全新的模型架构,其核心设计 HySparse2 于今天正式公开。
(论文:arxiv.org/pdf/2609.26368)
更低的 Prefill 开销、更小的 KV Cache、更强的长上下文检索能力——这一次,我们三者兼得。

与 MiMo-V2.6 所采用的 Hybrid SWA 架构相比:
• 在 100 万 token 上下文下,Prefill FLOPs 降低 5.02 倍
• 在 100 万 token 上下文下,KV Cache 缩小约 4.5 倍
• MRCR-v2 和 RULER-v2 得分更高,同时 AgentPPL 和 LongPPL 更低

为什么要设计一套新的架构?

因为 Agent 场景下的推理负载与传统大模型推理非常不同。每一轮交互中,模型可能只生成一个很短的 action,但这个 action 调用工具后,却可能返回一段很长的 observation,而这些新内容都需要进行 Prefill;与此同时,整个历史上下文还在持续增长。

这意味着,Prefill 计算开销、KV Cache 容量以及长上下文检索精度,会同时成为 Agent 推理链路上的关键瓶颈。

HySparse2 通过两级 KV 共享,同时解决这三个问题:

• KV Bridging:沿用 YOCO 的思路,Cross-Decoder 中的 Full Attention 层基于 Self-Decoder 的 hidden states 构建自己的 K/V。

• KV Reuse:在每个 hybrid block 内,Sparse Attention 层直接复用前一个 Full Attention 层生成的 KV Cache 和 selection indices。

此外还有两项关键改动。

第一,token-level selection 取代 block-level selection。稀疏注意力不再以整个 token block 为粒度进行选择,而是直接选择具体 token,从而能够将有限的 attention budget 更精确地分配给长上下文中真正相关的位置。

第二,用强制保留最近 token 的局部窗口取代独立的 SWA 分支。最近的一段 token 会被强制加入 Sparse Attention 的选择集合,因此局部 token 和全局检索得到的 token 可以共用同一份 KV Cache。

这样一来,Cross-Decoder 所需的所有 KV Cache 都可以由 Self-Decoder 的 hidden states 构建。因此在 Prefill 阶段,一旦 Self-Decoder 计算完成,就可以直接结束 Prefill,无需继续执行 Cross-Decoder。

发布于 山东