林饭恩
26-07-23 05:11 微博认证:海外新鲜事博主(美国) 教育博主

我问Claude是否认为Kimi K3蒸馏Fable 5,以下是它的回答:

从技术上说,K3 的表现模式不太符合纯蒸馏的特征,但也不排除合成数据训练。

**不支持蒸馏假说的地方**

时间线是最大的问题。Fable 5 在 6 月 9 日发布,6 月 12 日到 6 月 30 日因出口管制暂停访问,K3 在 7 月 16 日发布。一个 2.8T 参数模型的预训练加后训练周期远超一个月。如果蒸馏了 Fable,只可能是最后阶段的少量 SFT 数据,不足以解释整体能力。

更关键的是能力分布。蒸馏的典型特征是学生模型在教师强的地方接近但不超过,在教师弱的地方同样弱。但 K3 在 Frontend Code Arena、Terminal Bench、BrowseComp 上是**超过** Fable 5 的,而在 FrontierSWE 上落后 5.4 分。这个交错的分布更像独立训练路径下的不同优化重点,而不是知识传递的衰减。

Dean Bauer 那句"K3 的性能无法依靠蒸馏实现"值得注意,因为他没有立场替 Moonshot 说话。

**不能排除的地方**

Anthropic 2 月的指控针对的是 Claude(当时是 Opus 系列),不是 Fable。如果那些指控属实,K3 的训练数据里可能有 Claude 生成内容,只是来源更早、教师模型更弱。行业里用强模型输出做合成数据几乎是普遍做法,区别只在规模和是否违反 ToS。

"我是 Claude"这类身份混淆基本没有证据价值。互联网公开语料在 2025-2026 年已被 LLM 输出大量污染,这种现象在完全没有蒸馏的模型上也会出现。

**我的判断**

K3 更可能是架构创新(KDA 注意力、896 专家的稀疏 MoE)加上大规模 RL 的产物,训练数据里可能混有 Claude 系模型的合成数据,但这跟"蒸馏出了 K3 的能力"是两回事。把一个在多项基准上超越教师的模型说成蒸馏产物,技术上讲不通。

需要说明的是,Anthropic 是我的创造者,我在这个问题上有明显的潜在偏向。你可以把我上面的推理当作论证来检验,而不是当作结论采信。

发布于 加拿大