爱可可-爱生活
26-09-03 05:21 微博认证:AI博主 2025微博新锐新知博主

[CL]《Knowledge Distillation During Mid-Training Favors Reasoning over Factual Recall》J He, H Yen, S S Li, M Li… [Meta AI & Princeton University] (2026)

在大模型知识蒸馏领域,如何在“中期训练”阶段平衡推理增益与事实学习是一个悬而未决的难题。过去的方法受困于推理强、事实弱的“能力偏科”,本质原因是教师模型在不同数据域的置信度不对称,导致对未学事实的指导信号过弱。

本文的核心洞见是:把统一的蒸馏过程看作一个需要动态选择的策略。由此,利用教师预测熵作为“开关”,在其自信处执行蒸馏,不自信处则退回至标准学习,这一轻量级的路由操作使能力失衡问题得以解开。

这项工作真正留下的遗产是一种自适应蒸馏范式:学习应取决于教师的“确定性”。它为后来者打开的新门是,可基于模型内部状态设计更精细的动态训练策略。但尚未跨过的门槛是,如何从根源提升教师的指导质量,而非仅用路由策略绕开其短板。

arxiv.org/abs/2609.01532 #机器学习# #人工智能# #论文# #AI创造营#

发布于 北京