DSpark 的洞察:不是所有请求的 token 价值相等。有些 token 大概率会被接受(高置信度),有些大概率被拒绝
与其把 batch 槽位浪费在大概率被拒绝的 token 上,不如把它分配给其他请求的高概率 token
这就是调度器算法(Algorithm 1)在做的——全局排序所有候选 token 的生存概率,只取期望回报最大的组合
代价:你必须相信置信度头预测的 \(c_k\) 是准的。如果置信度头自我高估(overconfident),调度器会错误地保留过多低质量 token
如果低估(underconfident),则过分谨慎。论文用 post-hoc calibration(基于贝叶斯分箱的校准方法)加强了可靠性 `[L2: 实验验证]
…这哪里是论文,这就是在对哲学/人类思考范式编程啊[笑cry]
发布于 广东
