蚁工厂
26-09-10 19:18 微博认证:科技博主

HuggingFace的大佬Thomas Wolf,出了个视频介绍DeepSeekV4.1的向前推理过程。

“全新的 DeepSeek V4.1 Flash 模型令人惊叹——它重新登顶开源模型排行榜,而且成本极低。

它拥有诸多极为精妙的高效且高性能的实现方式,因此我制作了一段关于前向传播的视频,让大家得以一窥模型在推理过程中的内部运作情况。”

里面的内容都是V4.1技术报告里介绍的。主要介绍 DeepSeek V4.1 Flash 的一次完整前向推理过程,以及它在推理阶段如何减少计算开销。输入的文本或图像首先会被转换成向量,随后进入由 Encoder 和 Decoder 组成的模型结构。模型内部通过多条残差流传递信息,并利用 Engram 一类记忆机制直接检索已经学到的模式,避免重复计算。

在 Attention 阶段,模型不会无差别读取全部历史信息,而是重点关注附近 Token 和筛选出的远距离 Token。部分层负责构建全局记忆,其余层保留局部记忆,并通过共享缓存减少存储和访存成本。与此同时,MoE 路由器每次只选择少量专家参与计算,而不是激活全部专家,从而进一步降低单个 Token 的推理成本。

Encoder 处理完成后生成的全局记忆还可以直接被 Decoder 复用。到了实际服务阶段,Prefill 会先处理完整 Prompt 并建立所需记忆,而 Decoder 只需要处理靠后的部分 Token,不必重新计算全部上下文。这种 Encoder、Decoder 之间的记忆共享,是视频重点展示的另一项推理优化。

完成这些计算后,最终的隐藏状态会被映射成词表上的 logits,并从中采样出下一个 Token,然后继续下一轮生成。视频最后还介绍了一种推测式生成思路:先一次性提出多个候选 Token,再由主模型统一验证多个位置,从而减少主模型完整前向计算的次数。 http://t.cn/AX0gW9Z2

发布于 山东