阿柯学长_
26-01-13 18:19 微博认证:数码博主 微博原创视频博主

DeepSeek又整新活了!简而言之就是增加了Engram条件记忆机制,给MoE模型提速:把固定知识存成表省算力,训练量减18%还反超同参数模型,推理吞吐几乎没降。论文一作是北大在读博士,还在DeepSeek干活,新人这是挑大梁了啊[doge]
#DeepSeek又开源了# ​

发布于 上海