【#DeepSeek联合北京大学发布论文#,如何让大模型跑得更快】
据快科技报道,当行业在讨论谁的模型更聪明时,DeepSeek仍然把目光投向更现实的问题:如何让大模型跑得更快。昨日,DeepSeek官方在Github低调发表了一篇最新论文,介绍其推理加速框架DSpark,试图解决大语言模型在高并发场景下的推理效率瓶颈。
从作者署名来看,这篇论文由DeepSeek与北京大学联合发布,值得注意的是,DeepSeek创始人梁文锋也位列作者名单。在论文中,团队开源了DSpark模型权重,并同步发布了面向推测解码、由算法驱动的训练代码仓库DeepSpec。
DeepSeek首先解释了需要解决的问题。大语言模型采用自回归方式生成文本:每一个新词元的生成,都需要基于全部前置词元完成一次完整前向传播,结果是输出越长,等待越久。
目前,DeepSeek已经将DSpark部署到DeepSeek-V4在线服务系统中,并基于真实用户流量评估其实际性能。结果显示,相较于现有生产环境基线系统MTP-1,在相同吞吐量条件下,DSpark将用户端生成速度提升了60%-85%。
