karminski-牙医
25-12-30 08:12 微博认证:AI博主

腾讯发布了首个 Diffusion 大语言模型!

腾讯微信AI联合北京大学与清华大学推出了新模型——WeDLM-8B,这个时间点8B模型能做什么? 答案是, 这个模型有着超越Qwen3-8B的性能同时又带来了3-10x的生成速度提升, 没错! 这是个 diffusion 大语言模型!

这个模型基于 WeDLM 框架, 通过拓扑重排和动态滑动窗口,解决了传统扩散模型的停等瓶颈,实现真正的流式并行解码,消除流水线气泡。
另外除了生成速度, 模型还原生支持 KV Cache,支持 FlashAttention 和 PagedAttention.

具体得分的话, WeDLM-8B-instruction MMLU 是75.14分, GPQA-Diamond 是44.95, MBPP 是70.53 。分数基本是8B模型中相当高的水平了, 不过需要注意, 前两个分数都是 5 shot, 后面一个是 3-shot. 所以模型还不是特别稳定能达到这么高的分数的.

从我来看, 这个模型最大的意义是, 在8B 这个规模达到了Qwen3-8B 的性能的同时, 还能有3-10x的生成速度, 非常适合本地使用.

#ai生活指南##ai创造营#

发布于 日本