爱范儿
26-04-24 11:04 微博认证:爱范儿官方微博

突发|#DeepSeekV4上线#

今天,DeepSeek 正式发布采用混合专家(MoE)架构的 DeepSeek-V4 系列开源大语言模型,重点实现了百万级 Token 上下文长度的支持与底层推理效率的大幅优化。#DeepSeek新模型##DeepSeekV4来了#

从 HuggingFace 显示,DeepSeek-V4 系列包含总参数量达 1.6 万亿(激活参数 490 亿)的 V4-Pro,以及总参数量 2840 亿(激活参数 130 亿)的 V4-Flash 两款模型,二者均支持 100 万 Token 的上下文长度。

在底层架构上,V4 引入了结合压缩稀疏注意力(CSA)与重度压缩注意力(HCA)的混合注意力机制,并实装流形约束超连接(mHC)与 Muon 优化器。

官方数据显示,在百万 Token 上下文场景下,V4-Pro 的单 Token 推理浮点运算量(FLOPs)仅为前代 V3.2 的 27%,KV 缓存占用大幅降至 10%。

训练管线方面,两款模型均基于逾 32 万亿 Token 进行预训练,并提供 Non-think、Think High 与 Think Max 三档推理模式以适配不同算力预算。

基准测试表明,V4-Pro 在开启最高推理性能的 Max 模式后,在 MMLU-Pro(87.5%)、Codeforces(3206 分)及 HMMT 等复杂逻辑与编程评估中表现突出,官方称其已确立当前开源模型最高水平。