向小田
24-12-26 21:28 微博认证:2024微博年度新知博主 科技博主

一家中国量化对冲基金支持的大模型公司能干出这个成绩,令人佩服。今天Deepseek发布了V3首个版本。有几个信息:

1、V3大模型性能对齐海外领先的闭源模型
V3为自研MoE模型,671B参数,在14.8Ttoken上进行了训练;

成绩超越Qwen2.5-72B, Llama-3.1-405B,性能跟GPT-4o和Claude-3.5-Sonnet相当;

2、生成速度从20TPS提高至60TPS,更流畅;

3、API价格每百万输出tokens 8元。优惠期2元。

4、采用FP8训练,并开源了原生FP8权重。

已经可以登录官网试用了。

发布于 上海