一家中国量化对冲基金支持的大模型公司能干出这个成绩,令人佩服。今天Deepseek发布了V3首个版本。有几个信息:
1、V3大模型性能对齐海外领先的闭源模型
V3为自研MoE模型,671B参数,在14.8Ttoken上进行了训练;
成绩超越Qwen2.5-72B, Llama-3.1-405B,性能跟GPT-4o和Claude-3.5-Sonnet相当;
2、生成速度从20TPS提高至60TPS,更流畅;
3、API价格每百万输出tokens 8元。优惠期2元。
4、采用FP8训练,并开源了原生FP8权重。
已经可以登录官网试用了。
发布于 上海
