http(s)://www.nist.gov/news-events/news/2026/05/caisi-evaluation-deepseek-v4-pro
美国叙事测评,DeepSeek牛逼,美国都开始做这种“叙事”测评了...
主要差距是在:安全、Agentic 软件工程、抽象推理隐藏集上,而在数学、科学问答、常规软件修复上,差距没有那么大
最大优势还是在于成本,也就意味着之前常说的“性价比”直播又大大提升了,这个才是大模型大规模落地的核心指标~
发布于 湖南
