开眼视点
26-08-21 08:30 微博认证:C114通信人家园3G版主、专栏作者李建昆,出版作品有《如影随形》 科技博主

看到GLM-5.3登顶的消息,我第一反应是:
国产模型终于把Claude和GPT干掉了?
仔细看完榜单,先冷静一下。
这里的“登顶”,主要指GLM-5.3在Terminal-Bench 3.0上取得开源模型最高分。这个榜单测试的是模型能否在终端环境中完成真实的软件工程任务。此外,它在CyberGym漏洞发现测试中也取得领先成绩,但在另外两项安全评测中仍落后于Claude Mythos 5。
所以,它不是所有能力都世界第一。
但这次登顶仍然值得认真看。

发布于 安徽