看到GLM-5.3登顶的消息,我第一反应是:
国产模型终于把Claude和GPT干掉了?
仔细看完榜单,先冷静一下。
这里的“登顶”,主要指GLM-5.3在Terminal-Bench 3.0上取得开源模型最高分。这个榜单测试的是模型能否在终端环境中完成真实的软件工程任务。此外,它在CyberGym漏洞发现测试中也取得领先成绩,但在另外两项安全评测中仍落后于Claude Mythos 5。
所以,它不是所有能力都世界第一。
但这次登顶仍然值得认真看。
发布于 安徽
