张抗抗KK
26-08-30 09:17 微博认证:2023微博年度新知博主 长文原创作者 汽车博主 汽车答主

腾讯的大模型,这次行了吗?

至少在写网页这件事上,终于行了。如果腾讯也行了,似乎只差百度了。

按Arena 8月28日公布的结果,腾讯混元Hy4 preview在Code Arena: WebDev拿到1633分,约排总榜第5、开源模型第3。

Hy3当时还是总榜第31、开源第7,一代涨了115分。

这个测试有一定含金量。Arena算目前公众认知度比较高的第三方AI擂台:同一个需求交给两个模型做可交互网页,再比较哪个做得更好。

不过,这次还是早期AutoEval。真人票数还不够,Arena先让一个在人类偏好数据上训练的奖励模型代投。它测的又只是WebDev,可以证明腾讯写网页的能力进步很大,不能顺手宣布混元所有能力都到了世界第五。

这个月初,我写WorkBuddy为什么成功,说得可能有点刻薄:正因为腾讯自家的大模型不够强,它才不敢只绑定“亲儿子”,反而被逼成了兼容各家模型的通用Agent,广受大家欢迎。

后来腾讯投诉我侵权,公众号还被警告了。我当时又补了一句:在腾讯平台不能说腾讯大模型不行。因为它是真的不行,万一让老马知道,那就不得了了。[允悲]

那时候Hy3排第31,现在Hy4约第5。也算卧薪尝胆了。

那行吧。你不行的时候,我会说你不行;你行的时候,我真的会说行。等Hy4真正能在WorkBuddy里用上的时候,我会试一试。#腾讯大模型##workbuddy#

发布于 上海