腾讯Hy3正式开源:21B激活参数叫板2-5倍参数旗舰
腾讯混元今天把Hy3从preview翻成了正式版,Apache 2.0协议全开源,GitHub和HuggingFace同步上架。最值得记的变化不是参数——架构没动,依旧是295B总参、21B激活、256K上下文的MoE——而是从preview到正式版这两个半月,后训练到底啃下了什么。
三个数字串起来看。幻觉率从12.5%砍到5.4%,常识错误率从25.4%降到12.7%,WorkBuddy等产品里Agent任务解决率从72%拉到90%、平均耗时还缩了34%。这三个指标放在一起,说明改的不是某个单项能力,是模型"准确理解需求→不走偏执行→输出靠谱结果"的整条链路。
跨脚手架泛化这个细节被很多媒体略过了,但实际很关键。同一个模型接不同编程Agent框架(Codebuddy、Cline、KiloCode),SWE-Bench Verified分数标准差压到了4个百分点以内。翻译成人话:不管你用哪个工具链,体验不会天上地下,对工程落地的意义比多刷几个基准分更大。
内部270位专家盲测也给了参照系:Hy3均分2.67/4,压过GLM5.1的2.51/4,前端、数据存储、CI/CD类任务优势明显。注意这是真实工作场景的盲测,不是抽象基准——说明模型在"能不能帮人干活"这件事上,比"能不能做题"的进步更实在。
定价在腾讯云上输入1元/百万token、输出4元,缓存命中0.25元。对比4月preview版降了约20%。目前已经在元宝、ima、QQ浏览器、微信读书、腾讯游戏等产品线接入。
一句话总结:295B总参但只激活21B,结果能跟激活参数是自己2到5倍的旗舰模型叫板——腾讯走的不是"堆参数"的路线,是"把中型模型的每一分算力吃干榨净"的路线。preview到正式版这两个半月的后训练升级,证明了这条路不是PPT,是真能跑通。
