川北小哥
26-07-20 17:24 微博认证:科技博主

#川哥杂谈[超话]##微博视频号续航计划# 千问 3.8 Max Preview 到底是什么水平?实测结果来了!

通过 AICodeKing 的 KingBench 测试,这款模型在8道综合任务中拿下65/80分,表现相当亮眼。

从前端交互、数学推理,到长程 Agent 任务,千问3.8 Max展现出了很强的执行能力,其中弓箭游戏和部分 Agent 任务甚至拿到满分。

当然,它也并非完美。在三维手表设计等视觉任务上仍有提升空间,面对超长复杂任务时,也出现过文件未创建、执行中断等情况。

但整体来看,千问3.8 Max已经证明国产大模型正在快速追赶第一梯队。

AI竞争的核心,不只是参数大小,而是真正解决问题的能力。未来,模型之间的较量才刚刚开始。(实测者:@servasyy_ai)#微博视频号续航计划# http://t.cn/AX92T9aE

发布于 广东