#川哥杂谈[超话]##微博视频号续航计划# 千问 3.8 Max Preview 到底是什么水平?实测结果来了!
通过 AICodeKing 的 KingBench 测试,这款模型在8道综合任务中拿下65/80分,表现相当亮眼。
从前端交互、数学推理,到长程 Agent 任务,千问3.8 Max展现出了很强的执行能力,其中弓箭游戏和部分 Agent 任务甚至拿到满分。
当然,它也并非完美。在三维手表设计等视觉任务上仍有提升空间,面对超长复杂任务时,也出现过文件未创建、执行中断等情况。
但整体来看,千问3.8 Max已经证明国产大模型正在快速追赶第一梯队。
AI竞争的核心,不只是参数大小,而是真正解决问题的能力。未来,模型之间的较量才刚刚开始。(实测者:@servasyy_ai)#微博视频号续航计划# http://t.cn/AX92T9aE
发布于 广东
