AI最新评分,总结一下:
Gemini 3.1 Pro 统治知识广度与事实准确性,同时在网页浏览和大规模工具调用上保持领先;
GPT-5.4 以碾压级优势垄断数学竞赛(AIME、HMMT、IMO),并在专业工作流和多步工具对话中表现最强;
Opus 4.7 在"人类终极考试"这类超复杂跨学科推理上独占鳌头。
GPT-5.5 则偏向 Agentic 执行,在真实电脑操作、多步工具协作和客服工作流中领先。
K2.6 Thinking 在工具加持的复杂推理(HLE with tools 54.0)和数学竞赛上已跻身第一梯队,但在 BrowseComp、MCP-Atlas 等浏览与工具调用测试中仍与顶尖水平存在差距;
MiMo-V2.5-Pro 在多步工具对话和代理协作中表现亮眼。
~~~~~~~~~
如果你看重综合知识与推理,目前看 Gemini 3.1 Pro 是天花板。
如果你看重数学解题能力,GPT-5.4 依然是王者。
如果你看重实际操作和工具使用,GPT-5.5 和 Opus 4.7 表现最佳。
国产模型如 DeepSeek 和 K2.6 正在奋力追赶,差距正在逐渐缩小。
发布于 安徽
