皇家山的维特根斯坦
26-07-19 04:52

今天是周末,来聊一聊我对 2026 年中期大模型和 Agent 系统发展方向的一些想法。

最近 Kimi K3 非常火,它把总参数量推到了 2.8 万亿,在前端开发等细分领域表现非常突出,超过了Fable5,做到了全球第一。无论从模型规模还是实际能力看,这都是中国大模型一次相当有分量的突破。

马斯克今天很快作出了回应。他透露,xAI 的下一款 2 万亿参数模型将在下周完成初始训练,也就是 Grok 4.6。按照他的说法,这款模型全面超过 1.5 万亿参数的 Grok 4.5,并且可能超过 Kimi3,同时保持接近 Grok 4.5 的速度和 token 效率。

这说明基础模型层面的竞争仍然激烈。参数规模还在扩大,训练能力继续提高,下一代模型的能力肯定还会再上一个台阶。

不过,唐杰前段时间谈 GLM 时说过一句很重要的话:GLM 更接近一个纯模型,直接拿它和 GPT-5.6、Claude Fable 5 这类完整产品比较并不公平。

这句话我觉着说到了关键。

到了 2026 年中期,很多前沿产品已经很难按照一个单独模型来理解。Claude Fable 5、GPT-5.6 以及 Grok 4.5 在实际使用中体现出来的,都是模型与 Harness 结合后的整体能力。

所以我对目前做一个最简单的概括:

模型决定产品的上限,Harness 决定产品的下限。

更准确的说,模型决定一个系统理论上最多能做到什么。Harness 决定它在日常工作中,能够稳定发挥出多少能力。

过去两年,大家讨论大模型,焦点主要集中在参数量和 benchmark 上。但到了 Agent 阶段,模型分数已经不足以解释产品之间的真实差距。同一个模型放进不同的 Harness,最后表现可能完全不同。

Cursor 做过一个很有代表性的实验。同一款 Claude 模型,换用不同的 Harness,分数可以从 46%提高到80%。模型没有变化,变化的是它怎样获取信息、调用工具,以及根据执行结果继续行动。

Harness 的重要性,最容易从工具调用上看出来。

很多人觉得工具调用很简单。这里举个例子,比如模型需要搜索,很多人觉着就是调用一次搜索接口,然后把结果返回给模型,就完了。但真正做过 Agent 系统的人都知道,这只是表面。

模型首先要判断什么时候搜索。然后还要决定搜索多少内容,第一次结果不够时应该怎样调整查询。结果回来以后,系统还要完成排序和提取,再把合适的信息放回上下文。

任何一个环节处理不好,模型的能力都会被浪费。

一次搜索应该发几个查询?搜索结果应该打开多少个?不同来源出现冲突时,系统又应该怎样处理?这些都没有一个可以适用于所有任务的固定答案。

所以工具调用真正困难的地方,从来不是把一个 API 接上去。难点在于让模型在正确的时机调用工具,并且能够正确使用返回结果。

这也是各家私有 Harness 系统最近持续投入的重点。大家都有搜索工具,但搜索工具怎样被调用,最后效果可能相差非常大。

同样的情况还存在于代码执行和文件读取。接口并不复杂,真正困难的是围绕任务建立稳定的决策和反馈循环。

这也是通用 Agent Framework 经常表现一般的原因。通用平台需要兼容大量模型,只能设计一套相对平均化的 Harness。但不同模型对工具格式和上下文组织的适应方式并不相同。兼容范围越广,针对单一模型进行深度优化就越困难。

所以 ChatGPT、Claude Fable 5 和 Cursor 的能力,已经不能只用基础模型分数解释。它们背后的 Harness 本身就是产品竞争力。

这里我再说一句,普通人没精力的话,就别去折腾什么龙虾,Hermes之类的通用Agent平台。你大概率没有人家官方调的好。如果你有什么特殊需求的话,那另说。

不过,这个过程还有另一面:模型正在反过来吸收 Harness。

过去一段时间,大语言模型的后训练已经逐渐形成了一套相对稳定的路线。预训练完成以后,再通过大规模强化学习提高逻辑推理能力。训练重点逐渐从大量普通对齐数据,转向高质量任务环境和可验证结果。

数学可以核对答案,代码可以执行测试,Agent 任务则可以检查最终结果。模型通过成功和失败的轨迹继续学习。Kimi、GLM以及国外前沿模型,基本都在沿着这个方向发展。

现在这套路线正在进入下一阶段。

进入强化学习环境的内容,将从数学和代码进一步扩展到完整的 Harness 操作。模型会在真实任务中调用工具,读取执行结果,然后根据反馈调整计划。

经过足够多的训练以后,一部分原来主要由 Harness 控制的策略,会逐渐成为模型自身的能力。模型会更准确地判断何时搜索,怎样使用工具,以及失败后如何恢复。

Grok 4.5 和 Cursor 的结合,就是这个趋势最清楚的案例之一。Grok 4.5 的表现不只来自模型权重本身,还来自它在 Cursor 的真实工作环境中接受训练。它学习的不只是代码生成,还包括如何在代码库和工具系统中完成任务。

所以模型与 Harness 正在双向靠近。

Harness 根据模型的特点继续优化,让模型的能力得到更稳定的释放。模型则利用 Harness 产生的任务轨迹接受训练,把其中成熟的决策方式逐步内化。

当然,模型内化 Harness 能力以后,外部 Harness 依然不会消失。模型可以学会如何搜索,但搜索索引和执行环境仍然存在于模型之外。模型吸收的是使用环境的策略,Harness 提供的是真实环境本身。

总结一下,2026年中期,模型竞争仍在继续,基础模型的规模还会扩大;真正的产品差距正在更多地转向 Harness;下一阶段则会出现模型与 Harness 更深的联合训练。

Kimi K3 和 GLM 代表基础模型能力上限的继续提升。ChatGPT、Claude Fable 5 和 Cursor 展示了 Harness 能够把多少模型能力转化成稳定的产品表现。

但是,现在评价一个 Agent 系统,只问它用了什么模型已经不够了。还要看它运行在什么 Harness 中,以及这个模型是否在类似环境里真正训练过。

模型决定产品的上限,Harness 决定产品的下限。

发布于 加拿大