你把这场 DeepSeek Harness(以下简称 DSH)当成一场艺术的话,其实就很好理解了。
像 DeepSeek-V4-Flash,在 300 多个 B 的前提下就已经达到了那么好的成绩,同时价格便宜,缓存命中率还高,可以说已经立于不败之地。按理说,DeepSeek-V4-Pro 只要继续沿着 Codex、Claude Code 这类成熟 Agent 的路线做大量后训练,基本就能稳稳拿到一个不错的成绩。
但 DeepSeek 团队让我觉得意外的是,他们偏偏选择了最有话题度的打法。
在 DSH 上,它分成了四种模式:极简模式、代码模式、标准模式和创造模式。
其中极简模式真的非常极简,只提供 持久化 Bash 和 str_replace_editor 两个工具,构成一个最基础的 Coding Agent。
但反差的是,在一些环境下,DeepSeek-V4-Pro 反而是在这个极简模式下面表现最好。
这就很有意思了:Agent 的工具真的是越多越好吗?
工具越多,能力当然越强,但同时也意味着更多选择、更复杂的决策,以及更多出错的可能。对于一个本身已经很强的模型来说,Harness 反而可能越简单越好。
而创造模式,则直接走到了另一个极端。
它可以自主创造、修改和卸载插件。只要能完成目标,怎么干都行。
为了钉一个钉子,它可以自己造一把锤子;如果这把锤子下一步不好用了,就修改,甚至直接扔掉,再造一个新的。
我觉得这里最牛逼的其实就是这种热插拔能力。
传统 Agent 是:
人类先把工具造好 → 模型学习怎么使用。
而创造模式更像是:
先给模型目标 → 模型自己决定需要什么工具 → 自己造 → 自己用 → 不合适就扔。
这就是 DSH 最艺术的地方:它把灵活性放到了非常高的优先级。
但灵活性也意味着混乱和随机,而这恰恰是现在大模型最难控制的东西。所以绝大多数 Agent 都在自己的code agent上,或者Codex 和 Claude Code 这种足够稳定、足够结构化的方向训练。
DeepSeek 却在反过来试:
到底应该给模型多少自由?
从两个模型在不同模式下表现都不一样,也能看出来,他们自己可能还处在快速迭代和实验阶段。
所以我觉得,DSH 真正有意思的地方,真不是去看 DeepSeek 在上面的跑分,因为跑分只是一时的,或者阶段性的表现。
而是它在问一个更根本的问题:
当模型本身足够强以后,我们是不是应该少规定一点“它应该怎么做”,把更多完成任务的权力交给模型自己?
如果未来 Agent 不只是会使用人类提前准备好的工具,而是能根据任务临时创造工具、修改工具、用完就扔——那它就不再只是一个优秀的工具使用者了。
它开始有一点“自己想办法”的味道了。
发布于 英国
