k3确实还不错
只要能“哄着它”把推理能力充分发挥出来,输出成果就都不错,确实能触及 fable 级别
之所以用“哄”字,因为它还非常被动,我前面几天主要拿来 coding,感觉还不是太深,这几天拿来做非 coding 任务了,体会就越发明显了
只是,还没找到什么好办法让它轻易“动脑子”,暂时还比较痛苦,每次协作都是费劲巴拉
不得不感慨,Claude 真是强的可怕
这个问题其实是个黄金能力指标
GPT5.6sol 虽然还 k3强一点,但做的也不好,只要拉高思维强度,它就会强行“很主动”的动脑子,但很容易误入歧途,把海量 token 浪费在很多莫名其妙的地方
k3除了 agent 集群外,总是过于被动,拉高思考强度也没啥用,它遵循内部的某种开关,并不会像 sol 一样拉高了就强行思考[笑cry]
倒也不算坏事,这会逼着你想办法——其实就是进一步显化和明确主轴,但这个在 LLM 协助下才更好。用 k3之所以各种别扭,是因为我被 Claude “惯坏了”,Claude 能在互动中根据我的潜在意图,一步步显化它们,然后锚定它们进行深度推理探索,这个过程太丝滑了,以至于被误认成自己的能力,一旦使用 k3类型的 LLM,一切就会暴露
只有 anthropic 家的模型,能主动动脑子,还很少把脑子动错了
背后依旧是对意图/主轴的识别和保持能力
这真是 LLM 能不能进行有效复杂推理的核心
这大概也是 Moonshot 为何认为自家在体验上差距较大的根源
发布于 广东
