试了试 Grok 4.5,感觉现在马斯克已经进入模型战场第一梯队了。
Grok 4.5 最强的地方,不是简单地超过Cursor Composer2.5,而是把 Composer 那套工程工作流能力,放到了一个大得多的基座模型上,终于像一个真正能干活的Agent模型。
我觉得关键还是 Cursor 那套训练数据太值钱。怪不得马斯克愿意用大价钱去收购Cursor。普通代码数据只能告诉模型代码长什么样,但 Cursor 这种 IDE 里的真实使用数据,能让模型学到工程任务是怎么被完成的。一个功能怎么拆解,一个 bug 怎么定位,哪里该改,哪里不该乱动,用户为什么接受某个 diff,又为什么不接受另一个方案,这些都是静态代码语料里很难学到的东西。
所以 Grok 4.5 这次不像是单纯堆了一个更大的模型,而是大基座 MoE 加上真实工程工作流训练。这个组合很重要。模型不只是会回答“这段代码是该怎么写”,而是更懂怎么顺着一个项目把事情做完。
另一个很强的体感就是快。这个快不是单纯 token 快,而是整个交互节奏快。coding agent 只要慢下来,人的使用方式就会变保守。你会少试几轮,少让它迭代,最后它再聪明也进不了真正的工作流。Grok 4.5 现在给人的感觉更像 IDE 里的执行器,而不是一个站在旁边解释代码的聊天模型。
同时,还有一个优势,就是 token 花得少,同样一个活,Grok 4.5 的 context 明显填得更慢,不像 Opus 4.8那样一上来就把上下文和输出都撑得很满。日常使用里这点非常重要,因为 agent 不是跑一次就完事,而是要反复。token 用得少,成本压力就小很多。更关键的是,这次 Grok 4.5 的价格直接对标 GLM 5.2,基本就是跟国产标杆一个价格了。
这也是我现在用 Opus 4.8 少很多的原因。Opus 4.8当然强,但很多时候太啰嗦。日常开发里,我不是每次都需要完整分析,我需要的是它看懂上下文,然后把活干完。GPT 5.5 那种慢慢拖的体验也有类似问题,不过稳是稳。
马斯克这次的路线其实很明确:大 MoE 基座,低延迟,高吞吐,再加专门面向代码和 agent 的 RL。这条路很像国内大模型这几年走出来的方向,拼成本、速度和真实生产力。
对我来说,它已经可以直接当主力用。
发布于 加拿大
