人工智能与龙共弈
26-07-01 20:19

Claude Sonnet 5 发布了,据说是主打智能体能力的高性价比模型,在保持接近 Opus 4.8 表现的同时大幅降低了成本。

多数开发者认可 Sonnet 5 在编程和自主任务上以中端价格逼近旗舰水平。

也有网友表示,Sonnet 5 用于相同任务中 Token 消耗更多,总体费用可能超过 Opus 4.8 和 Fable 。。。

情感温度上 Sonnet 5 说比 Sonnet 4.6 更冷、更爱越权。

Sonnet 5 宁愿多花几分钟也不愿交出日后会崩的代码,会一遍遍自我清理、把测试当成习惯,因此非常适合长链条、开放式的 Agent 循环任务。

Sonnet 5 在法律、保险、金融等垂直场景表现比较好。

有资深用户表示自己主要做人机协作式开发而非全自动开发,他的观察是模型越是为全自动 Agent 优化,在辅助式开发里就越差,常常无视严格具体的指令而做得太多。

在代码评审时不会主动质疑,例如数据库事务隔离级别用了默认值却不追问,缺少挑战式反馈。

过度拒绝与说教,对事实性问题过度含糊,对疑似提示注入过度敏感,以及在私人对话中语气比 Sonnet 4.6 更冷、更克制。

Sonnet 5 在真实交互中的正向情感下降、中性情感上升,在 Claude Code 中尤为明显。

有用户称它是巨大的进步,需要更少的直接指导、盯得更松,且沟通更清晰、少了 Opus 4.8 那种夸张文风。

实际效果里 Harness 比模型本身更重要,这说明 Sonnet 5 更偏向奖励结构化、自动化、放手让它跑的用法,对习惯逐步把控、轻量辅助的用户不够友好。

神龙摆尾

如果你做的是真实软件交付、多步骤 Agent 任务或知识型工作,并愿意放手让它自主完成,Sonnet 5 大概率是当下极具吸引力的性价比选择,值得从旧模型迁移。

如果你偏好紧密的人机协作、看重模型温度和主动质疑,或你的现有 4.6 工作流已经调教顺手,那么升级带来的变冷,爱越权,过度谨慎等副作用可能让体验打折。

Sonnet 5 是 Agent 能力大步向前、协作手感有所让渡的升级,值不值得切换,取决于你实际的工作。

发布于 广东