indigo
26-09-23 12:27 微博认证:Hallidai 联合创始人 Brilliant Phoenix 合伙人 科技博主

下午体验了一下 Opus 5.5,那个曾经超牛逼的 Opus 又回来了,从文字表达,到逻辑深度和速度都非常不错!分享一下 Anthropic 官方的 Opus 5.5 Playbook,跟现有的 Claude 用法兼容,主要有三点不同:

- 能独立工作更长时间;
- 会用直白的话汇报自己做了什么;
- 每次回复前都会先思考,思考多少由它自己决定!

一、怎么提问

- 写清楚什么算"完成",然后让它自己跑。 一条消息给出完整任务和终点,比如"所有测试通过"或"所有接口都迁移完",再说明什么情况下停下来问你。Opus 5.5 最大的进步在多步骤长任务上;

- 删掉"仔细想想""一步步思考"这类话。 它本来就会先思考,删掉后回复来得更快,质量也没有明显下降。想要简短回答,就直接说"直接回答"。在 Claude Code 里要调思考深度,改 effort 设置;

- 任务运行中可以直接补充要求。 现在任务跑得更久,重来一次代价更大,想到什么直接输入就行;

- 做设计时,具体列出不想要的风格。 "不要太普通"这种笼统要求没用,要点名具体样式,比如米白背景、标题里的斜体强调词、"01 / 02 / 03"编号、胶囊形按钮;

二、在 Claude Code 里引导长任务

- 在 CLAUDE.md 里写明什么时候停、什么时候继续。 不需要你介入的步骤就继续做;只有卡住,或者要做删数据、强制推送这类破坏性操作时,才停下来问。破坏性命令的权限提示要保持开启;

- 大任务分给子代理(subagent)并行做,比如审计、迁移、代码库级别的审查。每个子代理交回结果后,让它先核实证据再采纳,最后汇总成一张表;

- 任务清单放在文件里(例如 TASKS.md),边做边打勾。上下文被压缩后清单还在,你看文件就知道进度;

三、检查结果

- 先看它需要你做什么,比如还没定的决策、等你批准的改动,然后再看其他总结;

- 在人工审查前,先让它审一遍代码。 有早期测试者说,Opus 5.5 在最低 effort 下找到的 bug 比 Opus 5 在高 effort 下还多,误报也更少;

- 做研究分析时,让它标出没能确认的内容,并说明查过哪些地方;

用 Opus 5.5,要把它当成能自主执行的同事,而不是一问一答的工具。你的重点从一步步指挥,转向定目标、设停止规则、最后审核。未来更长时间的自主任务会越来越常见,这套“交代目标 → 放手执行 → 先看待办再验收”的流程值得尽早用熟 ✨

发布于 加拿大