前沿在线
26-10-08 21:39 微博认证:前沿在线微博官方账号

Claude Haiku 5.5发布:最小的模型开始能接Agent的活

10月7日,Anthropic发布Claude 5.5家族里最小的模型Haiku 5.5,官方称这是它做过最快、最强的小模型,标准速度下也是当前响应最快的Claude。

值得看的是能力那一段。官方基准里,考“在真实操作系统里干活”的OSWorld 2.1,Haiku 4.5只有15.7%,5.5跳到72.4%;终端任务Terminal-Bench 4.0从零分到39.2%;知识工作评测GDPval-AA v2.1从735分提到1620分。

第三方机构Artificial Analysis给的综合智能指数是43,比上一代高26分。但官方自己划了边界:Terminal-Bench那个数字是在最高effort档测的,默认中档只有约20%——档位选错,拿到的是另一个模型。

这也是Haiku系列第一次带可调effort,开发者能按任务难度切换档位。

代价在另一头:Artificial Analysis测出,跑到最高effort时它每个任务消耗的输出Token约为同类对手的三倍。

而且思考默认开着、关不掉,读响应时如果代码默认第一个block就是答案,会拿到空内容。

迁移比想象中麻烦。自定义temperature、top_p、top_k这些采样参数被取消,传了直接报400错误,assistant prefill同样报错;思考Token还会占max_tokens额度,上限给小了,正文可能还没开始就结束。

Anthropic把这几项写进迁移指南,属于升级前必须逐条检查的类型。

官方给它的定位很明确:压缩、摘要、分类、数据库查询、客服,以及给大模型打配合的子代理;复杂的编码类Agent任务,仍建议交给Sonnet 5.5和Opus 5.5。

SDK这次新增computer use和browser use的测试版支持,指向的就是让这档小模型去点鼠标、填表单。

早期客户的数字先摆着:Asana说任务完成延迟降了三成以上,Box称相比Haiku 4.5提升11分、延迟大约减半,Cognition把它当副手、配Opus做主脑跑Devin的编码评测,FrontierCode拿到66.2分。

安全侧同步收紧了。官方称对齐评估比Haiku 4.5明显改善,配合滥用的意愿也更低;网络安全防护比Haiku 4.5更严、但比Sonnet 5.5宽松,仍会拦截渗透测试类请求,生物领域防护与Sonnet 5、Opus 5一致。

小模型这一档真正的分水岭,不是能不能做对一件事,而是能不能放心塞进成千上万次调用的流水线里。Haiku 5.5把这道门推开了一条缝。

发布于 北京