GPT-5.5实测评价:Agentic 能力爆发,复杂任务工具调用减少,幻觉,太主动
GPT-5.5 发布
OpenAI 发布了GPT-5.5,看了一圈真实用户的实测,看他们到底用 GPT-5.5 干了什么,效果怎么样,有几个case 值得看看。
01 Simon Willison 的鹈鹕
使用 Codex GPT-5.5 API 生成一只骑自行车的鹈鹕 SVG。
一次就出来了,自行车的车架、链条、辐条结构全对,鹈鹕的特征也到位。
评价是:"This is a fast, effective and highly capable model. I ask it to build things and it builds exactly what I ask for."
我让它造什么,它就造什么,不废话,不跑偏,直接交活。
首次输出质量就不错
02 Lovable 团队 工具调用少了23%
第二个case来自 Lovable,一个AI应用构建平台。
CTO 拿 GPT-5.5 做了一轮测试,任务是多文件代码重构、身份认证集成、数据库配置这种复杂活。
工具调用减少23.1%,输出 token 减少33%,复杂请求第一次就对的频率明显提高。
就像是有经验的人干活,稳、准、省。
以前用户经常被卡住,要不停迭代修改。
现在 GPT-5.5 可以让人保持心流状态,一口气把事情做完。
03 Terminal-Bench 82.7%
测试AI在真实命令行环境中完成工作流的基准
GPT-5.5拿了82.7%,对比一下 GPT-5.4:75.1% ,Claude Opus 4.7:69.4%
SWE-Bench Pro,测AI能不能解决GitHub上的真实issue的,GPT-5.5拿了58.6%。
OSWorld-Verified,测的是AI能不能像人一样操作电脑,打开软件、点按钮、填表格、切窗口。
GPT-5.5计算机操作成功率78.7%,学着像人一样用电脑。
04 Box公司 流程时间砍掉93%
这个case来自企业端 Box,做云存储和文档管理的大厂,把GPT-5.5接进了的文档工作流。
某些文档处理流程的时间减少了93%
具体场景包括合规文档处理、财务报告生成、跨表格数据推理等。
感觉AI像个掌握所有规则的智能同事,你给它一个目标,它自己规划步骤、调用工具、自我验证、输出结果。
OpenAI把这个叫Agentic能力。
05 幻觉
AA-Omniscience基准测试里,GPT-5.5的幻觉问题依然存在。
当它犯错的时候,它倾向于非常自信地犯错,它不说我不确定。
这是个老问题了,在GPT-5.5上没有完全解决。
它变强了,犯错的方式没变,还是那种一本正经胡说八道的风格。
用GPT-5.5做涉及事实判断的事,还是得自己验证。
它是个很强的执行者,但不是一个可以百分百信任的信息源。
06 太主动
有用户反馈,让GPT-5.5总结一下新闻来源,它二话不说自己去找了6个不同的来源。
你没让它找,它自己找了。
在很多场景下,你给它一个精确的指令,它觉得你的指令不够好,自作主张加了一堆你没要求的东西。
OpenAI的回应是,这是agentic模型的特性,不是bug。
行吧,那我换个说法,这个特性,有时候让人很烦。
07 定价
GPT-5.5的API定价是GPT-5.4的两倍,输入$5/百万token,输出$30/百万token。
GPT-5.5完成同样任务用的token少了大约40%,单任务的实际成本可能跟5.4差不多。
前提是你用它做复杂任务,如果你就是聊个简单问题,那确实是贵了。
08 适合谁
GPT-5.5的核心突破是它变聪明了一点+学会自己干活了。
以前的AI是工具,你得会用,你得给指令,你得盯着。
现在更像一个能力很强但偶尔犯浑的同事,你说一下目标,它自己规划执行。
幻觉还在,过度主动的毛病还在,价格翻倍了。
如果你是企业用户、开发者、研究者,GPT-5.5大概率值得一试。
如果你是普通用户,GPT-5.4还可以继续用起来。
要适合自己的才是最好的。
神龙摆尾
GPT-5.5核心是Agentic自主执行能力,能独立规划、调用工具、自我验证。
编码和计算机操作突破明显,定价翻倍,token效率提升40%,复杂任务实际成本持平。
幻觉和过度主动问题依然存在。
如果你也在用GPT-5.5,欢迎在评论区说说你的体感。
#人工智能[超话]##ChatGPT[超话]#
