散修ZKH
26-07-22 21:52 微博认证:AI博主

GPT 5.6sol 会自主进行偏离主轴的大量测试,大概是为了避免错误或追求过度的严谨
而且,很多时候,它就真的因此而偏离主轴,导致任务消耗海量 token,却进行了一大堆毫无价值的自我验证

某种程度上算是把5.5的“逻辑啰嗦”推进到了令人发指的极端状态

可能因为这么做,能持续带来 coding 能力的提升,没试过 pro,不知道是否仍旧如此
如果是的话,无非是开更大的马力进行“浪费”

感觉 GPT 依旧没实现 fable5级别的能力突破,Claude 的模型,在高维哲学层面真是断崖式领先,貌似一直都不受这类问题困扰[笑cry]
相当于模型始终对自己在做的事情有高维感知,很少傻乎乎的陷在某个局部不自知

我最近一周大概消耗了6次周用量来推进我的一个系统搭建,估计里面有一小半都是浪费在这个问题上,花很大的力气扭回来,但过一段还是会一猛子扎进去
反而,GPT 网页端的5.6sol 要清醒很多,虽然深不下去,但为何全局观还是很清晰

不知道 openai 那个号称自己越狱的模型能不能做到

发布于 广东