今晚才来得及试GLM-5.2,初感的确比较靠谱,尤其是准确性要求比较高的任务,验证、质疑、举一反三方面印象深刻,一直比较稳,意图、理解和执行全程没漂移。
但直觉GLM-5.2有保留,后续如果发大版本的话潜力可能更大一些。照这个节奏,此前预期的国产前沿模型在今年年底前达到Opus-4.7甚至4.8水平,大概其差不多(尽管有些评测指标的得分已经和Opus-4.8差不多),但是能不能到Fable-5不好说(尽管唐杰号称追平Fable-5不用等到2027年)。原因有6点:1.整体追平和某些维度达到是两个概念;2.常规智能和深度智能是两个概念;3.工程化复杂长程任务的后半程表现和前半程是两个概念;4.时快时稳时好和又快又稳又好是两个概念;5.模型的Agent-工具-操作能力比较强和很强也是两个概念;6.Loop-学习-记忆-内化又是新的一波正在显著提升模型能力的概念。至少近几个月的态势是,常规智能的差距不断缩小,深度智能的差距微微扩大。
希望国产模型尽快达到Opus-4.7至4.8水平的原因是,好多活就能相对比较靠谱地干了。
发布于 上海
