我觉得现在网上,尤其是网友,讨论大模型的能力比较其实没太大意义,即使是同一个模型:
应用场景不同(有的人写代码,有的人用web聊天,有的人写文档做PPT)
模型设置不同(有的人用默认,有的人开max/ultra)
harness工具不同(codex、CC、copilot、一些国产coding工具)
使用习惯不同(有的人上下文控制在200K以内、多开子Agent,有的人上下文顶到1M不松手)
prompt习惯不同(有的人清晰描述需求,有的人不知道自己要什么,有的人冲AI发火)
最终都会导致模型显现出来的能力、token消耗、最终效果有着天差地别。在这种环境下讨论出的结论毫无参考价值,甚至能不能得出结论都难说。
我自己一般首先看的是各个评分榜,然后听听相关权威专家和大佬的意见。如果普遍好评,就自己花钱,用真实项目的多种需求去对比测试。还要保证确实用了尽量好的工具和提示词,保证不因自己水平拖累模型的表现,最终才能得到真实的判断。
发布于 天津
