正在用我司内部评测集来跑中国国产开源大模型!
总的来说,与美国前沿大模型相比仍有差距,但差距并不很大。
根据我们内部评测集的初步结果,貌似 DeepSeek 最新版模型在编写代码方面的表现还是不够理想,与 Claude Sonnet 5 相比,仍有一些差距。
GLM 5.3 确实挺厉害,在编写代码方面和 GPT-5.6 Terra 在类似的水平上。
然后是 Kimi K3,接着是 Qwen 3.8 Max 和 DeepSeek V4 Pro 0813,再往后是 MiMo V2.6(和 Gemini Pro 3.1 在类似水平上),最后则是 MiniMax M3 thinking 垫底……
Qwen 3.8 Max 虽然在写代码的评测中表现一般,但在定位和修复 bug 的评测集中表现亮眼。而 DeepSeek V4.1 Flash 也紧随其后,与 Gemini 3.8 Flash 的表现相近。
晚些时候再把正式评测结果(包括具体评分和延时数据图表)发出来。
在我们的内部评测中,除了特别大的开源模型用 FP4 精度以外,我们尽量使用 FP8 精度的布署,尽量减少质量损失。成本花费不小,供大家参考。
发布于 美国
