Fireworks 团队最近发布的这篇文章,真的太精彩了。
他们在 1000 个 Agent 任务中对 Kimi K3 和 Fable 5 进行了测试,结果发现两者的平均准确率几乎持平(例如在 SWE 软件工程测试中,K3 为 92.4%,Fable 为 92.6%)。
当然,术业有专攻。
Kimi K3 在长周期的终端操作(如安全、密码学分析)、符号数学和开发工具方面表现更优。
Fable 5 则在多语言编程广度,Web 开发和数据可视化方面占据优势。
但是,重点来了。
虽然两者在顶层质量上打成平手,但在成本上存在巨大差异,Kimi K3 在 Fireworks 平台上的成本最高可比 Fable 低 50 倍。
文章提出,将任务分配给最擅长该任务的模型,最终得到的结果会高于任何单一模型的准确率。
通过“预言机路由”在两个模型间分配任务,整体准确率达到了 93%,不仅打败了单打独斗的 Fable,还大幅降低了成本。在路由测试中,72%~96% 的任务都被分配给了成本更优的 K3。
这意味着,强大的开源模型足以作为默认主力,而昂贵的闭源模型只需处理少部分特定的长尾高难度任务。
针对自身的业务工作流,构建一个能不断学习并分配任务的路由器,是未来在 AI 应用中保持领先的最佳方式。
传送门:fireworks.ai/blog/kimik3-fable
#HOW I AI##科技先锋官#
发布于 北京
