欧巴聊AI
26-07-22 23:06 微博认证:AI博主

Fireworks 团队最近发布的这篇文章,真的太精彩了。

他们在 1000 个 Agent 任务中对 Kimi K3 和 Fable 5 进行了测试,结果发现两者的平均准确率几乎持平(例如在 SWE 软件工程测试中,K3 为 92.4%,Fable 为 92.6%)。

当然,术业有专攻。

Kimi K3 在长周期的终端操作(如安全、密码学分析)、符号数学和开发工具方面表现更优。

Fable 5 则在多语言编程广度,Web 开发和数据可视化方面占据优势。

但是,重点来了。

虽然两者在顶层质量上打成平手,但在成本上存在巨大差异,Kimi K3 在 Fireworks 平台上的成本最高可比 Fable 低 50 倍。

文章提出,将任务分配给最擅长该任务的模型,最终得到的结果会高于任何单一模型的准确率。

通过“预言机路由”在两个模型间分配任务,整体准确率达到了 93%,不仅打败了单打独斗的 Fable,还大幅降低了成本。在路由测试中,72%~96% 的任务都被分配给了成本更优的 K3。

这意味着,强大的开源模型足以作为默认主力,而昂贵的闭源模型只需处理少部分特定的长尾高难度任务。

针对自身的业务工作流,构建一个能不断学习并分配任务的路由器,是未来在 AI 应用中保持领先的最佳方式。

传送门:fireworks.ai/blog/kimik3-fable

#HOW I AI##科技先锋官#

发布于 北京