一个较小的模型,如果配备了正确的任务特定框架,就能击败一个更强的模型。
新论文介绍了 JIT-Agent,它采用了这种方法:它按需生成代理框架,选择内存、规划、动作、工具和技能如何为特定任务工作。
配备 JIT-Agent 的 DeepSeek-V4-Flash 在 DeepSearchQA 上得分 85.1,而 GPT-5.6 为 76.0。
这一变化足以显著提升相同骨干模型。在 18 个匹配的骨干-基准对中,每个 JIT 生成的框架都提升了底层模型;9 个基准的平均分对于 GLM-5.2 提高了 7.7 分,对于 DeepSeek-V4-Flash 提高了 8.8 分。
这不仅仅是更多的推理。在与固定框架(如 Claude Code、Codex、OpenCode、Hermes 和 NanoBot)的受控比较中,JIT-Agent 在所有 6 种设置中具有最低的令牌使用量和 API 成本,平均成本比最便宜的固定替代方案低 36.0%。
– arxiv. org/abs/2608.25593
标题:"JIT-Agent:通过即时框架演化扩展框架智能"
http://t.cn/AX0fHjAM
发布于 北京
