最近有个叫 AdaPlanBench 的基准挺有意思,专门考大模型在真实家务场景里会不会“见机行事”。任务里的世界约束和用户偏好不是一次给全的,只有规划踩雷了才暴露新限制,逼着模型边踩坑边改方案。测了十款主流模型,最好成绩也就 67.75%,用户约束翻车尤其多,说明这类动态修正规划的能力还差得远。
http://t.cn/AXXN0zYw
#技术分享 #深度学习
发布于 江苏
最近有个叫 AdaPlanBench 的基准挺有意思,专门考大模型在真实家务场景里会不会“见机行事”。任务里的世界约束和用户偏好不是一次给全的,只有规划踩雷了才暴露新限制,逼着模型边踩坑边改方案。测了十款主流模型,最好成绩也就 67.75%,用户约束翻车尤其多,说明这类动态修正规划的能力还差得远。
http://t.cn/AXXN0zYw
#技术分享 #深度学习