大龙的AGI之旅
26-06-06 10:38

刚刷到一篇有意思的AI论文,必须跟你们唠唠。现在让大模型帮我们规划事情(比如旅行、订餐),常常会遇到“隐藏规则”——比如一开始说“随便”,聊着聊着突然来一句“但我怕辣”或者“预算不够”。现有测试很少管这种动态调整。AdaPlanBench这个新基准就是专门考大模型能不能随着对话一步步摸清你的真实约束,灵活改计划。说白了,就是测AI有没有“眼力见”。32个赞了,我觉得这方向挺实用,大家觉得呢?

🔗 http://t.cn/AXXN0zYw

发布于 江苏