之前一直用豆包闲聊解闷,前段时间听说字节火山Force大会推出豆包2.1 Pro原生任务模式,刚好赶上时间冲突没能到场,心里一直惦记着这套 Agent能力到底好不好用,索性直接开通专业版,拿我日常做产品长周期重型测试的标准完整实测了一遍。
对于agent的测试,尤其是比较重的harness测试,我自己还是有一定发言权的,因为我就是做这玩意的,所以我用我的一个产品经常测试的,长周期任务来测试一下
1-调度skill能力的准确性
2-长尾任务关于记忆和context压缩的balance
3-中间插入任务补充的context管理和注意力的分配
4-当然任务本身的完成质量是最重要的
基本豆姐在这分析plan这快没让人失望,很清晰的判断的prompts的真实意图,拆解了细分的todo(虽然这块隐式到到那时可以看出来)
在拆解skill的时候一个有趣的发现,skill里本身有业绩和股价相关的
而我问的任务容易被判断成业绩分析之类的逻辑,但是豆姐还行,它并没有去按着这个逻辑来分析,还是专注于我的问题判断公司关系的本身来开展故事线
它的search逻辑我分享基本也是按关键字来判断生成多个搜索请求然后多轮来实现的,这种的好处就是搜索速度极快,问题是过于依赖关键字不太容易能完全准确的找到一些抽象的问题,这块或许后续会有变化吧,比如通过LLM生成多样性的搜索请求
Collect以后就生成了一个xml文件,会以这个文件为蓝本来生成飞书文档和slide
生成了飞书文档和slide,而且所有的引用文档都可以在线预览,如果对某些数据有疑问可以直接去相关的文档进行check,防止幻觉引导数据的错位,也可以在线edit文档修正
值得说的是slide,对于中文排版来讲是非常友好的,所有的icon也都可以在ppt软件中编辑,并且和别的genAI不一样的是,豆姐很贴心的写了注释,防止演讲者的思路和genAI生成的不一定完全一致,一是起到align的作用,二是可以很好的在演讲的时候适当提醒
然后又一个append任务,我要求它把生成的结果文档通过邮件传输给我老板
我的skill是原生的没有支持outlook连接的office cli一类服务,所以它尝试直接写powershell来兜底完成任务(应该是内置了个sandbox,不过我没看到)
最后生成了邮件,也把链接都附加在邮件里,当然邮件的话术原生肯定是不成的,需要牛马们自己来斟酌了
总体来说豆包的专业版体验是不错的,我会非常推荐,这个价格在现在动辄20美金cowork类的订阅完成不了几个任务的当下,也算有竞争力。#AILifeDemo#
