#谷歌安卓AI评测基准#
谷歌发布Android Bench 2.0评测基准
IT时代网9月18日消息,据海外媒体报道,谷歌对其Android Bench评测基准做了大幅调整,2.0版本把重点转向长周期任务与智能体评测。
第一版Android Bench聚焦对既有代码仓库的增量改动,比如修复缺陷或实现较小的功能需求;2.0版本则针对复杂度高、工程师需要数天甚至一周才能完成的任务,例如新增功能、从零构建应用,以及把跨平台应用迁移到Android。新的侧重点要求更细致的评估与打分方式,谷歌因此从通过或失败的二值评分改为连续评分,综合功能完成度、视觉还原度与回归情况计算完成率,并对偏离评测指令或结构约束的情况给予扣分。
从测试结果看,模型的表现普遍不高。把跨平台应用移植到Android仍是难题,没有模型达到100%的通过率,前沿模型的完成率最高约80%。在智能体评测方面,Android Bench运行了来自对应模型厂商的智能体。谷歌表示,评测框架的设计会正向影响开发者的实际效果,未来还计划纳入更多模型与智能体的组合。
