Chaspark茶思屋
26-05-28 14:52 微博认证:茶思屋科技网站官方微博。https://www.chaspark.com

当 AI Agent 已经能端到端写算子,怎么知道它写得好不好?传统 benchmark 是给人设计的 — 对于Agent,它会找出并利用Benchmark内的各种漏洞。从 Sakana AI "100×加速"缓存作弊讲起,我们将用 50 分钟介绍刚开源的 CANN Bench:昇腾生态首个 Agent-Native 评测基准,53 个算子、1060 个测试用例、四级难度、三轴评测。重点拆解硬件性能上限锚定、CANN Bench精度标准、以及针对九种已观测攻击的防作弊体系。欢迎各位算子开发者、Agent 研究者、CANN 生态共建者参与讨论、共建。 http://t.cn/AX6ROSSK http://t.cn/AX6ROSad

发布于 广东