Edge Delta 开源了 Project Arena,据其 GitHub 项目页面介绍,这是一个与厂商无关的评测起点,用于部署用完即弃的 Kubernetes 集群、注入故障、保存调查记录,并由可配置的裁判模型打分,旨在评测 AI 产品的故障排查能力。
据官方开源页面说明,该项目支持本地 kind 或 AWS EKS 集群,以 MIT 许可证开源。测试套件分为两类:包含 21 个场景的完整套件,以及包含 6 个场景的冒烟套件。 在运行环境方面,官方要求完整套件使用面向 Linux AMD64 的预构建应用镜像,需要 AMD64 工作节点;Apple Silicon Mac 则可在原生 ARM64 的 kind 上运行冒烟套件。
Edge Delta 在该项目中公布了一份基准测试结果,比较了 Edge Delta 原生 AI 调查、Grafana 原生 AI 调查,以及 Claude 分别通过两家的命令行工具(edx 和 gcx)进行的调查。据说明,这 21 个 Kubernetes 事故场景的所有最终调查,均由 GPT-6-Astra 按同一套事故事实和评分标准进行评估。
在故障检测环节,据 Edge Delta 发布的测试结果,Edge Delta 原生功能检测并调查了 18 个场景(85.7%),Grafana 原生功能则为 12 个(57.1%)。 对于 Claude,文档指出它在两个平台上均是从外部启动的,覆盖了全部 21 个场景。其中在 edx 下触发来源为 16 次告警和 5 次客户报告,在 gcx 下为 12 次告警和 9 次客户报告;由于是外部启动,Claude 的检测环节未单独测量,表格以“—”表示。
在根因分析方面,据测试数据,Claude + gcx 找出了 19/21(90.5%),Claude + edx 为 18/21(85.7%);相比之下,Edge Delta 原生功能为 15/18(83.3%),Grafana 原生功能为 9/12(75.0%)。 在给出有依据的最终缓解方案上,Claude 同样领先:Claude + edx 为 16/21(76.2%),Claude + gcx 为 15/21(71.4%),而 Edge Delta 原生为 8/18(44.4%),Grafana 原生为 5/12(41.7%)。文档也特别声明,缓解与实施就绪度衡量的是给出的方案,而不是已执行的修复或经验证的恢复。
为了进一步对比,文档还提供了一组两款原生产品都调查过的 12 个相同事故的数据。 在这 12 个相同事故中,据统计,根因分析方面 Edge Delta 原生功能达到了 11/12(91.7%),Grafana 原生为 9/12(75.0%),两组 Claude 均为 10/12(83.3%)。在有依据的最终缓解方案方面,Edge Delta 原生为 7/12(58.3%),Grafana 原生为 5/12(41.7%),两组 Claude 均为 8/12(66.7%)。