浏览 1.1.1 文档
1.1.1

1.1.0 性能评测

查看冻结的 AIT 与 Git worktree 各 100 个 session 结果、置信区间、验收披露与并发边界。

适用人群: 开发者、评估人员与技术决策者

已发布结果#

冻结的 1.1.0 campaign 在五个游戏开发 workload 上比较了 AIT Task worktree 与 Git worktree。分析纳入 100 个 AIT session 和 100 个 Git session;每个 workload 有 20 组配对,两种 treatment 都是 100/100 通过验收。

主要结果给每个 workload 相同权重:

  • workload 中位数 token 节省:34.95%
  • bootstrap 95% 置信区间:27.85% 至 39.77%;以及
  • workload 中位数经过时间节省:21.04%

Provider token 汇总总量是描述性交叉检查,不是主要估计量:AIT 使用 46,300,272 token,Git 使用 70,140,925 token;在本次 campaign 中, AIT 的 token 少 33.99%

各 workload 结果#

WorkloadAIT token 中位数Git token 中位数Token 节省95% 置信区间配对
GD-01213,481.0317,517.832.77%22.07–41.92%20/20
GD-02266,652.6428,522.237.77%27.59–45.66%20/20
GD-03376,821.3496,364.824.08%12.41–34.32%20/20
GD-04580,373.9915,416.836.60%25.68–45.84%20/20
GD-05877,684.71,349,224.834.95%22.36–44.82%20/20

冻结分析中,每个 workload 的区间都保持在零以上。

协议边界#

两种 treatment 使用相同的 GPT-5.6 Sol 模型和 maximum reasoning、相同的 冻结 fixture、相同的任务 prompt 和功能验收检查、全新 session,以及 provider 报告的 token 计数。Session 采用线性执行;本次 campaign 没有 测量高并发吞吐量或扩展性,也不保证每个仓库、模型或任务都有相同节省。

验收披露#

Campaign 为 200 个纳入分析的观察值执行了 201 个 session。原始 AIT GD-05 尝试没有保留 soundEnabled: 0,因此未通过冻结的功能检查。该失败 保留在 run ledger 中,按冻结验收规则排除,并在相同模型与 fixture pin 下补跑一次。替补通过,并成为纳入分析的观察值。

Task-driven 并发是另一项能力#

AIT 以 Task 作为 agent 工作单元。独立 Task 各自拥有 Change、功能 Line 和 worktree,因此命令可以跨多个 agent session 并发执行。对共享目标 Line 的接纳会重新校验并串行进行。这能防止过期写入目标,但不会让多个执行者 同时写同一个 worktree 变得安全。

命令与权威边界见并行 Task 隔离。 这项产品能力不属于上面的线性 benchmark 结果。

冻结证据#

版本权威

对照 1.1.1 源码逐条核对

这一页是公开文档,不是第二份产品契约。要确认发布权威,请以确切的源码和分发契约为准。

所属组件 Snapshot
  • ait-coreSNP-ED7593DBF982
  • ait-serverSNP-0CCD7DD2A077
  • ait-runnerSNP-35C9C133D2EE
  • ait-pythonSNP-756C731A4CC0
  • ait-nodeSNP-55E90D0A81F1