1.1.0 性能评测
查看冻结的 AIT 与 Git worktree 各 100 个 session 结果、置信区间、验收披露与并发边界。
适用人群: 开发者、评估人员与技术决策者
已发布结果#
冻结的 1.1.0 campaign 在五个游戏开发 workload 上比较了 AIT Task worktree 与 Git worktree。分析纳入 100 个 AIT session 和 100 个 Git session;每个 workload 有 20 组配对,两种 treatment 都是 100/100 通过验收。
主要结果给每个 workload 相同权重:
- workload 中位数 token 节省:34.95%;
- bootstrap 95% 置信区间:27.85% 至 39.77%;以及
- workload 中位数经过时间节省:21.04%。
Provider token 汇总总量是描述性交叉检查,不是主要估计量:AIT 使用 46,300,272 token,Git 使用 70,140,925 token;在本次 campaign 中, AIT 的 token 少 33.99%。
各 workload 结果#
| Workload | AIT token 中位数 | Git token 中位数 | Token 节省 | 95% 置信区间 | 配对 |
|---|---|---|---|---|---|
| GD-01 | 213,481.0 | 317,517.8 | 32.77% | 22.07–41.92% | 20/20 |
| GD-02 | 266,652.6 | 428,522.2 | 37.77% | 27.59–45.66% | 20/20 |
| GD-03 | 376,821.3 | 496,364.8 | 24.08% | 12.41–34.32% | 20/20 |
| GD-04 | 580,373.9 | 915,416.8 | 36.60% | 25.68–45.84% | 20/20 |
| GD-05 | 877,684.7 | 1,349,224.8 | 34.95% | 22.36–44.82% | 20/20 |
冻结分析中,每个 workload 的区间都保持在零以上。
协议边界#
两种 treatment 使用相同的 GPT-5.6 Sol 模型和 maximum reasoning、相同的 冻结 fixture、相同的任务 prompt 和功能验收检查、全新 session,以及 provider 报告的 token 计数。Session 采用线性执行;本次 campaign 没有 测量高并发吞吐量或扩展性,也不保证每个仓库、模型或任务都有相同节省。
验收披露#
Campaign 为 200 个纳入分析的观察值执行了 201 个 session。原始 AIT GD-05 尝试没有保留 soundEnabled: 0,因此未通过冻结的功能检查。该失败 保留在 run ledger 中,按冻结验收规则排除,并在相同模型与 fixture pin 下补跑一次。替补通过,并成为纳入分析的观察值。
Task-driven 并发是另一项能力#
AIT 以 Task 作为 agent 工作单元。独立 Task 各自拥有 Change、功能 Line 和 worktree,因此命令可以跨多个 agent session 并发执行。对共享目标 Line 的接纳会重新校验并串行进行。这能防止过期写入目标,但不会让多个执行者 同时写同一个 worktree 变得安全。
命令与权威边界见并行 Task 隔离。 这项产品能力不属于上面的线性 benchmark 结果。