1.1.0 效能評測
檢視凍結的 AIT 與 Git worktree 各 100 個 session 結果、信賴區間、驗收披露與併發邊界。
適用對象: 開發者、評估人員與技術決策者
已發布結果#
凍結的 1.1.0 campaign 在五個遊戲開發 workload 上比較了 AIT Task worktree 與 Git worktree。分析納入 100 個 AIT session 和 100 個 Git session;每個 workload 有 20 組配對,兩種 treatment 都是 100/100 透過驗收。
主要結果給每個 workload 相同權重:
- workload 中位數 token 節省:34.95%;
- bootstrap 95% 信賴區間:27.85% 至 39.77%;以及
- workload 中位數經過時間節省:21.04%。
Provider token 彙總總量是描述性交叉檢查,不是主要估計量:AIT 使用 46,300,272 token,Git 使用 70,140,925 token;在本次 campaign 中, AIT 的 token 少 33.99%。
各 workload 結果#
| Workload | AIT token 中位數 | Git token 中位數 | Token 節省 | 95% 信賴區間 | 配對 |
|---|---|---|---|---|---|
| GD-01 | 213,481.0 | 317,517.8 | 32.77% | 22.07–41.92% | 20/20 |
| GD-02 | 266,652.6 | 428,522.2 | 37.77% | 27.59–45.66% | 20/20 |
| GD-03 | 376,821.3 | 496,364.8 | 24.08% | 12.41–34.32% | 20/20 |
| GD-04 | 580,373.9 | 915,416.8 | 36.60% | 25.68–45.84% | 20/20 |
| GD-05 | 877,684.7 | 1,349,224.8 | 34.95% | 22.36–44.82% | 20/20 |
凍結分析中,每個 workload 的區間都保持在零以上。
協議邊界#
兩種 treatment 使用相同的 GPT-5.6 Sol 模型和 maximum reasoning、相同的 凍結 fixture、相同的任務 prompt 和功能驗收檢查、全新 session,以及 provider 報告的 token 計數。Session 採用線性執行;本次 campaign 沒有 測量高併發吞吐量或擴充套件性,也不保證每個儲存庫、模型或任務都有相同節省。
驗收披露#
Campaign 為 200 個納入分析的觀察值執行了 201 個 session。原始 AIT GD-05 嘗試沒有保留 soundEnabled: 0,因此未透過凍結的功能檢查。該失敗 保留在 run ledger 中,按凍結驗收規則排除,並在相同模型與 fixture pin 下補跑一次。替補透過,併成為納入分析的觀察值。
Task-driven 併發是另一項能力#
AIT 以 Task 作為 agent 工作單元。獨立 Task 各自擁有 Change、功能 Line 和 worktree,因此命令可以跨多個 agent session 併發執行。對共享目標 Line 的接納會重新校驗並序列進行。這能防止過期寫入目標,但不會讓多個執行者 同時寫同一個 worktree 變得安全。
命令與權威邊界見並行 Task 隔離。 這項產品能力不屬於上面的線性 benchmark 結果。