瀏覽 1.1.1 文件
1.1.1

1.1.0 效能評測

檢視凍結的 AIT 與 Git worktree 各 100 個 session 結果、信賴區間、驗收披露與併發邊界。

適用對象: 開發者、評估人員與技術決策者

已發布結果#

凍結的 1.1.0 campaign 在五個遊戲開發 workload 上比較了 AIT Task worktree 與 Git worktree。分析納入 100 個 AIT session 和 100 個 Git session;每個 workload 有 20 組配對,兩種 treatment 都是 100/100 透過驗收。

主要結果給每個 workload 相同權重:

  • workload 中位數 token 節省:34.95%
  • bootstrap 95% 信賴區間:27.85% 至 39.77%;以及
  • workload 中位數經過時間節省:21.04%

Provider token 彙總總量是描述性交叉檢查,不是主要估計量:AIT 使用 46,300,272 token,Git 使用 70,140,925 token;在本次 campaign 中, AIT 的 token 少 33.99%

各 workload 結果#

WorkloadAIT token 中位數Git token 中位數Token 節省95% 信賴區間配對
GD-01213,481.0317,517.832.77%22.07–41.92%20/20
GD-02266,652.6428,522.237.77%27.59–45.66%20/20
GD-03376,821.3496,364.824.08%12.41–34.32%20/20
GD-04580,373.9915,416.836.60%25.68–45.84%20/20
GD-05877,684.71,349,224.834.95%22.36–44.82%20/20

凍結分析中,每個 workload 的區間都保持在零以上。

協議邊界#

兩種 treatment 使用相同的 GPT-5.6 Sol 模型和 maximum reasoning、相同的 凍結 fixture、相同的任務 prompt 和功能驗收檢查、全新 session,以及 provider 報告的 token 計數。Session 採用線性執行;本次 campaign 沒有 測量高併發吞吐量或擴充套件性,也不保證每個儲存庫、模型或任務都有相同節省。

驗收披露#

Campaign 為 200 個納入分析的觀察值執行了 201 個 session。原始 AIT GD-05 嘗試沒有保留 soundEnabled: 0,因此未透過凍結的功能檢查。該失敗 保留在 run ledger 中,按凍結驗收規則排除,並在相同模型與 fixture pin 下補跑一次。替補透過,併成為納入分析的觀察值。

Task-driven 併發是另一項能力#

AIT 以 Task 作為 agent 工作單元。獨立 Task 各自擁有 Change、功能 Line 和 worktree,因此命令可以跨多個 agent session 併發執行。對共享目標 Line 的接納會重新校驗並序列進行。這能防止過期寫入目標,但不會讓多個執行者 同時寫同一個 worktree 變得安全。

命令與權威邊界見並行 Task 隔離。 這項產品能力不屬於上面的線性 benchmark 結果。

凍結證據#

版本權威

對照 1.1.1 原始碼逐條核對

這一頁是公開文件,不是第二份產品契約。要確認發布權威,請以確切的原始碼和分發契約為準。

所屬元件 Snapshot
  • ait-coreSNP-ED7593DBF982
  • ait-serverSNP-0CCD7DD2A077
  • ait-runnerSNP-35C9C133D2EE
  • ait-pythonSNP-756C731A4CC0
  • ait-nodeSNP-55E90D0A81F1