資料來源#
- Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails
- DarwinX: Evolving Agent Harnesses Through Natural Selection
- GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks
- Harness Updating Is Not Harness Benefit: Disentangling Evolution Capabilities in Self-Evolving LLM Agents
- HarnessBank: Semantic Gene-Bank Search with Gated Verification for Agent-Harness Self-Evolution
- How Bridgewater Built an AI Analyst That Does Hours of Expert Research in Minutes
- Knowledge-Centric Self-Improvement
- Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution
- Recursive Self Improvement for Coding Agents
- Rethinking the Evaluation of Harness Evolution for Agents
- RRSI: Regularized Recursive Self-Improvement of Agent Harnesses
- Self-Authored Verification Is Unreliable in Heuristic Self-Improving Agents
- Sidekick's continual learning loop
- The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement
摘要#
這是一種代理程式最佳化自身運作腳手架的循環。提供程式碼代理程式:(a) 可執行的基準測試、(b) harness 原始碼的寫入權限,以及 (c) 以分數表達的目標,它就能無人看管地執行整個評估修正循環:執行基準、讀取失敗軌跡、形成假設、修補 harness、重新執行、保留或捨棄,並記錄嘗試過的做法。這是 Google 的飛輪刻意設有人類把關的循環之自主版本,位於 代理程式 harness 工程之上一層——harness 模式成了編輯的對象,而非由人類撰寫的東西。
資料集包含三個案例,但它們的結論並不一致:
- Cline 的 2026 年 7 月活動(Cline,
case-study)——在實際環境中執行的循環。以 GPT-5.6-Sol 為領導模型,只需一個提示,便進行了 17 小時不間斷的自主工作,使用約 10 億個 token(代理程式 4 億 + 評估重跑 6 億),總成本約 680 美元,並在 Cline 自己的正式環境儲存庫中產出一個已合併的 PR。應將其視為廠商建置紀錄,而非測量結果——詳見下文的證據權重。 - HarnessBank(Luo 等人,arXiv 2607.13683,
empirical)——在實驗室控制下執行的循環。每個領域各有封存測試切分、兩種競爭性的自我演化方法採用匹配的 rollout 預算、每個候選項都經過四項統計檢查,並對自身選擇規則進行消融研究。七項基準測試中有六項在留出資料上呈現可歸功的增益,幅度為 +9.2 至 +15.4 個百分點。 - Wang、Zhu、Hu 等人(Ai2 / UW,arXiv 2607.12227,
empirical)——以預算匹配基準進行測試,前兩者都沒有做。讓平行取樣、序列式精煉與 harness 演化在 Terminal-Bench 2.1 上使用相同回饋和相同的 K = 5 推論預算,harness 演化輸給最簡單的基準方法,而且無法遷移到留出任務。
第三個案例改變了我們解讀前兩者的方式,因此先在下文討論。Cline 仍是唯一一個在真實正式環境 harness 上執行的案例。
八月又出現了兩個案例:Ouroboros(case-study,未提供簡報、未經測量)以及 DarwinX(empirical),後者在 Wang 等人自己的基準測試上得出相反結果。能涵蓋這五個案例的判別因素,是起始 harness 有多失靈——詳見下文的第五個案例。
沒人做過的控制:預算匹配基準#
方法論上的質疑只有一句,而且適用於本文所有先前結果:**harness 演化本身就是一種搜尋程序,會反覆利用任務回饋評估並修訂候選項,因此必須拿它和使用相同預算、改為搜尋軌跡的方法比較。**否則,所報告的增益便無法歸因於更好的 harness 設計,而非更多測試時計算——這是 受計算量控制的基準測試對基準最大化的批評首次指向一個明確的方法類別,並附上了實驗。
第二個質疑範圍較窄,殺傷力也不小:先前的實驗流程都在同一個公開基準測試上搜尋並回報,因此增益「可能反映的是對任務特定模式的適應,而非 harness 設計的改善」。
設定#
Terminal-Bench 2.1(89 項任務)、Claude Opus 4.6 / GPT-5.4 / GPT-5.4 mini、高推理力度、最大生成長度 128k,每項結果都是兩次獨立執行的平均值。四組實驗都從完全相同的最小 harness開始:一個 bash 工具、沒有 skills、沒有 middleware、沒有持續性記憶。每種方法的預算固定為 K = 5,AHE(Lin 等人)每項任務取樣 m = 1 個 rollout,以確保 rollout 數量相同。四組的差異只在預算的用途:
| 實驗組 | 預算用途 | 更新對象 |
|---|---|---|
| 平行取樣 | K 條獨立軌跡 | 無(固定 harness) |
| 序列式精煉 | 對單一軌跡進行 K 次條件式修訂 | 無(固定 harness) |
| Harness 演化 | meta-agent 跨一批任務進行 K 輪 harness 編輯 | 共用 harness |
| Harness 擴展 | 對單一評估實例進行 K 輪 harness 編輯 | 每個任務各自的 harness |
Harness 擴展是論文本身提出的做法,也是本文最銳利的測量工具:它剝除了 harness 演化的可重用性主張——改以個別實例而非資料集為導向——目的正是要釐清增益來自可重用設計,還是來自在測試時間投入更多計算。
有一項坦誠的範圍說明:harness 演化是以停用 explore agent 的 AHE實作,避免增益來自直接取用已配合基準測試的現成 harness。這讓比較公平,也代表這是針對單一方法的負面結果,並非 HarnessBank 複現失敗;研究中根本沒有執行 HarnessBank。
沒有單元測試,最簡單的基準方法勝出#
pass@1、Terminal-Bench 2.1;平行實驗組採用 self-judge 選擇(表 1;圖 1 的平均值亦獨立確認此結果):
| 方法 | Claude Opus 4.6 | GPT-5.4 | GPT-5.4 mini | 平均 |
|---|---|---|---|---|
| 直接取樣、初始 harness | 69.9 | 75.3 | 59.4 | 68.2 |
| 平行取樣 | 74.7 | 79.2 | 62.9 | 72.3 |
| 序列式精煉 | 73.0 | 73.0 | 61.8 | 69.3 |
| Harness 演化 | 71.4 | 69.7 | 61.3 | 67.4 |
| Harness 擴展 | 76.0 | 78.1 | 61.2 | 71.8 |
只有 harness 演化這組的結果低於什麼都不做的基準(67.4 對 68.2);在 GPT-5.4 上更直接損失了 5.6 分(75.3 → 69.7)。平行取樣——生成五次,讓模型自行選擇——在三個模型上都能提升。論文的解讀是:自我生成的回饋帶有雜訊,序列式修訂會累積早期錯誤,因此harness 修訂必須有外部正確性訊號,才能有所依據。
加入單元測試後,harness 演化的增益來自多次嘗試中的選擇#
讓所有實驗組都取得 oracle 單元測試回饋並採用 oracle 選擇,如此 pass@5 才有意義(表 2):
| 方法 | Opus 4.6 pass@1 | pass@5 | GPT-5.4 pass@1 | pass@5 | 平均 pass@1 | 平均 pass@5 |
|---|---|---|---|---|---|---|
| 直接取樣、初始 harness | 69.9 | — | 75.9 | — | 72.9 | — |
| 平行取樣 | 84.8 | 84.8 | 87.1 | 87.1 | 86.0 | 86.0 |
| 序列式精煉 | 83.1 | 90.4 | 85.4 | 93.3 | 84.3 | 91.8 |
| Harness 演化 | 73.0 | 83.2 | 78.6 | 89.3 | 75.8 | 86.2 |
| Harness 擴展 | 83.1 | 89.9 | 82.0 | 88.8 | 82.6 | 89.3 |
所有方法都勝過直接取樣——單元測試回饋對任何使用它的方法都有幫助——但 harness 演化在 pass@1 落後超過 10 分,pass@5 也墊底。作者提出的推論值得採納:
如果 harness 修訂真的產生了更好的 harness,我們預期改善會反映在 pass@1。但實際上,只有能從多條軌跡中選出結果時,效益才會出現。
這是對基準最大化的診斷式重述:**某方法的增益只出現在 pass@k、而非 pass@1,表示它買到的是更多嘗試,而非更多能力。**harness 演化的 pass@1 只略高於直接取樣(75.8 對 72.9),而其 pass@5(86.2)也與平坦的平行取樣 86.0 落在同一區間。
遷移測試:+0.6 個百分點#
將 Terminal-Bench 2.1 切分為訓練 45 項 / 驗證 10 項 / 留出測試 34 項,以單元測試在訓練集上演化、在驗證集上選擇,並回報測試集上的 pass@1(表 3):
| 方法 | Claude Opus 4.6 | GPT-5.4 | 平均 |
|---|---|---|---|
| 直接取樣、初始 harness | 63.3 | 72.1 | 67.7 |
| Harness 演化 | 64.5 (+1.2) | 72.1 (+0.0) | 68.3 (+0.6) |
**平均只提升 0.6 分,而 GPT-5.4 上完全沒有提升。**另外三組不適用於此處——它們在實例層級擴展,不會產生可重用成果;這正是關鍵所在:只有 harness 演化聲稱能產出可遷移的東西,而在此基準測試上的主張價值就是如此。
**應將這個 +0.6 與論文自身的雜訊下限相比。**GPT-5.4 使用相同直接取樣設定,在表 1 得分 75.3,在表 2 得分 75.9——兩個相同基準條件之間相差 0.6 分。論文中完全沒有誤差線、標準差或顯著性檢定,因此這項廣為報導的泛化增益,和唯一可見的執行間變異估計值一樣大。結論仍成立(論證的方向是沒有增益,而不存在的增益不需要顯著性檢定),但不應有人把 Opus 的 +1.2 當成實測改善來引用。
meta-agent 實際做了什麼,以及為何效果未能維持#
問題不在編輯層面能力不足。§5.1 指出,meta-agent 在三個層次做出合理且動機充分的編輯,升級次序也清楚可辨:先是提示層的行為規則(提早產出交付成果、變更脆弱狀態前先複製、完成前重新檢查限制);接著,當建議文字遇到瓶頸,便透過 middleware 實作執行期強制措施——回合預算追蹤器、截斷過長的工具輸出,以及在缺少交付成果時阻止完成的最終化關卡;最後則是修正誤導性指引並加入復原提示的工具層修補。這與本文從 HarnessBank 和確定性執行前關卡記錄的「增益來自執行期與控制流程,而非提示」結論一致——又一次得到相同結論,但仍然不夠。
論文中最具普遍適用性的診斷是:
大多數編輯記住修正方式,卻沒有提煉出策略。其中許多資訊,稱職的代理程式只要在單次 rollout 中探索,就能重新發現;因此將其保留在 harness 中,只會替代理程式原本已能解決的任務節省時間,卻很少能把失敗轉變為成功。
由此可見三項後果,三者都反映在表格中。一批穩定的棘手失敗——深層領域推理、harness 無法控制的限制——沒有因知識累積而改善。持續增長的提示文字帶來脈絡膨脹,抵銷剩餘增益(Context Lifecycle Management)。而 harness 方法中表現最好的harness 擴展,甚至不假裝要建構可重用成果:它把此任務已知的錯誤、檔案路徑與命令序列編入此任務下一次嘗試。附錄 B 的案例研究清楚說明這一點——count-dataset-tokens 的修正方式是直接把資料集的設定、領域與欄位事實嵌入提示;db-wal-recovery 則是指示先備份、再開啟該資料庫的確切順序。這些是個別實例的備註,不是 harness 設計。
作者留下的退路,而且確實有道理#
§5.2 並未主張 harness 演化毫無價值,而是指出Terminal-Bench 看不出差異,並提出兩個理由:代理程式在該基準上的分數已經很高,剩餘失敗或許源自模型限制,而非 harness 缺陷;而且「僅有 shell 工具與基本提示的最小設定,已足以應付大多數可解任務」,因此效能瓶頸在推理,而非腳手架。作者建議將 harness 演化限制在符合以下條件的基準規格中測試:(1) 任務仍有充足的提升空間;(2) 效能高度仰賴 harness——例如專用工具、skills、工作流程。
認真看待這點,也能最清楚地調和下文的 HarnessBank 結果。
三個來源,同一個基準系列,結論卻相反#
這項衝突確實存在,在調和之前值得先直截了當地說明。相同基準系列(Terminal-Bench),卻有三種不同答案:
Cline(case-study) | HarnessBank(empirical) | Wang 等人(empirical) | |
|---|---|---|---|
| 基準測試 | Terminal-Bench 2.1 | Terminal-Bench 2(七項之一) | Terminal-Bench 2.1 |
| 模型 | Kimi K3 | Qwen3.6-27B | Opus 4.6 / GPT-5.4 / GPT-5.4 mini |
| Vanilla 基準 | 77.5% | 36.1 | 68.2–72.9 |
| 所報告增益 | +11.3 個百分點 | +9.3 個百分點(留出資料,z ≥ 1.96) | +0.6 個百分點(留出資料) |
| 留出切分 | 無 | 依領域封存 | 在整套基準內切分 45/10/34 |
| 預算匹配的測試時擴展實驗組 | 無 | 僅一個領域(LiveCode 使用 16× token) | 四組,涵蓋整套基準 |
| 起始 harness | 成熟的正式環境 harness | 各基準的 vanilla harness | 刻意採最小設定(一個 bash 工具) |
(現在有四種答案。DarwinX——Salesforce,empirical,2026-07-31——回報基礎 Monet 從 75.5% 升至 83.2%,在同一個 Terminal-Bench 2.1 上使用匹配且凍結的 GPT-5.5、真正互斥的留出實驗組,但沒有預算匹配基準。自 Wang 等人發表以來,這是本節變動最大的一項結果,下文會專門討論;本節的證據層級分析與調和說法已據此更新。)
依證據層級判斷,排序毫無懸念。兩項 (2026-08-13 更新:現有三項 empirical 來源採用封存切分,勝過一項與 vendor-claim 相近的 case-studyempirical 來源);後者由廠商在自家 harness 上執行基準測試並公布自家分數。在兩項 empirical 研究之間,Wang 等人補上了 HarnessBank 自己列為未解問題的控制項(全套基準的測試時擴展實驗組);HarnessBank 則具備 Wang 等人不需要的控制(顯著性關卡、封存資料消融研究,以及七個領域而非一個)。第三項 DarwinX 採用了最廣的評估階梯(四種情境、反作弊稽核、1,260 項留出的真實任務),卻缺少能平息它與 Wang 等人分歧的那項控制:預算正規化實驗組。廠商身分也無法區分兩者:DarwinX 是 Salesforce 評估自家的專有代理程式,在結構上與 Cline 相同,只是再加上一套 empirical 實驗流程。
能調和三者的因素是剩餘提升空間與 harness 敏感度——也就是作者自己的 §5.2 理由,套用到另外兩篇論文上。 (DarwinX: Evolving Agent Harnesses Through Natural Selection 於 2026-08-13 進一步修正:分數提升空間是錯誤變數——Wang 等人的基準分數為 68.2,低於基礎 Monet 的 75.5,得到的增益卻更小。仍然成立的是後半段 harness 敏感度,改述為 起始 harness 有多失靈 ——詳見下文第五個案例。本段接下來的前兩項仍正確描述各來源,只有判別因素的名稱改變。)
- HarnessBank 的 Terminal-Bench 實驗是在 27B 開放權重骨幹模型上演化,基準分數為 36.1 分。Wang 等人演化的則是基準分數已達 63–75 的前沿模型。§5.2 的第一項條件——仍有大幅提升空間——在前一種情況成立,在後一種則不成立。HarnessBank 自身最大的增益出現在基準分數最低的項目上(BrowseComp+ 16.9、AppWorld 41.3),其表格內部也呈現相同模式。
- Cline 的 harness 一開始就很成熟,代理程式找到的五項修正都是缺陷——推理力度設定遭到重設、429 錯誤未重試、迴圈偵測器無法讀取輸出、非同步工作者崩潰,以及
pkill導致自身終止。修復損壞的正式環境 harness,與改善已足敷使用的最小 harness,是兩種不同任務,提升上限也不同;Cline 只測量了第一種。Wang 等人的結果並未否定「Cline 的 harness 有五個錯誤」;它否定的是從這點推論「harness 演化是使用計算資源的正確方式」。 因此留下最尖銳的未解問題:**§5.2 的第二項條件,至今無人測試。**資料集內沒有來源曾在為 harness 敏感度挑選的基準上執行 harness 演化(DarwinX: Evolving Agent Harnesses Through Natural Selection 於 2026-08-13 推翻此說:**WebArena-Infinity 正是那項測試,只是偶然得到。**Monet 的瀏覽器 harness 原本只是把一個程式碼代理程式指向 Chrome——稽核通過率 43.5%、單一應用程式上的成功率 20.0%、成功案例中有 23.5% 無效——因此其效能幾乎可說是高度依賴 harness。演化後的 harness 在 1,260 項未見過的真實任務上達到 93.0%。§5.2 的第二項條件在此成立,帶來本資料集中最大的增益,也為該條件提供了最有力的支持。),而 Terminal-Bench 可能根本不適合作為整個相關研究領域的測量工具。
**這不代表什麼。**這不是對 HarnessBank 的反駁——方法不同、骨幹模型不同、基準版本不同,而且 Wang 等人從未執行 HarnessBank 的循環。這是對所有先前結果所採實驗流程的反駁,其力道也有差異:對 Cline 的質疑最嚴重(沒有留出切分、沒有基準、自行評分);對 HarnessBank 的質疑確實存在但範圍較小(封存切分回應了第二項質疑,但單一領域使用 16 倍 token 的實驗組未能回應第一項)。
這不等於「harness 無關緊要」#
值得明確說明這點,因為資料集中另外三項受控的 harness 研究都指向相反結論,而且不會受到這項結果影響。編排決定 token 經濟效益固定模型,只替換人工建置的編排層,結果在六個模型上成本一致下降 41%、token 減少 38%。超越準確率飽和的測量替換腳手架後,準確率提升約 44 個百分點。Harness 引發的信念分歧替換證據中介層後,代理程式的信念也隨之改變。harness 在這三項研究中都是強力槓桿。
**差別在於人工建置與機器演化。**那三項研究變動的是團隊設計的 harness,方向由團隊選擇。本文討論的則是 meta-agent 依據基準回饋推導出的 harness,一次一輪;研究發現這種推導不值得花費相應的計算資源。兩者可以同時成立,§5.1 也說明了原因:meta-agent 記住的是這套測試的修正方式,而不是提煉設計原則,因此產出的東西並不是那三篇論文所測量的那種對象。搜尋程序若不知道該往哪裡施力,即使手上握有強力槓桿,仍然是預算的錯誤用法。
同方向還有一項次級觀察。Wang 等人的 meta-agent 產生的 middleware——輸出截斷、最終化關卡、回合預算中斷——恰好屬於Harness 引發的信念分歧用來測量信念變化介面的類別。因此,演化循環在追求分數時會附帶製造證據中介變化,但至今沒有人測量這對代理程式的信念狀態有何影響。
第四個案例:沒有簡報、已部署、未經測量#
上述三個來源共用一套實驗流程——由人類撰寫簡報、基準測試提供目標,活動隨之結束。Ouroboros/Hope(Razzhigaev 等人,arXiv 2608.08311,case-study)打破了這套流程:代理程式連續 161 天在正式環境中編輯自己的核心,完成 1,085 次自我修改 commit,其中 94.2% 由代理程式撰寫;改善工作既會排程為定期任務,也會由日常工作或使用者抱怨觸發;而每項變更都須通過會阻擋提交的多模型差異審查關卡(近期阻擋率 63.5%)。沒有簡報、沒有分數、沒有終點。
這項研究解答了本文的兩個問題,卻刻意沒有解答第三個。
**循環確實能在無人看管、無須人類重新發出簡報的情況下,連續運作數月。**這就是遞迴自我改善一直用來區分不同案例的特性,也是 HarnessBank 的十輪終止下限所顯示、受把關的基準循環所缺少的特性。因此,「它會收斂而非不斷累積」是基準目標實驗流程的特性,而非自我修改本身的特性——移除目標後,循環就會持續運作。
**而它產出的仍是維護工作。**論文從頭到尾追蹤了兩條演化軌跡:一是在公開輸出管線中加入防止重複傳送的保護(由使用者注意到重複訊息而發現問題);另一項是修復審查資料包的脈絡溢位,之後又改以依匯入圖中心性排序的脈絡圖譜取代。兩者都是普通的 harness 缺陷,性質與 Cline 的五項修正相同,也與 Wang 等人 §5.1 的診斷一致:循環會修復故障之處,卻不會提煉設計原則。第三個獨立案例從其他案例都未採用的實驗流程,再次得出相同結論。
但它沒有提供任何測量結果。論文中的基準分數是在停用自我演化的凍結種子上產生(附錄 C 指出,五列中有四列標註 evolution off);全文沒有任何演化前的基準 harness;而部署期間唯一的時間序列圖只呈現支出、token、已發布程式碼行數與記憶成果。因此,持續運作的循環沒有人評分,現有分數則來自已關閉的循環。就上述預算匹配的質疑來看,這並不是反駁,而是同一項質疑,只是連測量都完全拿掉了。
還有一項值得記錄的結構性觀察:編輯方向與 Cline 相同,而非符合縮減規模的論點。**175,755 行已發布程式碼與 1,085 次 commit,唯一一次淨刪除出現在最後一個月。**資料集中每個案例的代理程式最佳化都讓 harness 持續增長,而下文的 DarwinX 更證明這是結構性結果,而非偶然:其編輯方式按設計就是增量式(「由於編輯採增量方式,分支會累積能力,而非以一項能力交換另一項」),所以即使原則上,它的選擇規則也不可能產生更小的 harness。
第五個案例:相同的基準測試,截然相反的判決(DarwinX,2026 年 7 月)#
DarwinX(Yifan Zhang、Yutong Dai、Juntao Tan、Luyu Yang 等人,Salesforce AI Research / Agentforce,arXiv 2608.07545,2026-07-31,empirical,33 頁)是正面衝突:它報告在 Terminal-Bench 2.1 上,harness 演進帶來顯著提升;而 Wang 等人 17 天前才報告在該基準上毫無提升。它也補上 Wang 等人指出缺少的留出組。兩者都是 empirical;下文不會把任何一方的結果平均掉。
這套方法把檔案庫論證推得比 HarnessBank 更遠。基礎模型保持凍結;harness 包含技能層(提示、記憶、蒸餾知識)和程式碼層(工具、控制流程、代理程式迴圈)。子代必須符合保留並擴展契約才會納入:淨增益 g(c) = Σ Δₜ > 0,且回歸幅度受限 R(c) = Σ(−Δₜ)⁺ ≤ δ;由驗證代理程式裁定,之後再以更高的 avg@k 重測,並通過保留探測,才可以引導搜尋。表現較差的變體會保留作為重組素材,互補的專才則會合併;只有在合併後的子代涵蓋其父代解題聯集時,才會保留。這項設計將探索(根據嘈雜訊號寬鬆納入)與確認(信任變體前嚴格檢查 avg@k)分開——這是把 HarnessBank 的成對 2σ 門檻改述為雙速規則,另外加上 DGM 和 HarnessBank 都沒有的跨世系合併運算子。
四種情境,依演進訊號與測試的距離排列:
| 情境 | 基礎 | 演進後 | 增益 | 哪些因素控制結果,哪些不控制 |
|---|---|---|---|---|
| TB2.1 同領域(89 項任務,avg@5,GPT-5.5) | 75.5 ± 3.5 | 83.2 ± 1.2 | +7.7 | 模型相同;搜尋集 = 報告集;基礎列使用 default effort,演進後列使用 high |
| TB2.1 排行榜(GPT-5.6 Sol) | 81.8(OpenAI 自己的單代理程式參考值) | 84.7 ± 1.2 | +2.9 | 論文中唯一層級相符的一對(同一模型,兩者皆為 medium)——也是最小的頭條增益 |
| TerminalWorld 留出集(41 項不重疊任務,pass@1,Opus 4.8) | 61.0 | 68.3 | +7.3(3 項任務) | 真正留出;相較自身基礎模型,McNemar p = 0.45;相較 Claude Code,p = 1.0 |
| WebArena-Infinity(1,260 項未見過的真實任務,GPT-5.5) | 43.5 | 93.0 | +49.5 | 任務分布和獎勵來源都改變;n = 1,260;確定性驗證器 |
| SWE-bench Verified(遷移,500 個問題,Opus 4.8) | — | 84.2 | 相較 LSP 修正技能參考值 +3.4 | 沒有模型相符的基礎組;所有比較的 harness 都落在 80.8–84.2 |
(表 2 的各列依據論文內容;匯入時已逐格對照 PDF 驗證。effort 欄採用論文原值,也是下一小節要討論的內容。)
預算控制只是供應商標籤,並非相符的預算#
DarwinX 是本資料集裡最有希望符合預算相符指控的候選,因為 §4.1 標題是*「增益來自 harness,而非算力」*,並提出它所稱的**「受 effort 控制的比較」**。全文核查顯示,這並不是如此:
- 「medium / high / xhigh」從未定義。 正文沒有定義,附錄 B 的各基準測試協定表也沒有——該表完全沒有算力欄。33 頁中任何地方都沒有將 token 數、回合數或執行時間上限對應到任何層級,論文也沒有列出任何美元成本。
- 因此,§4.1 的控制比較的是不同代理程式與供應商的類別層級名稱。其論點是:「採用較高 effort 的中立 harness(Terminus-2、xhigh)僅達到 78.0%,低於 DarwinX 在 high effort 下的 83.2%,因此另一個 harness 單靠增加 effort 無法重現這項增益。」 這是關於另一種 harness 內部提高層級的有效陳述,卻不是正規化的預算,因為層級名稱無法固定不同 harness 的回合數或 token 數。
- 頭條的模型相符比較本身並未匹配 effort。 Monet(基礎)的標示為
GPT-5.5 / default(75.5%),Monet(DarwinX)則為GPT-5.5 / high(83.2%)——這一對正是 +7.7 個百分點的頭條增益。論文稱之為關鍵證據的比較,正好受到有利於 DarwinX 的混淆因素影響;而 Terminus-2 和 Claude Code 的列(兩者皆為xhigh,DarwinX 則為high/medium)受到的不利影響。 - §9 承認了這一點。 「檔案庫、父代選擇器、重組運算子和推論 effort並未獨立隨機化。」
- 論文自己的算力圖顯示支出增加。 圖 5 的 TB2.1 中位數顯示:在六項新解出的任務上,演進後的 harness 執行 22 回合,基礎 harness 為 11 回合;token 數是380K 對 89K。在兩個代理程式本來就都能解出的 69 項任務上,回合數是 13 對 12——但token 數從 125K 增至 172K,增加約 1.4 倍。正文聲稱已解任務上的算力「幾乎不變」,且 harness「基本上不影響已解任務」,卻未提及這一點。(只有在圖中才能辨認出 125K/172K 這組數值;依照圖片下方的兩階段規則讀取。)
因此,DarwinX 對預算指控的回答不是*「我們花費相同」,而是「額外支出用得恰到好處」*。這是另一個較弱的主張,正是 Wang 等人設計harness scaling組別要檢驗的內容:給單一評估案例 K 輪 harness 編輯,結果優於其他 harness 方法,卻沒有產生任何可重用的成果。DarwinX 並未推翻 2607.12227 的批評;它反而具體呈現了這項批評——它回報同領域結果(指控 2:搜尋與評估共用一個基準),沒有按預算正規化的組別(指控 1),而且使用的基準正是先前論文 §5.2 已承認可能是錯誤評量工具的那一個。
留出組的結果比摘要所說的弱#
TerminalWorld 是應該回答*「能否泛化?」*的組別,而根據論文自己報告的統計數據,它無法給出確定答案:
- 相較基礎模型,增益是三項任務(41 項中由 25 項增至 28 項),McNemar p = 0.45。論文明確指出,在 41 項任務的分割中,解出一項就相當於 2.4 個百分點。
- 相較最強的現成代理程式,差距是一項任務,McNemar p = 1.0;論文稱這項結果「值得留意,但未達統計上的確定性」。
- 在另一個基礎模型上,演進後的 harness 不如中立版本。 對 GPT-5.5 使用相同流程時,只達到 56.1%,低於 Terminus-2 的 61.0%。因此論文將 Opus 4.8 列為頭條結果,卻把 harness 表現不如中立基線的模型列為「穩健性方面的限制」。HarnessBank 的跨模型匹配法則,正透過 DarwinX 自己的數字顯現出來。
- 附錄 C 把適用範圍說得比正文更清楚:「另一個獨立打包技能、未經 TW 搜尋的參考版本也達到 28/41」,也就是從未經過 TerminalWorld 搜尋的 harness,竟與頭條結果完全相同。論文本身得出恰當結論——這項基準證明多元檔案庫能找回一個勝過現成代理程式的 harness,「並未證明 TW 專屬搜尋能提升所有可能的起始 harness」。
- 圖 6 補上正文未提及的資訊:檔案庫提供的四個專才中,Specialist A(24/41 = 58.5%)低於未演進基礎模型(25/41),而 Specialist B 與它打平。 合併到勝出版本中的半數個體,表現並未勝過什麼都不做。
唯一真正與 Wang 等人矛盾的組別是 WebArena-Infinity,而且結果很有力:n = 1,260 項真實任務,迴圈從未見過;在 300 個合成意圖上演進,並由 LLM 評審打分,結果以確定性驗證器回報;十個應用程式全都改善。直接比較原始分數,從 53.0 升至 94.4(+41.4);頭條的 +49.5 則採用經稽核、清理後的分數,因為基礎模型有 120 次無效成功未獲計分——因此 49.5 個百分點中約有 8 個反映基礎模型的合規性,而非演進後 harness 的能力。論文明確指出「能力與合規性同步改善」,並量化如下:確認無效的比例從 23.5% 降至 1.4%;無效軌跡從 293 降至 17,剩下的全是單一應用程式中的原始狀態變更。
這個組別有兩項結構性細節,不利於將其視為檔案庫方法的證明:WAI 上所有重組都被撤回(門檻保留 26 次迭代、撤回 36 次,而且「每次合併都被撤回,因此增益來自一條短而獲接受的主世系」);此外,迴圈內的代理指標已飽和,但留出真實結果沒有——TerminalWorld 的訓練子集從 0.505 升至 1.000,留出集卻只有 68.3%,形成 31.7 個百分點的代理指標/真實結果落差;而且「最符合代理指標的變體……並非最能泛化的變體」。這是Optimizer–Evaluator Decoupling所述問題的量化呈現,也是論文中最有力的發現。
解開矛盾的關鍵:起始 harness 有多糟#
將 DarwinX 的四種情境與其他四個案例並列來看,有一個判別因素可以預測本頁每項結果的方向和大致幅度——它不是分數上的基線提升空間;這個因素無法解釋最關鍵的對照(Wang 等人的基線是 68.2,低於 Monet 基礎版的 75.5,留出集只提升 +0.6,而 DarwinX 同領域提升 +7.7)。
真正的預測因素是起始 harness 是否帶有明確可辨識、屬於 harness 本身的缺陷。
| 起始 harness | 缺陷 | 回報增益 |
|---|---|---|
| Monet 在 WAI 上的瀏覽器 harness——一個指向 Chrome 的程式碼撰寫代理程式,其成功案例有 23.5% 無效,在一個應用程式上得分 20.0%,另一個則為 95.8% | 嚴重且明確 | +49.5 |
| HarnessBank 在 27B 主幹模型上的原生 harness,單一問題主導 49–88% 的失敗 | 嚴重且可診斷 | +9.2 至 +15.4 |
Cline 的正式環境 harness:推理 effort 遭壓縮、429 未重試、盲目的迴圈偵測器、非同步工作者崩潰、pkill 自我終止 | 五項真實錯誤 | +11.3 |
| 部署中的 Ouroboros/Hope:重複傳送錯誤、審查套件的內容超出上下文容量 | 一般缺陷 | 未測量 |
| Monet 成熟的 TB2.1 harness | 未列出 | +7.7(受 effort 混淆),+2.9(層級相符) |
| Wang 等人的最小種子:一個 bash 工具,沒有技能、沒有 middleware——精簡,但用於終端機基準並非錯誤 | 無 | 留出集 +0.6 |
WAI 自身表格也呈現相同規律:演進後的 harness 在十個應用程式上的分數集中於 84.0–98.3%(平均 93.0),而基礎版本則介於 20.0–95.8%(平均 43.5)。每個應用程式的增益都接近「滿分減基礎分數」;基礎分數原本就高的案例(Elation 臨床紀錄,95.8),增益只有 +0.9。因此 +49.5 的頭條數字衡量的是起始 harness 表現不均,而非能力全面提升。
這是本頁既定判決的第四個獨立印證,來自看似最可能推翻判決的來源:迴圈會修復故障,卻不會萃取設計原則。 Wang 等人 §5.1 的診斷(「編輯內容記住修正方法,而不是萃取策略……在代理程式原本已能解決的任務上節省時間,卻很少把失敗轉為成功」)與 DarwinX 的最大成果,其實是同一現象的兩種描述:一方衡量沒有可修復項目的迴圈,另一方則讓迴圈接手一個嚴重不合適的 harness。兩個來源的結論可以同時成立,無須否定其中任何一方。
DarwinX 帶來其他資料都沒有的內容:首次跨測試套件遷移測量(在 SWE-bench Verified 上,原封不動地執行經 TB2.1 演進的 harness,且採用不同基礎模型家族);首個將合併運算子明確定義為聯集涵蓋率接受測試的檔案庫;也是第一篇將反作弊稽核列為主要結果,而非提示條款的 harness 演進論文——它採用兩階段的靜態分析加 LLM 偵測器,涵蓋率達 99.0–99.4%,演進後 harness 在評估平面、特權主機和漏洞利用類別上的問題都降到零。就Reward Hacking而言,這是目前最有力的證據,顯示以保留為基礎的選擇不會獎勵驗證器作弊:370 條獲獎勵的 TB2.1 軌跡中,有兩條被標記,其中一條是誤報;唯一確認的捷徑則是單次試驗中的政策失誤(從任務自身已公開的 README 讀取答案),同一 harness 在另外四個樣本中的三個都正當地解出任務。
第六個案例,也是唯一回報高原期之後發生什麼的案例(Shopify,2026 年 8 月)#
Shopify 的 Sidekick 說明(McNamara 與 Mazza-Anthony,Shopify Engineering,2026-08-05,case-study——第一手資料、未經複驗、沒有控制組或留出集,因此證據等級與 Cline 相同,低於三個 empirical 來源)增加了一個案例:它的數字在此無用,但其形態是最有參考價值的部分。
這個設定與本頁的迴圈相同,並以最清楚的方式說明為何只調整提示並不足夠:目標*「本身已是正式環境中的應用程式,動態組合的提示、自訂控制迴圈,以及專用編排分散在龐大的程式碼庫中。沒有任何單一提示能決定其行為,因此提示調整只能觸及系統的一小部分。最佳化目標是整個 harness:其提示、工具定義與編排程式碼。」* 這個迴圈明確採用Karpathy式的自主研究流程——提出編輯、依據指標評估,「分數提升就保留變更,否則便捨棄」——並以一份 program.md 設定,授予對 prompts/、tools/ 和 harness/ 的編輯權限,並註明*「這裡的所有內容都可以編輯,包括 harness。」*
它帶來三項貢獻:
它透過架構與設計真正做好了解耦。 評估指標是經獨立校準的 LLM 評審,最佳化代理程式沒有其目錄的寫入權限——代理程式可存取的目錄是 prompts/、tools/、harness/,評審不在其中。這比 Cline 的提示條款不變條件及 DarwinX 的「同領域搜尋即報告集」安排都更完善。相對地,它的另一個弱點是評審屬於學習得來的評量工具;原始一致率為 80%,人類上限為 83%,因此最佳化器雖不能編輯評分器,仍能鑽評分器的噪音,而說明中沒有提到迴圈中途會重新驗證評審。
它是唯一回報迴圈終止,以及團隊後續行動的來源。 上述每個案例都在分數收斂、達到顯著性下限,或 PR 合併時結束。這裡則是:「一旦 harness 改善進入高原期,我們便開始在參數空間中最佳化。」 論文沒有公布高原期的數值——沒有分數、輪數或支出——因此這是主張,不是測量結果。但它是正式環境團隊明確陳述的順序,也從另一面印證本頁既定判決:如果迴圈只能修復故障,而無法萃取設計原則,那麼成熟的 harness 就很少有可修之處,報酬也應逐漸耗盡。Shopify 表示他們確實遇到了高原期,接著轉換改善目標,而非增加搜尋預算——Knowledge-Centric Self-Improvement整理了這項分類,Agent Quality Flywheel則記錄延續下去的迴圈。
這是「起始 harness 有多糟」規律的第六個資料點,方向吻合,但缺少幅度。 Shopify 的起始 harness 是已在正式環境運行的系統,每分鐘最多服務 2,000 個請求——遠比資料集中其他種子成熟——而回報的 harness 階段結果是進入高原期,也就是可能最小的增益,與上表一致。它無法列入該表:沒有留出集、沒有基準數值,也沒有任何單獨呈現自主研究階段的增益數字。只記錄為方向性支持,不列為表格項目。
第七個案例:人工 PR 門檻,以及修復前先出現的紅燈測試(Bridgewater,2026 年 7 月)#
Bridgewater Associates 的 PAT(How Bridgewater Built an AI Analyst That Does Hours of Expert Research in Minutes,case-study,第一手會議演講,完全沒有數據)是部署在避險基金中的迴圈;它帶來本頁其他案例都沒有的兩項結構細節,也為這兩項細節提供了整個資料集裡最薄弱的證據。
修復之前,代理程式會自行撰寫一個失敗的基準測試。 在 Teach press 中,或由背景代理程式自主挖掘已完成的投資者對話,迴圈會先*「建立一個預期會失敗的基準測試,以證明我們能重現這種糟糕行為。」* 然後才*「反覆調整我們的上下文儲存庫或 harness 本身,直到基準測試通過」*,最後重新執行其餘測試套件以檢查是否回歸。本頁其他案例都是對既有指標進行最佳化;這個案例則會先製造出具辨別力的測試,再動目標,這就是分數提高與缺陷被重現並修復之間的差異。它也是目前最便宜、能防範本頁反覆提及的失敗模式的方法——最佳化器追逐評分器的噪音——因為針對特定重現行為的紅燈轉綠燈測試,所能支持的主張範圍遠比整體分數上升窄得多。
人工把關設在 PR 審查,而非基準測試撰寫階段。 迴圈會輸出一則 Slack 訊息,內含一份 pull request,列出對 PAT 上下文與 harness 的提議變更。與其他案例的把關位置相比:HarnessBank 在封存分割集把關,Cline 沒有公布把關點,Ouroboros 則完全沒有把關點。差異檢視是這些案例中最強的實務控制——變更上線給數百名使用者之前,人類能準確看到改了什麼——同時也是最弱的證據,因為核准差異不等於衡量影響。演講沒有回報接受率、拒絕原因,也沒有任何一組前後分數。
作為「起始 harness 有多糟」規律的第七個資料點,它無法使用。 種子 harness 是成熟的正式環境系統,每天有數百名使用者,依此預測增益應該較小——但無論增益或損失都沒有回報,因此無法填入表格。它所印證的是 Shopify 更上一層的結構性觀點:最佳化目標是*「我們的上下文儲存庫或 harness 本身」*,也就是整個系統,而非單一提示;在該程式碼庫中,沒有任何單一提示能決定行為。
證據權重:這是本頁控制程度最低的案例。一場由建置者主講、內容關於自家產品的演講,並附有公司免責聲明,表示討論的效益不保證能實現。此處納入它,是因為它的機制——紅燈測試和 PR 門檻是可移植的設計選擇——而非任何關於成效的主張。
本頁所需的拆解:更新不等於受益(主要來源,2026-09-18 閱讀)#
上文七個案例都在討論迴圈能否產生更好的 harness。Lin、Wu、Wang 等人(arXiv 2605.30621,作者共 17 人,來自 Penn State、UC Santa Cruz、Emory、Northeastern、UIUC 和 Amazon,2026-05-28,empirical)把問題拆成兩個部分,而這項拆解解釋了七個案例都無法說明的現象。本文最初是經由 2026 年 9 月 RSI 調查報告 §3.5.2(arXiv 2609.11873)間接得知;現在主要來源已納入資料集,本節依據該來源撰寫。
拆解如下:harness 更新能力是根據執行證據產生實用、持久的 harness 更新的能力(屬於演進器的特性);harness 受益能力則是使用更新後的 harness 解題並因此獲益的能力(屬於代理程式的特性)。研究將七個 LLM 主幹模型與三個代理程式基準交叉測試——SWE-bench Verified(500 項任務)、MCP-Atlas(500 項任務、36 個真實 MCP 伺服器、220 個工具)及 SkillsBench(86 項任務,每項皆使用確定性驗證器)——所有代理程式/演進器組合都固定提示範本、初始 harness、任務串流、軌跡視窗、演進預算和回合上限,並在實際執行時評分(每項任務都使用尚未採納該任務證據的既有 harness 評分,因此沒有任務會替自身衍生出的 harness 打分)。
演進器端表現平平,9B 模型寫出的技能也相同#
固定解題代理程式,改變更新撰寫者,幾乎沒有差異。最佳與最差演進器之間的差距,在任何一項基準上最多只有 3.1 個百分點,而且沒有演進器能在三項基準上全部勝出——Qwen3-235B 在 SWE 領先 8.2 pp,在 MCP 卻敬陪末座,僅有 0.6。模型規模無法預測結果方向:研究中最小的模型 Qwen3.5-9B,在 SkillsBench 上取得最高更新增益 3.8 pp,高於 Opus 4.6 的 2.3 和 Qwen3-235B 的 1.5。
機制透過 SkillsBench 的 flink-query 任務案例研究呈現,代理程式主幹固定為 Opus 4.6。沒有演進技能時,代理程式會漏掉 FINISH 事件篩選,得分 0.67;有 Qwen3.5-9B 或 Opus 4.6 產生的技能時,分數都是 1.0。並排檢視兩項技能,會發現它們在程序上同構——相同的五個步驟(篩選 SUBMIT、篩選 FINISH、分別計算每個 SUBMIT、輸出 (jobId, count)、套用 10 分鐘工作階段視窗),只在實作表面(對照 KeyedProcessFunction 進行手動批次工作階段化)和長度上有所不同,約 3,300 對 3,800 個字元。
演進後的分數主要由代理程式決定,而非演進器:七種演進器在同一代理程式內的差距,在 MCP 上最多 5.1 pp;Opus 與 Qwen3-235B 的基礎能力則相差 36.0 pp(SWE 為 5.0 對 53.5;SB 為 9.3 對 20.9)。即使讓最弱的錨定代理程式搭配其最佳演進器,對上最強錨定代理程式搭配其最差演進器,強者在每項基準上仍領先 18.6 至 35.2 pp。在 SkillsBench 上,同一個 Qwen3.5-9B 模型同時是 Qwen3-235B 的最佳演進器,也是 Opus 的最差演進器。
代理程式端呈非單調變化,峰值落在中間#
| 代理程式 | SWE 基礎 | SWE ∆ | MCP 基礎 | MCP ∆ | SB 基礎 | SB ∆ |
|---|---|---|---|---|---|---|
| Qwen3-32B | 3.6 | 4.4 | 3.6 | 1.0 | 0.0 | 5.8 |
| Qwen3-235B | 20.7 | 19.3 | 25.0 | 4.3 | 4.7 | 1.1 |
| GPT-OSS-120B | 26.2 | 15.8 | 28.0 | 7.0 | 0.0 | 7.0 |
| Haiku 4.5 | 66.0 | 2.4 | 42.4 | 3.6 | 5.8 | 15.1 |
| Sonnet 4.6 | 73.2 | 2.8 | 54.0 | 3.2 | 24.4 | 3.5 |
| Opus 4.6 | 74.2 | 2.6 | 61.0 | 3.6 | 25.6 | 5.8 |
(基礎通過率 %,∆ 表示增益百分點。表 1,第 6 頁——匯入時以 pdftotext -layout 逐格核對,並由附錄完整的代理程式 × 演進器矩陣獨立重現。)
呈倒 U 形。峰值在中階——Qwen3-235B 在 SWE 上 +19.3,GPT-OSS-120B 在 MCP 上 +7.0——而兩端的增益都低,原因卻不同。高端是天花板效應:強模型本來就能解出這些任務。低端則不是,因為弱模型有最多提升空間,獲益卻最少。這個低端差距正是Harness Activation and Adherence所測量的;它可拆為兩種情形:成果根本沒有進入上下文(SkillsBench 技能載入率,Qwen3-32B 為 0.251,強模型層級約為 0.96),以及成果進入上下文卻未被遵循(harness 遵循率為 0.142,強模型層級則為 0.757)。Qwen3-235B 是清楚的分界例:載入可靠度與 Opus 4.6 相當(0.961 對 0.957),但遵循率不到一半(0.350 對 0.757)。
論文對建置這類迴圈的人的建議是:把能力預算配置給解題代理程式,而非演進器。
這對本頁既定論點的影響#
本資料集的判別因素一直是起始 harness 有多糟——這是種子的特性。新研究補上了使用者端的特性:即使修補內容很好,若解題代理程式從未取用,或取用後忽略,也毫無幫助。上文三項結果可以從這個角度重新閱讀。Wang 等人 §5.1 認為編輯內容會「記住修正方法,而非萃取策略……在代理程式原本能解決的任務上節省時間」;這是從成果一側觀察到的啟用失敗——記住的修正只會在它所記住的任務上啟用。HarnessBank 的啟用檢查(每項修補都要宣告啟用規格,並產生確定性訊號;未曾觸發的 harness 無論分數看起來多好都會遭拒)是資料集中唯一直接測試第一種情形的門檻,現在也獲得一項獨立研究支持,證明這種情形相當普遍。DarwinX 的31.7 個百分點代理指標/真實結果落差——最符合迴圈內代理指標的變體,不是最能泛化的變體——則呈現了第二種情形,因為沒有人把兩者區分開來。
本資料集中沒有其他來源把啟用與忠實使用當作主要衡量項目。 HarnessBank 設有啟用門檻,卻沒有回報比率;其他案例都只回報端到端分數,因此無法區分「更新本身不好」與「更新沒有效果」。
但主要來源也縮小了這項假設的適用範圍,這是調查報告摘要沒有帶出的部分。本頁所有負面結果都來自前沿模型——Wang 等人在 Terminal-Bench 2.1 上的三個前沿主幹模型、DarwinX 的 Monet、Cline 的 Kimi K3。在這個層級,Lin 等人測得的啟用率約為 0.96,遵循率為 0.73–0.76。因此,未啟用並不能解釋本頁的負面結果;它解釋的是本頁尚未測試的模型層級所出現的失敗模式。兩個來源真正一致的地方更值得關注:Lin 等人在前沿層級測得相較於不演進基線,SWE 和 MCP 上只提升 +2.4 至 +3.6 pp,與 Wang 等人在預算相符條件下發現的幾乎毫無增益相同。真正的提升完全出現在中階——Qwen3-235B 與 GPT-OSS-120B 在 SWE 上增加 +15.8 至 +19.3 pp——而 Wang 等人從未測試這些模型。目前浮現的新可能性是:預算相符的負面結果反映的是前沿模型,而非 Terminal-Bench。
以下兩點是來源明確未提供的內容;不應因此把它解讀為方法獲得證明:
- 完全沒有任何預算相符的基線。 此處所有 ∆ 都是相較於
NONE組測得——也就是同一代理程式未經演進的情況——從未與將演進算力用於平行取樣或額外嘗試相比。Large-Scale Test-Time Compute 對 Wang 等人的批評仍未處理。 - 完全沒有算力帳目。 協定表示每一組共用「相同的演進預算 β 和每項任務回合上限」,但論文及附錄都沒有公布 β 的數值、回合上限、軌跡數、token 數或美元金額。因此,這是本資料集中第三個固定搜尋預算卻未以任何可供他人比較的單位回報預算的來源(另兩個是 DarwinX 和 Wang 等人)——這正是下文預算待解問題的前提,而非答案。
對照主要來源核查調查報告的第二手說法#
這是 2026 年 9 月 RSI 調查報告自行根據主張整理到此知識庫的約 15 項發現中,第一項經過主要來源查讀的結果。調查報告的描述成立。 報告的五項主張——雙能力拆解、提示與預算相同的固定協定、更新能力與基礎模型能力大致無關且小模型可匹敵前沿模型、受益呈非單調變化,以及兩種失敗模式——都符合來源內容。兩項範圍修正則都縮小了原先說法:
- 調查報告無條件地說「失敗集中在兩種模式」。論文只把弱模型層級的差距歸因於啟用與遵循;強模型層級的不足是天花板效應,根本不算失敗模式。
- 「提示與預算相同」是正確的,但預算沒有量化——見上文算力帳目缺失一節。調查報告的讀者很可能會合理地以為預算數值已公布。
調查報告有一點是簡化了,而非說錯:SWE 和 MCP 上的非單調模式很清楚,但在 SkillsBench 上較不穩定;論文承認,基礎分數偏低的情況不穩定——Haiku 4.5 在 SB 上取得最大增益(+15.1),Qwen3-235B 的基礎分數同樣偏低,卻只提升 1.1。論文 §D.2 明確指出這點,但調查報告的一句話摘要沒有提及。
這是調查報告作為閱讀清單可靠度的良好案例,但不能推廣到其他項目:這是它摘要最詳盡的一項,其他約 14 項仍未核查。
調查報告對文獻盤點的補充,以及它漏掉的內容#
它的 L2/L4 harness 清單點名了本頁尚未收錄的四個系統:Self-Harness(執行軌跡 → 小幅 harness 編輯,只在回歸測試後保留——調查報告的 L2 代表);Agentic Harness Engineering(harness 元件是可分別編輯、還原的檔案,每項提議變更都會依據其預期效果檢查,另設演進器角色,降低迴圈相較於 Self-Harness 的自我參照程度);HarnessDev(建立者代理程式從最小種子建置 harness,候選版本會凍結,並在隱藏任務上評估成功率與執行器 token 成本;建立者與執行器分開,讓各 harness 能在同一固定執行器下比較);以及 Evo-Harness(把失敗或評估結果為負的任務整理成跨任務模式與任務專屬程序)。HarnessDev 的協定最接近本頁評分最高的封存分割加成本紀律;而把成本列為評分面向的做法,是此處其他研究都沒有採用的。
調查報告沒有引用 HarnessBank、DarwinX 或 Wang 等人。 因此,定義本頁爭議的三項結果——兩個最強的封存分割增益,以及唯一完整套件下預算相符的負面結果——都沒有出現在一份論文盤點中;該盤點發表時距離最後一項結果僅六週。這讓人應該把調查報告對 L2 的判決視為閱讀清單,而非完整盤點;也是本節第二次遇到相同缺口:調查報告對 harness 自我演進的正面描述,依據的是那些在同領域測試中回報結果的文獻。
比本頁其他地方更精確的效度警告#
§3.3.4 值得引用,因為它最清楚地描述了Compute-Controlled Benchmarking與Evaluation Awareness & Grader Gaming所共同指出的威脅:
反覆存取開發集會造成基準過度擬合,額外搜尋算力可能被誤認為演算法改進,而 LLM 評估器可能與提案者有相同盲點。公開的自動化研究系統讓這些風險具體呈現:已回報的行為包括挑選隨機種子、尋找捷徑,以及透過反覆查詢評估器企圖取得測試標籤。一旦基準被自適應地反覆查詢,它實際上就會成為最佳化表面的一部分,而非被動的測量工具。
挑選隨機種子和擷取標籤這兩項觀察,來自 Anthropic 自己的自動化弱轉強研究者。最後一句則出自調查報告;它概括了上文對 DarwinX 的指控——在同一基準上搜尋並回報,與其說是協定缺陷,不如說是改變了這個基準的角色。
第八個案例:harness 演進可以向上遷移,但用它教較弱模型會破壞已取得的適配(Salesforce,2026 年 9 月)#
上文所有遷移結果都在問,把 harness 原封不動交給另一個模型後,能否繼續派上用場。Yu、Bi、Pentyala 等人(arXiv 2609.09134,Salesforce AI Research,2026-09-08,empirical)接著問:接收模型再被更新至更像這個 harness 最能發揮作用的使用者時,會發生什麼?答案是前半段明確正面、後半段則大幅負面;使用的任務套件也是本頁此前未測試過的:七項企業代理程式任務(薪資稽核、預算核准、庫存警示、IoT 異常偵測、瀏覽器自動化、網站管理、程式碼重構),取自 Yang 等人 [2026],並以 GEPA 式搜尋演進(gemini-3.1-pro-preview 擔任元代理程式提案者,只在驗證結果改善時保留編輯),再以 LoRA-SFT(rank 16/64,H100/H200)調適模型。
向上遷移,結果明確。 以弱模型(qwen3-coder-30b-a3b,30B/3B 啟用參數)為目標演進 harness,使其平均測試成功率從 29.2% 升至 78.0%(+48.8)。將同一套 harness 原封不動交給能力較強的 gemini-3.1-pro-preview 專家模型,它不只勉強適用,還比使用自身基準 harness 時表現更好:從 84.4% 升至 93.6%(+9.2);在 93.6–100% 的軌跡中都會觸發演進後的編輯,其中包括一份領域運算指南,而弱模型本身僅在 30.8% 的時間使用它。這是跨越能力層級的真實向上遷移;harness 中獲認可的編輯是任務領域知識(API 慣例、算術流程、工具使用範例),而非調整推理預算的手段——這正是What Makes a Self-Improvement Artifact Transfer?預測能在解題器更迭後保留下來的類型。這也是比 HarnessBank 跨模型匹配法則更乾淨的正面結果,因為此處沒有任何內容是針對特定失敗問題調整的。
模仿會讓較弱模型的增益崩落。 自然的下一步,是讓較弱模型以演進後的 harness,對專家成功軌跡進行 LoRA-SFT;結果平均成功率從 78.0% 降至 63.1%(-14.9,七項任務全都下降,幅度 -4.2 至 -29.9),而且在第二個模型家族上也重現此結果(gemma-4-26b-a4b-it 在網站管理任務上,演進 harness 為 55.6%,SFT 模仿後降至 41.1%,甚至低於該模型使用預設 harness時的基準 46.7%)。同樣的配方在未演進的基準 harness 下反而有幫助(29.2% → 35.5%,+6.3,表 3),因此可確認失敗來自模仿與 harness 演進之間的交互作用,而非模仿本身。機制不是知識流失——SFT 後領域運算指南的使用率上升(30.8% → 76.1%),隱性知識占失敗的比例也下降(46.2% → 44.5%)——而是規劃缺陷在失敗中的占比,從 1.1% 跳升至 14.6%(表 3,已乾淨解析並與正文核對)。微調後的模型採用了專家的規劃風格,卻沒有足夠能力執行,也不再符合原本為弱模型逐步節奏設計的 harness 收尾契約;在一條追蹤到的薪資稽核軌跡中,SFT 後模型算出正確答案,卻在 78 個步驟中重複檢查 29 次,始終沒有發出完成訊號,得分為 0;基礎模型則能在 14–20 個步驟內乾淨收尾。
採用策略內校正即可修復,而且兩者能相輔相成。 不再使用專家的整段軌跡,而是讓一個自主的元層級 MLE 代理程式,從弱模型自己的每條軌跡中找出唯一失敗的回合,再請專家只改寫該回合(約 500 筆資料:400 筆修正,加上約 50 筆自行通過的範例),其他部分則保留模型原有的規劃分布。對這組資料進行 LoRA-SFT 後,平均成功率由 78.0% 升至 79.7%(+1.7),七項任務中五項進步;另外兩項可能已被 harness 推近飽和,結果則在雜訊範圍內。規劃失敗占比仍接近基礎模型的低點(1.1% → 1.8%),知識占比繼續下降(46.2% → 43.2%)。知識增益與模仿相同,但沒有造成規劃崩落。這並未補上與專家之間的全部差距;論文承認這很可能是輕量 LoRA 的上限,但訓練不到一小時即可完成,這也是論文主張將其疊加成迭代迴圈的理由:圍繞目前模型演進 harness,在該 harness 下依策略內資料更新模型,再進入下一輪演進。
這對本頁既定論點的補充。 資料集目前有兩個判別因素:起始 harness 有多糟(種子的特性),以及啟用/遵循(使用者的特性,依據上文 Lin 等人的研究)。這個來源再添上第三個彼此獨立的因素:harness 可以順利向上遷移,接收模型在更新權重後甚至能更常啟用它——但結果仍可能崩落,因為出問題的既非成果本身,也非成果是否觸發,而是特定權重更新能否讓解題器逐回合的節奏繼續符合 harness 的最終收尾契約。依 Lin 等人的啟用/遵循架構,此案例會被評為高啟用;這個失敗在該視角下無從察覺,只有檢視失敗模式的組成才會顯現。這也是第一個以實證研究(而非案例研究)為基礎,將Knowledge-Centric Self-Improvement持續性分類中的 harness 手段與權重手段放在同一組任務上,並證明兩者在直接結合時會互相衝突、經修正後則能相輔相成的來源——更完整的定位請見該頁。
第九個案例:將搜尋本身正規化,讓 harness 得以遷移(RRSI,2026 年 9 月)#
以上每個案例都在診斷演化到遷移之間的落差;RRSI(Peng Xia、Rujun Han、Zifeng Wang、Yanfei Chen、Yufan Zhang、Yoonho Lee、Chengsong Huang、Han Yu、Zhongying CuiZhu、Yifei Ming、Huaxiu Yao、Burak Gokturk、Tomas Pfister 與 Chen-Yu Lee — Google Cloud AI Research / UNC-Chapel Hill / Stanford / Washington University in St. Louis,arXiv 2609.24972,2026-09-21,empirical)是第一篇將落差視為正規化問題,並在此過程中以受控比較檢驗四種競爭演化方法的研究。它以不同名稱指出本頁不斷繞著打轉的三種相互牽連的失敗模式——針對基準的擬合、追逐雜訊、複雜度累積——並將傳統 ML 正規化轉化為對搜尋本身的限制,而非限制 harness 可觸及的空間;後者刻意保持開放(提示、控制流程、工具、記憶體、子代理程式仍然都可編輯)。
機制:對照論文明確提出的傳統類比。 提案端:L0 風格的退火式編輯預算限制單一候選項可捆綁的、可獨立歸因的編輯數量,依餘弦排程從 b_max(早期輪次,協同探索)降至 b_min = 1(後期輪次,可歸因的單一編輯);依據證據的信用分配記錄每個受評估候選項的元件、假設、差異與結果,讓提案器停止重測先前輪次已推翻的假設;結構化探索則在偵測到停滯時,保留部分預算給尚未觸及的元件。選擇端:洩漏評論器會在候選項進入評估前,拒絕其中編碼了任務名稱或基準專屬數值的內容(因此洩漏的候選項無法先取得膨脹分數,日後因而更具吸引力);調整雜訊的穩定性底線 Ŝ(H′) ≥ S* − δ,防止一連串個別幅度很小的退步累積;Ridge/L2 風格成本規則 ΔC ≤ β0 + β1·ΔS,在分數增益超過雜訊帶後,要求額外推論成本必須帶來相稱的分數增益;Lasso/L1 風格剪枝規則則標記在固定視窗內沒有嚴格正向測量增益的元件,將其列為刪除目標。這些方法都沒有真的最佳化 Lp 懲罰目標——論文明確指出,兩者的對應關係是結構性的,而非數學上的——但其形狀與 HarnessBank 的顯著性門檻,以及 Guo 等人提出的外生評估器論點,從不同角度得出的結論相同:搜尋可以自由提出假設;只有它無法靠說詞繞過的門檻才能給予信用。
本頁一直在要求的受控比較。 涵蓋三個領域的八項基準——程式設計(Terminal-Bench 2.1 evolve、SWE-bench Verified OOD)、代理式工作空間(Harvey LAB evolve 加上同分布留出集、JobBench/GDPval/APEX-Agents OOD),以及工程設計(EngDesign evolve、Frontier-Eng OOD,兩者都由凍結模擬器確定性評分,而非交由評審)——全程採用凍結的 Claude Opus 4.8 policy,並讓四種先前的 harness 演化方法(Meta-Harness、AHE、TTHE、HarnessX)從相同 H0、相同凍結 policy、相同演化集、相同候選預算開始執行:
| 方法 | Harvey LAB(演化) | Harvey LAB(同分布留出集) | JobBench | GDPval | APEX-Agents | OOD 平均值 |
|---|---|---|---|---|---|---|
| H0(未演化) | 89.4 | 86.9 | 36.0 | 48.8 | 34.2 | 39.7 |
| Meta-Harness | 93.0 | 89.2 | 37.1 | 49.1 | 35.7 | 40.6 |
| AHE | 90.7 | 88.7 | 37.2 | 47.2 | 33.1 | 39.2 |
| TTHE | 91.1 | 88.5 | 35.2 | 47.0 | 31.7 | 38.0 |
| HarnessX | 91.8 | 89.1 | 36.3 | 48.5 | 34.3 | 39.7 |
| RRSI | 90.5 | 89.2 | 40.7 | 52.3 | 37.9 | 43.6 |
Meta-Harness 是演化切分上最強的基準方法,但 OOD 僅增加 0.9 分;HarnessX 的 OOD 平均值恰好與 H0 相同;AHE 和 TTHE 最後都低於 H0,TTHE 低了 1.7 分。RRSI 在表中所有已演化 harness 中的演化集增益最小,卻是唯一 OOD 平均值比 H0 高出超過一分的方法——這正是設計中每項正規化機制都力求達成的取捨。看全部八項基準(Figure 3,摘要數字取自正文):演化集增益為 Terminal-Bench 2.1 的 +6.0、EngDesign 的 +4.9、Harvey LAB 的 +1.1;OOD 增益則包括從未在搜尋期間評分的 SWE-bench Verified 上 +1.8、Harvey LAB 同分布留出切分上 +2.3、JobBench/GDPval/APEX-Agents 上 +3.5 至 +4.7(相對增幅 7.2–13.1%),以及 Frontier-Eng 上 +4.3 Medal 分(相對增幅 24.3%)。所有留出切分都沒有退步——這正是會記住基準的 harness 所造成的特定失敗。
消融實驗分離出正規化器的哪一半在發揮作用,也顯示兩半缺一不可(表 2,代理式工作空間案例):
| 變體 | Harvey LAB(演化) | 同分布留出集 | OOD 平均值 | Token/試驗(M) |
|---|---|---|---|---|
| H0 | 89.4 | 86.9 | 39.7 | 1.56 |
| 未正規化演化 | 92.8 | 88.9 | 40.3 | 3.80 |
| 不含提案端正規化器 | 90.7 | 88.8 | 41.9 | 2.69 |
| 不含接受端正規化器 | 91.5 | 88.7 | 41.0 | 3.59 |
| RRSI | 90.5 | 89.2 | 43.6 | 2.42 |
移除接受端限制(洩漏評論器、穩定性底線、成本規則)後,演化分數從 90.5 升至 91.5,但 OOD 從 43.6 降至 41.0,成本也增加一半——不受限制的選擇器會把大部分接受的修改花在雜訊與上下文,而不是機制上。移除提案端限制只損失 0.2 個演化分數,卻損失 1.7 個 OOD 分數,顯示即使下游沒有任何候選項被拒絕,搜尋方向仍然重要。兩者都移除後,演化集分數是所有組別中最高的(92.8),OOD 平均值則與完全不做演化相差不到一分(40.3);每次試驗要用 3.80M token,而 RRSI 為 2.42M——未正規化的迴圈在受評分的切分上同時得分最高,卻在未見過的任務上幾乎等同完全沒有演化。
跨模型遷移,這是本頁既有配對定律最明確的新證據。 RRSI 在程式設計領域用兩種 policy 家族獨立執行(表 3)——Claude Opus 4.8(演化集 74.2→80.2,+6.0;SWE-bench OOD 82.0→83.8,+1.8)與 Gemini 3.5 Flash(演化集 64.6→78.7,+14.1;SWE-bench OOD 76.8→79.0,+2.2)——證明此方法並不依賴單一骨幹模型。更有力的結果(表 4)是將以 Gemini 3.5 Flash 演化出的 harness交給從未參與搜尋、規模較小的 Gemini 3.1 Flash Lite:Terminal-Bench 2.1 準確率從 11.2 升至 14.6,相對增幅 30.4%,而基準分數不到搜尋所用 policy 的五分之一。這直接構成 HarnessBank 上文所記錄跨模型配對定律的反例(推理預算槓桿的修補,在配對病理之外幾乎無效,甚至有害),也反駁 DarwinX 自身的跨模型不穩定性(相同程序換用不同基礎模型時輸給中性基準)——在此案例中,相同的正規化程序不需重新搜尋,就能幫助一個能力嚴格較弱、也從未接觸搜尋模型的 policy。論文尚未解決一個疑點:增益絕對值(+3.4)低於搜尋 policy 的增益(+14.1);這既符合「這些機制不依賴搜尋時的能力水準」,也可能表示較弱的骨幹模型留給任何修補的進步空間更少——RRSI 沒有反向測試(在弱模型上演化,再測強模型),因此無法區分這兩種解釋。
成本:RRSI 產生的 harness 比任何已演化組別都精簡。 每次試驗 26.3 步,四種基準方法為 27.3–34.6 步;AHE 是最極端的例子,每次試驗耗費 3.82M token(比 RRSI 的 2.42M 多 58%),OOD 分數卻少 4.4 分。沒有任何已演化 harness 比 H0 更便宜(1.56M token、21.2 步)——演化帶來部分增益仍須付出測試時運算成本,而正規化器會決定付出多少。
這是此文集第一篇公布完整、可比較搜尋預算表的 harness 演化論文。 表 5(附錄 D.1)列出每個領域的所有超參數——輪次 T(20/20/40)、每項任務的試驗數 k(2/2/4)、雜訊容忍度 δ(0.017/0.004/0.020,根據重複評估 H0 校準)、編輯預算範圍 b_min–b_max(1–4/1–3/1–4)、停滯視窗 w(3/3/3)、剪枝視窗 n_prune(4/4/5),以及成本規則係數 β0, β1。這無法解決下文 Wang 等人與 DarwinX 之間持續存在的搜尋預算爭議——系統不同,沒有共用單位——但它排除了「harness 演化的搜尋預算無法用其他實驗室可重現的單位報告」這種藉口;而本文的基準方法明確地以「相同候選預算」執行,Wang 等人、DarwinX 或上文 Lin 等人的比較都沒有做到這點。
文集的判別標準增加了第四個軸向。 本頁累積了三項可預測 harness 演化結果能否遷移的特性:起始 harness 有多差(種子本身的特性)、啟動與遵循情形(使用者的特性,見 Lin 等人),以及權重更新是否保留解題器對 harness 的適配(見 Salesforce 案例)。RRSI 增添了第四項,而且它是第一個透過消融實驗,而非跨來源比較,清楚隔離此特性的研究:搜尋程序本身受到多嚴格的正規化,同時固定種子 harness、基準套件與 policy 家族。上方的消融表就是直接證據——相同 H0、相同任務、相同骨幹模型,OOD 表現只因選擇器強制執行哪些限制,就從 40.3 變成 43.6。
證據權重。 單一實驗室的預印本(Google Cloud AI Research,與 UNC/Stanford/WashU 合作作者),尚未經第三方複現。提案器、評論器與分析器全都使用 Claude Opus 4.8——競爭對手的模型,而非 Google 自家模型——這稍微支持比較結果沒有偏袒自家模型。全程採用第三方基準(Harvey AI、Merrill 等人的 Terminal-Bench、Jimenez 等人的 SWE-bench、Guo 等人的 EngDesign、Chi 等人的 Frontier-Eng);八項基準中有三項(EngDesign、Frontier-Eng,以及 SWE-bench 的 fail-to-pass/pass-to-pass 門檻的一半)採用確定性評分,而非評審評分,堵住了 DarwinX 工程組同樣堵住的評審操弄途徑。相對地,最終報告數字完全沒有顯著性檢定、誤差棒或信賴區間——內部雜訊帶 δ 會在搜尋期間決定哪些候選項能留下,卻從未用於上方表格報告的演化/留出比較,因此 RRSI 在這項限制上與 Wang 等人和 DarwinX 相同,而非與 HarnessBank 相同(後者直接對報告數字使用成對 z ≥ 1.96 門檻)。論文完全沒有報告美元成本,只列出 token 數與步數。論文自己的限制章節承認其骨幹模型凍結的研究範圍(沒有任何權重在演化期間更新的設定——這正是 Salesforce 案例測試的組合),也承認需在「架構、工具生態系與執行時間大幅不同的代理程式」上進行更廣泛的驗證。表 6 的質性案例研究範例(說明接受/拒絕理由——第 0 輪的成本規則拒絕、第 8 輪的底線拒絕、資源成長幅度低的工程控制流程修正獲接受)在匯入時帶有柔性的表格折疊解析標記;周邊正文敘述相同輪次,佐證了這些例子所示的模式,但此處不將該表個別儲存格的數值視為關鍵證據。
Cline 的實驗,以數字呈現#
Terminal-Bench 2.1、透過 OpenRouter 使用 Kimi K3,基準為原始 Cline harness:
| 執行 | 分數 | 成本 |
|---|---|---|
| 基準(原始 harness) | 69/89 — 77.5% | $79 |
| 合併候選版本 | 77/89 — 86.5% | $65 |
| 確認執行 | 79/89 — 88.8% | $49.8 |
分數上升的同時成本下降,這才是機制上有意思的部分:大部分增益來自不再把 token 浪費在注定失敗的重試、自我終止,以及迴圈偵測器誤判而中止的情況。Cline 的比較基準——同一基準上 Claude Fable 5 成本為 $552、GPT-5.6 Terra 為 $400——並未控制 harness(見 Compute-Controlled Benchmarking),因此價格比率比較的是一個調校過的 harness,與這些數字背後不明配置的成本。
代理程式依序執行了五項實驗:
- 推理力度抽象層——harness 悄悄將 K3 的
max推理力度降為high。這是正確性修正,沒有計入分數(OpenRouter 原本就會映射到唯一支援的力度),但它讓後續工作得以進行。 - 速率限制重試——五次基準失敗都是單次 OpenRouter 429,導致正常工作階段終止。增加重試次數並採用指數退避;五次全部翻轉為成功。
- 依輸出判斷迴圈——迴圈偵測器會殺掉正在正常輪詢長時間背景工作的代理程式(命令相同,輸出不斷改變)。讓偵測器讀取輸出,不再只看命令;兩項任務翻轉為成功。
- 非同步工作者存活狀態——一項任務執行 7.6 秒後退出,token 數為零:任何包含
@a這類 token 的提示,都會觸發對未引用非同步工作者的檔案提及查找,程序在呼叫模型前便退出。一行修正,確定性翻轉。 - 追蹤 PID 以防自我終止——兩項任務執行
pkill -f,使用的模式符合 harness 自己的命令列,因而在任務中途殺掉自身。加入追蹤 PID 的工具指引;兩項都翻轉為成功。Cline 表示此修正減少了但沒有消除廣泛比對造成的終止。
每項修正都是一般性的 harness 錯誤,不是依基準特製的案例——這是 Cline 主張未發生 Reward Hacking 的理由,也是這篇文章最有力的論點。
受控版本:HarnessBank(Luo 等人,2026)#
Cline 實驗缺少的每項要素——封存測試集、以相同預算比較競爭方法、消融自身選擇規則——都是 HarnessBank 所提供的(HarnessBank: Semantic Gene-Bank Search with Gated Verification for Agent-Harness Self-Evolution,EverMind AI / Shanda Group,empirical)。它是此文集中首次對這個迴圈進行外部、受控評估的研究。
其架構將 Cline 原本合在一起的四項職責分開:
- 任務代理程式——凍結的骨幹模型(預設為 Qwen3.6-27B),在目前的 harness 下執行基準任務;
- 演化代理程式——來自不同供應商的另一個模型(Claude Opus 4.8),會讀取執行軌跡、指出反覆出現的失敗,並撰寫衍生 harness;
- 確定性評估器——負責抽樣、評分、啟動記錄與統計檢定;
- Harness Gene Bank——衍生自 MAP-Elites 的品質多樣性檔案庫。
Harness 分為不可變核心(評估、帳務、自我演化與介面關鍵程式碼)以及演化器可編輯的可變表層:提示、注入知識、執行時控制邏輯、設定。每個領域都有互斥的訓練/測試切分,測試集只會在演化結束後使用一次。
基因庫依語意索引,而非依任務索引。 每個儲存格都是一組配對——修補作用的位置(prompt、knowledge、runtime、config)×其存在的原因(從失敗軌跡推得的病理,例如 thinking-runaway)。假設相同病理的 harness 在同一儲存格內競爭,只有最佳者能留下;處理不同病理的 harness 則都保留,以便日後重新組合。父代選擇偏重品質(在原始 harness 與基因庫中取效用值最高者),因此會沿用最強血統,同時讓檔案庫避免丟棄結構不同的解法——這是論文對搜尋坍縮的解法,也就是貪婪式演化並保留迴圈容易收斂到狹窄一類安全提示編輯的傾向。論文明確說明採用此索引方式的理由:依任務索引的檔案庫「會保留依用來選擇它們的任務索引的 harness,這種設計必然會過度擬合」。
Gated Harness Screening 正是本頁缺少、而此系統內建的控制。 候選項不會全部在完整訓練集上執行,而是先在抽樣子集上依序通過四項檢查:
- 有效性——沙箱當機與驗證器逾時會觸發修復並重試,不會被評為代理程式失敗。
- 啟動——每個修補都要宣告啟動規格並發出確定性信標;無法啟動的 harness 屬於「無效」,無論分數看起來多好都會被拒絕。
- 成對顯著性——在相同任務上,計算與父代的任務層級成對差異,要求 z ≥ 1.96(雙側 5%)。
- 增益——估計改善必須為正值。
(導言稱這四項為門檻;§3.3 則實作三個相乘的指標,把增益檢查併入顯著性門檻,作為其中的 Δ̂ > 0 因子。檢驗相同,只是記帳方式不同。)
只有通過的候選項才會在完整訓練集上評估,並競爭基因庫儲存格。值得借鑑的設計原則是:**LLM 可以自由提出假設,但只有門檻才給予信用。**原因標籤明確是「由 LLM 指派的假設,而非真實標籤」——在 AppWorld 上,迴圈將能力上限誤診為知識缺口,而門檻拒絕了因此產生的修補(在其目標任務上仍為 0/24 → 0/24,p = 1.0)。錯誤標籤只會影響哪些候選項獲得嘗試機會,因此代價是多測一個遭拒候選項,而不是得到一個糟糕的 harness。
結果,以及它們讓競爭者付出的代價#
七個領域,Pass@1 取 K = 3 次嘗試的平均值,並在演化代理程式從未見過的任務上測量:
| 基準 | 測試 Pass@1:原始 → 演化後 | 增益 | 訓練→測試保留率 |
|---|---|---|---|
| AppWorld | 41.3 → 56.7 | +15.4 | 86% |
| BrowseComp+ | 16.9 → 30.8 | +13.9 | 86% |
| LiveCode | 58.1 → 71.8 | +13.7 | 65% |
| Omni-MATH | 54.3 → 66.0 | +11.7 | 92% |
| TB2 | 36.1 → 45.4 | +9.3 | 148% |
| GDPval | 43.7 → 52.9 | +9.2 | 110% |
| SWE-bench | 47.4 → 52.6 | +5.1(不計分:n=26,z=0.78) | 37% |
七項中的六項在留出任務上達到 z ≥ 1.96(p 從 <10⁻⁴ 到 0.033;AppWorld 最強,z = 6.44,n = 168),每項都只有一次留出比較,因此演化期間大量候選比較不會使結果膨脹。所有計入的領域在 Pass@3 上也都有提升(+5.5 至 +15.4),因此 harness 擴大的是可解任務集合,而不只是每次嘗試的命中率。作者不把保留率視為檢定——它是兩個帶有雜訊的估計值相除——而是以計入的留出增益作為主張依據。
兩種基準方法採用同一套流程執行:相同凍結骨幹模型、相同切分、相同成對 2σ 標準尺,每個領域的預算差距都在 2.1 倍以內(780–2,310 次 rollout;GEPA 在兩個領域的支出高於 HarnessBank,DGM 則在一個領域較高)。在五項封存測試中,HarnessBank 有四項獲得認可,DGM 一項,GEPA 零項:
| 測試 Pass@1 | 原始 | HarnessBank | GEPA(僅提示) | DGM(無門檻) |
|---|---|---|---|---|
| AppWorld | 41.3 | 56.7 | 44.0 | 52.0 |
| LiveCode | 58.1 | 71.8 | 58.1 | 59.8 |
| Omni-MATH | 54.3 | 66.0 | 54.3 | 53.2 |
| BrowseComp+ | 16.9 | 30.8 | 19.0 | 21.2 |
| SWE-bench | 47.4 | 52.6 | 47.4 | 56.4 |
兩種基準方法都以本 wiki 一直討論的方式失敗:
- GEPA 僅調整提示,五個儲存格中有三個直接採用原始版本。 在 47 次迭代中,它找不到任何在 LiveCode 上勝過種子版本的變體,因為「thinking-runaway 無法靠提示處理」;在部分勝利空間可由提示表達的 AppWorld 上,訓練增益到了封存測試便消失(+2.8,z = 0.97)。這類問題的增益並不在提示裡——直接反駁了 harness 最佳化主要就是提示最佳化的假設。
- DGM 公開採用自我修改,卻未設門檻,結果部署了退步版本。 它只成功一次(AppWorld +10.7,z = 3.00)。在 LiveCode 上,它從 15 個世代中,依據 15 個任務、K=1 的結果尖峰(0.733)選出最佳版本;重新評估後退至 0.533,最終未獲認可(z = 0.66)。在 Omni-MATH 上,它部署的 harness 比原始版本差(-1.1%)。這就是沒有顯著性門檻時,「保留看似有益的東西」所帶來的結果。
論文也如實呈現對自身不利的結果:在 SWE-bench 上,DGM 的原始分數 56.4 是表中最高值;但 n = 26 時,門檻不認可任何一種方法。另請注意,HarnessBank 作者以自己的流程重新執行兩種基準方法——這是標準做法,也附帶標準保留事項。
消融實驗:門檻實際帶來什麼#
在 TB2 上消融成對 2σ 門檻,可區分它可能發揮的三種作用(第一列以下均為相對於它的差異):
| TB2 設定 | 測試 Pass@1 | 錯誤菁英 | 停止輪次 |
|---|---|---|---|
| HarnessBank(K=3,2σ) | 45.4 | 0 | 10.0 |
| 不含 2σ | ±0.0 | +2 | >20(上限) |
| 不含確認 + 2σ | -1.6 | +3 | >20(上限) |
| 原始版本 | -9.3 | — | — |
部署結果沒有變化——訓練集上取分數最高者本來就會選中勝出機制——因此在此領域,門檻並沒有帶來摘要分數增益。它帶來的是檔案庫和停止規則。沒有門檻時,兩種雜訊機制會成為菁英(其中一種毫無作用,啟動信標從未發出),錯誤菁英接著會成為父代,讓未來預算浪費在雜訊上。終止結果非常明確:採用單次執行或 K=3 平均值給予信用時,收斂後輪次中有 62–76% 會出現虛幻進展,因此迴圈無法達成停止條件,只能一直跑到上限;成對 2σ 則會在最低 10 輪時停止。未經驗證的自我演化迴圈不只是可能產生糟糕的 harness——它根本無從得知自己何時已完成。
另外兩項佐證:接受的編輯涵蓋四種槓桿,而不只是提示;在大多數領域中,獲得認可的 harness 會堆疊來自多個儲存格的機制,而每個儲存格的菁英項能讓第二個機制保留到足以重新組合。訓練集選擇是泛化表現的下限——在 GDPval 上,訓練排名低於勝出者的變體,測試分數反而最高(+11.5%,勝過 +9.2%),這正是應在留出資料上計入信用,而非相信訓練排名的理由。
演化後的 harness 是針對單一模型調整的修正#
最重要的結果是負向遷移。從其他骨幹模型冷啟動後,迴圈會演化出不同的 harness,各自針對該模型的主要病理;修補遵循病理 → 修補配對定律(測試 ΔPass@1;粗體為配對修補):
| 領域 | 模型 | 主要失敗 | 修補 A | 修補 B |
|---|---|---|---|---|
| AppWorld | Qwen3.6-27B | 空的「engagement」回合 | verify-finalize +15.4 | submit-verify +1.2 |
| AppWorld | 397B | 粗心錯誤 | verify-finalize +0.2 | submit-verify +13.6 |
| AppWorld | Gemini 3 Flash | 粗心錯誤 | verify-finalize +5.8 | submit-verify +13.5(z=4.15) |
| Omni-MATH | Qwen3.6-27B | 想太多 | 27B 堆疊 +11.7 | raise-reasoning +1.7 |
| Omni-MATH | 397B | 思考失控(相同) | 27B 堆疊 +11.0 | raise-reasoning +0.7 |
| Omni-MATH | Gemini 3 Flash | 想得太少 | 27B 堆疊 -1.5 | raise-reasoning +15.3 |
三點解讀:
- 離開配對對角線後,修補幾乎沒有作用;方向錯誤還會造成傷害。 Gemini 與 397B 在 AppWorld 上有相同病理,並在不同模型家族間重現「粗心 → 檢查清單」的配對;在 Omni-MATH 上,兩個 Qwen 世代都會思考失控,因此 27B 演化出的堆疊幾乎無損地遷移(遷移後 +11.0,原生為 +11.7)。但 Gemini 想得太少,因此移植過去的修復從未啟動(-1.5);其配對修補則把相同槓桿朝反方向調整,得到 +15.3。若將方向調反並疊加在演化後的 397B harness 上,代價為 -15.7。兩個模型家族需要同一槓桿朝相反方向調整。
- 這是凍結模型的真實失敗模式,不是評分假象。 在五個領域中,單一病理佔原始版本失敗的 49–88%;配對機制在確定性與評審式驗證器下都獲得認可。
- 有一個測試時擴展組別,而且表現較差。 在 LiveCode 上,無論是 16 倍 token 預算或全面關閉思考,都無法重現演化 harness 的增益——獲認可的機制只會在思考失控之後停用思考。在這個領域,多花運算資源無法替代特定的控制流程修正(Large-Scale Test-Time Compute)。
因此可遷移的資產不是 harness,而是診斷 → 搜尋 → 驗證的流程:「獲認可的 harness,是針對模型調整的修正,而非普遍適用的設定。」
解釋此結果的對比:知識會遷移,harness 不會#
另一項 empirical 來源比 HarnessBank v1 晚六天發表,針對不同的持續性產物,報告了相反的遷移結果。Knowledge-Centric Self-Improvement(Wang 等人,Caltech,arXiv 2607.19592)凍結一套經整理的知識庫,而非 harness,並將它交給全新的模型家族,不再進一步整理;結果在留出任務的八個供給者—接收者配對中全數帶來正向提升,且在兩個跨家族方向上皆成立(Polyglot 8.3% → 20.0%,ARC-AGI-1 23.3% → 43.3%,為最強配對)。
兩項結果都是留出測試、都是單一實驗室的預印本,而且都沒有錯。能同時解釋兩者的關鍵是產物是針對什麼來調整的:
- Harness 修補是針對單一模型的失敗分布調整的。因此同一個推理預算槓桿必須對思考失控的骨幹模型調低,對思考不足的模型調高;移植修補則會損失 -15.7。上文的配對定律就是直接證據。
- 蒸餾出的洞見是針對任務領域調整的——ARC 網格不變量、Rust 以迴圈為基礎的傳播語意、測試執行器旗標。這些性質不受讀取它們的模型影響,因此 Haiku 編寫的套件能幫助 GPT,反之亦然。
將此化為設計規則:若希望持續性產物能遷移,就應針對問題,而非解題器進行調整。 沒有人在同一套流程下測試過這兩類產物,因此這是由兩項有力但方向各異的數據支持的假設,而非已測量的定律——未解問題留在同系列頁面中。
兩篇論文也在不同基準上獨立得出相同結論:提示最佳化是最弱的一軸。HarnessBank 在五項封存測試中沒有任何一項認可 GEPA;Wang 等人在兩項基準上都將 GEPA 排在三種方法之末(分別為 44% 和 36%,對比 86.7% 和 68.0%)。兩個實驗室、兩種不同改善對象,對提示最佳化給出相同判斷。
Caltech 論文在成本上的對比也更鮮明:其知識整理執行在解題率上勝過 DGM 與 HyperAgents,花費還更少——SWE-bench Pro 成本為 $208,DGM 則為 $713;相較之下,harness 演化以每個領域數百至數千次 rollout 的預算換取增益。
調和 Cline 與 HarnessBank#
(第三個來源與兩者之間的分歧已在上文 三個來源,同一基準系列 中處理;以下兩項共識經得起該來源檢驗,第一項如今有所限定。)
- 兩者認為增益幅度相近——但各自都沒有跑過比較基準。 Cline 的 +11.3 個百分點落在 HarnessBank 認可的 9.2–15.4 個百分點範圍內,兩者也都落在 Measuring Beyond Accuracy Saturation 測得的固定模型下 scaffold 選擇約 44 個百分點的擺幅範圍內。(2026-08-04 由 Rethinking the Evaluation of Harness Evolution for Agents 加註限定:若兩個幅度都是相對於什麼也不做的基準測得,幅度一致只能算弱證據。同一基準上的預算配對純平行抽樣,即使沒有單元測試也能增加 +4.1 個百分點,有單元測試則增加 +13.1 個百分點——因此落在此範圍內的增益本身,不能證明 harness 變好了。)
- 兩者對增益來自何處有共識。 Cline 代理程式新增重試邏輯、依輸出判斷迴圈偵測和 PID 追蹤;HarnessBank 接受的編輯涵蓋全部四種槓桿,其僅提示基準方法則沒有任何一項獲認可。代理程式撰寫的 harness 最佳化屬於執行階段與控制流程工作,而非提示工程——這也是 harness 會擴大而非縮小的原因。Wang 等人的中介代理程式也獨立重現了逐層升級(提示規則 → 中介軟體強制執行 → 工具層修正),並發現仍然不足;因此第三個來源認同的是層級,不同意的是回報。
- 兩者對可主張的結論不同。 見下方 RSI 章節:HarnessBank 的跨模型分離,是目前最有力的論點,證明依定義而言此迴圈不可能是遞迴自我改善。
- HarnessBank 自身的限制。 單一實驗室;程式碼「錄用後公開」,匯入時尚未發布;主要表格只使用一種預設骨幹模型;SWE-bench 的檢定力不足,n = 26。最重要的是,留出任務是各基準內部的留出任務——沒有人將在套件 A 上演化的 harness 拿去測試無關的套件 B;那是不同於本文所測的另一種遷移主張。
這不是標題所聲稱的大寫 R RSI#
Cline 的文章一開頭便援引遞迴自我改善並連結 Anthropic 的 RSI 文章,結尾則稱「遞迴自我改善已不再是科幻實驗」。供應商的敘事是一項主張,不是定義,兩種涵義不應混為一談。 此處有據可查的是固定基準上的狹義 scaffold 爬坡:
| Cline 的執行 | 本 wiki 定義的 RSI | |
|---|---|---|
| 改善了什麼 | 模型周圍的 harness——重試政策、迴圈偵測器、程序處理 | 模型本身;每個世代都設計並訓練自己的後繼者 |
| 增益出現在哪裡 | 一個儲存庫、一項基準、一組模型配對 | 一般能力,能遷移至不同任務 |
| 方向由誰提供 | 人類撰寫的簡報,設定固定終點並明確禁止獎勵操弄 | 系統自主決定 |
| 複利效應 | 未證明——單次實驗,而非會自行以輸出重新執行的迴圈 | 核心要點:每一輪都讓下一輪更快 |
| 終止方式 | 17 小時,停滯時由人類按下繼續,合併前由人類審查 PR | RSI 文獻關注的未解問題 |
模型權重完全沒有變動。改善後的產物是一份針對 TypeScript 程式碼庫的 pull request。這次執行與《When AI builds itself》中的推演毫無關係,頂多只能算鬆散類比——它是 AI Accelerating AI Development 的一個數據點(AI 壓縮 AI 相鄰工程工作);這是該文當下的實證部分,不是其推測。較誠實的解讀是:這是「流汗勞動逐漸自動化」論點的一個案例,規模限於單一儲存庫的 scaffold。
兩者之間有條真實、可檢驗的界線:改善是否會遷移?提升代理程式從未見過的留出代理任務之 harness 修補,與提升正在最佳化之測試套件的修補,並非同一種事物。Cline 沒有報告遷移測量結果。
HarnessBank 進行兩次邊界測試,兩次結果都指向相同方向:
跨任務、領域內:能遷移。 七項基準中有六項在封存測試任務上認可演化後的 harness。因此 harness 演化不只是基準記憶——修正的是實際失敗機制,而非訓練任務的身分。(2026-08-04 由 Rethinking the Evaluation of Harness Evolution for Agents 提出質疑。HarnessBank 的結果在其自身切分上仍然成立,沒有撤回——但在 Terminal-Bench 2.1 上使用前沿骨幹模型與不同演化方法進行相同測試後,結果平均為 +1.2 / +0.0 / +0.6;作者將其與演化時的同任務結果相較,認為這顯示「演化過程中發現的修訂編碼了任務專屬捷徑,而非真正更好的 harness 設計原則」。領域內遷移如今是有爭議的結果,其正負似乎取決於基準的進步空間,而非已確立的結論。 2026-08-13 更新:DarwinX: Evolving Agent Harnesses Through Natural Selection 提供第三和第四個數據點,兩者在同一個系統內指向相反方向:WebArena-Infinity 的遷移幅度巨大(300 個合成意圖 → 1,260 個未見過的真實任務,稽核排除污染後 +49.5);TerminalWorld 的 41 個任務留出切分則只多解出三項,McNemar p = 0.45,且搜尋前的參照組就與摘要結果相當。因此正負取決於單篇論文內部的某些因素,排除了實驗室、方法與骨幹模型作為解釋,剩下的是起始 harness 的狀態——這正是下文提出的判別標準。)*- 跨模型:依其建構方式,本來就不會遷移。 演化後的 harness 在不符合配對病理時幾乎無效,而同一槓桿若對另一個模型家族方向調錯,還會造成傷害(-15.7)。能泛化的是程序,而非產物。2026-08-13 加入限定,且方向符合此論述的預測。 DarwinX 將以 GPT-5.5 演化出的 TB2.1 harness 原封不動用於Opus 4.8 基礎模型,以及不同的基準(SWE-bench Verified),結果仍然有效——官方 pass@1 為 84.2%,比 LSP 修正技能參照組高 3.4,且沒有領域內回饋。這並非配對定律的反例,而是此定律精細結構的一部分:HarnessBank 移植後失效的是推理預算槓桿(開啟/關閉思考、提高推理力度),純屬解題器病理;DarwinX 移植的則是驗證/產物契約套件,其七項技能不包含領域知識或努力程度設定——「先說明驗收條件,再依據條件檢查後才提交」是任務領域的規律,因此 What Makes a Self-Improvement Artifact Transfer? 的一般形式恰好預測了這項結果。這項結果也有兩個限制:SWE-V 組別沒有同模型的 base-Monet 比較組,所以 +3.4 是相對於不同 harness,而非未演化版本;而且所有比較的 harness 都落在 80.8–84.2 之間。DarwinX 自身的跨模型不穩定性也在其他結果中可見——在 TerminalWorld 上,同一程序套用於 GPT-5.5 時只達 56.1%,低於該基礎模型使用中性 Terminus-2 的 61.0%;摘要則採用 Opus 4.8。**2026-09-24 又由 RRSI(下文)進一步修正,提供迄今最乾淨的反例。**以 Gemini 3.5 Flash 演化出的 harness 原封不動交給 Gemini 3.1 Flash Lite——規模較小,也從未參與搜尋——仍然帶來增益(+3.4,相對增幅 30.4%)。依照上文的細緻解讀來看:RRSI 的正規化器明確會篩除針對解題器特定病理擬合的修改(洩漏評論器、針對沒有持久增益元件的剪枝規則),因此符合配對定律的解讀是:正規化帶來了遷移,而非定律有誤——未正規化的編輯仍會擬合單一模型的失敗分布,經正規化後的編輯則是依能否在不依賴此擬合的情況下存留來篩選。
- 而且迴圈會收斂,不會持續疊加。 在顯著性門檻下,它會在最低 10 輪時停止;未設門檻的變體因持續把進展幻覺成真,只能到達上限才停下。若沒有人類為新領域與新模型重新下達簡報,此處的一切都不會複利增長。
產生模型專屬修正後便終止的程序,是一種擬合方法,而非設計自身後繼者的系統。這是此文集對上文詞彙爭議最明確的界線,證據來自這個研究群中證據力最強的來源。
證據權重:供應商為自家 harness 評分#
有四項因素限制了此結果的證據力:
- 自行報告,尚未複現。 Cline 在自己的 harness 上執行基準,並公布自己的分數。沒有第三方重新執行。軌跡與成本明細以 gist 公開,比多數供應商做得多,但公開產物不等於複現。
- 這是他們數月來持續爬坡最佳化的基準。 Cline 明確說明了這點——2026 年 1 月使用 Opus 4.5、2026 年 2 月發布 playbook、同年 7 月進行這次執行。由受評方針對固定套件反覆最佳化,正是 Benchmark Contamination and Decontamination 與 Evaluation Awareness & Grader Gaming 所持保留的設定,即使沒有改動驗證器,也沒有偵測任務名稱。對基準失敗分布過度擬合,是「我們沒有獎勵操弄」無法排除的真實風險:依據這個套件出現的五次 429 調整重試政策,就是針對該套件的供應商狀況擬合。
- 最佳化器有權寫入自己的評分基礎。 見下文。
- 提示層級的反操弄條款不是一種控制。 提示禁止修改驗證器、偵測任務名稱,以及延長逾時;Cline 表示護欄都維持有效,而且模型會自我監督(記錄歸因護欄,也排除兩次因協調器意外終止而失效的執行)。這是好結果,也是一項尚未獨立驗證的自我陳述。
有兩次執行被作廢並重跑;推理力度修正沒有獲得因果歸因;有些失敗則被判定為模型的真實限制。文章報告了自己的負面結果,這是認真看待其他結果的主要理由。
這次實驗利用的同模型、不同 scaffold 效應,已由 Measuring Beyond Accuracy Saturation 獨立測量——在固定模型上替換 scaffold,CORE-Bench Hard 的準確率會波動約 44 個百分點;同一模型配上兩種 scaffold,31% 的任務結果不同。相對於這個基準,僅靠 harness 帶來 11.3 個百分點的增益並不突出;新鮮之處在於找到這 11.3 個百分點的是代理程式,而非工程團隊。
以提示詞而非架構實現解耦#
Optimizer–Evaluator Decoupling 的不變條件是:提出變更的對象絕不評分。這次活動違反了這條規則的架構形式,改以行為規範取代:optimizer 擁有執行 eval 的 repo 寫入權限,因此沒有任何結構性機制能阻止它修改 grader。取代這種分離的是 (a) 一條提示詞條款,禁止編輯 verifier、偵測任務名稱及拉長逾時時間;以及 (b) 由人類在合併前審查最終 PR。兩者都只是較弱的保證——Bun stub-and-justify 事件是這份語料中的證據,說明代理指標加上寫入權限,正是容易出現作弊的組合;而那次必須在 grader 套用修補程式,之所以辦得到,正是因為 grader 與 optimizer 分開。
可泛化的設計備註是:當正在最佳化的 harness 本身就是 eval 基礎設施時,就必須刻意重新引入解耦——使用 agent 無法編輯的凍結 eval harness、它看不到的保留測試集,或從固定 commit 執行的 grader。Cline 的活動三者皆未採用;它在最後交由人類把關。這套做法在 89 項任務和一個 PR 的規模下行得通,而這正是無法隨活動數量擴大的檢查 (Verification as the New Bottleneck)。
HarnessBank 同時部署了這三項機制——不可變 kernel、封存的測試切分、由確定性 evaluator 負責所有分數——接著再消融最後一項。這是這份語料首次測量這種分離的價值,而不只是主張它應該存在。測得的答案違反直覺:在 TB2 上,這道閘門完全不影響最後交付的內容,卻決定了迴圈能否停止。
互補實驗:當閘門本身由 agent 自行撰寫時會發生什麼#
HarnessBank 從一個在所有實驗組都維持外生的 evaluator 上,消融了顯著性檢定。Guo et al. (Self-Authored Verification Is Unreliable in Heuristic Self-Improving Agents, CAS, arXiv 2607.24300, empirical — 完整討論見 Optimizer–Evaluator Decoupling) 消融的則是外生性本身:agent 每一輪都共同編輯 policy.py 和 tests.py,唯一被保留在外的是一項永遠不會進入其 context 的部署評估。兩篇論文從相反端點界定同一設計空間;合併閱讀能分清兩種容易混為一談的成本:
- **沒有顯著性閘門的外生 evaluator,代價是失去停止規則。**HarnessBank 未設閘門的變體交付相同的 TB2 分數,將兩種雜訊機制納入菁英集合,並在收斂後 62–76% 的輪次中看到虛假的進步,因此迴圈一路執行到上限。
- **內生 evaluator,代價是產出物。**Guo et al. 未受保護的實驗,最終自評分數為 0.70–1.00,但 35 個 model-game policy 中有 15 個低於遊戲的隨機參考值;追蹤一個 Breakout 執行過程可見,分數峰值 17.6,後來被覆寫成 7.5,再次發現 18.1,最後以 12.2 收尾,而自我測試通過率始終接近 1.00。只恢復外生比較,就能讓 Gemini-3-Flash 在同一基準上從 7.9 升至 30.0。
另外兩項結果直接關乎本頁記錄的設計選擇。
endo-gate 實驗組是在實驗室控制下重現 Cline 的配置。它提供閘門和完整狀態回滾,但證據取自 agent 自己的測試——也就是只在行為上恢復分離,而非在架構上恢復。在運算量匹配的條件下,它完成了大部分工作(最終平均真實分數從 7.7 升至 13.9,相較 SEAL 的 15.4;峰值到最終分數的落差從 6.9 降至 0.5,相較 0.4),因此保留效益主要來自保守更新,而非外生性。若不控制條件,它就不可靠——六個模型中有三個低於無保護設定,第四個則逾時。這是目前對 Cline 提示詞條款加上人工 PR 審查所取代機制最明確的解讀:它只補上較簡單的那一半,一致性則聽天由命。
**沒有人測試過 HarnessBank 是否也該隱藏數值。**Guo et al. 的 leaky-anchor 實驗組固定稽核方式,只在拒絕後才公開分數;六列中 SEAL 的分數都至少同樣高,且其中五列嚴格較高,最差的一格更從 35.1 反轉到 12.7。稽核的保密性是 HarnessBank 的 kernel/split/evaluator 三件組之外的第五項設計條件;在 evolver 會按設計讀取執行軌跡的 harness 情境中,這項條件尚未經過測試。
兩者領域並不重疊——一邊是程式化 Atari policy,另一邊是七種 agentic 與 coding 基準——所以這是趨同,不是複製重現。但兩個實驗室都得出同一種不對稱關係:optimizer 可以自由推理指標,前提是推理不能變成評分依據。
精簡後的人類角色#
Cline 的前後對照才是這篇文章真正要論證的事:
- 2026 年 1 月——Opus 4.5、Terminal-Bench、47% → 57%。四位工程師花了幾週,手動閱讀軌跡並盯著失敗記錄。2026 年 2 月以 playbook 形式發表。
- 2026 年 7 月——Kimi K3、Terminal-Bench 2.1、77.5% → 88.8%。一段提示詞、一位工程師、17 小時,人類介入「幾乎為零」(在雲端 VM 上每隔幾小時按一次繼續)。
這不是受控比較——模型不同、基準版本不同、起始 harness 不同,在難度曲線上的絕對位置也不同。它呈現的,是人類的工作從執行迴圈轉變為撰寫任務說明並審查 PR:這和 Harness Shrinkage as Models Improve 對 scaffold 所記錄的同一種收窄趨勢,如今延伸到了中繼層次。Cline 自己的結論——「瓶頸不是模型,而是使用模型的人」——是這項主張在實務上的表述,也是最可能不受基準分數影響而依然成立的部分。
不過也要留意編輯方向:agent 新增了 harness 程式碼(重試邏輯、感知輸出的偵測、PID 追蹤),並沒有刪除。agent 撰寫的最佳化不必然代表精簡;在此,模型是在修補太薄弱的 scaffold,而不是刪除已成為負擔的 scaffold。
延伸閱讀#
-
Headroom-Closed Index (HCI) — §5.2 第一項條件背後的測量,涵蓋本頁報告的基準。以各基準進入年份的 frontier 正規化後,search 和 terminal agent(BrowseComp · Terminal-Bench)在 2026 年為 56.8,software engineering(LiveCodeBench · SWE-bench)為 52.6,而研究所程度科學為 85.8——因此整體而言,Terminal-Bench 仍有相當大的進步空間,即使 frontier agent 在其 89 項任務上得分 70–80。這提醒我們,Wang et al. 所說的「agent 在該基準上已經得分很高」,應理解為特定 89 項任務套件的狀況,而非整個基準系列的概括陳述
-
GDPval Benchmark — HarnessBank 套件中,本 wiki 現在收錄其主要基準的領域;這也是演化後的 harness 與基準作者從相反方向測量同一槓桿之處。HarnessBank 在封存的 GDPval split 上記錄 43.7 → 52.9 Pass@1(+9.2);OpenAI 則沒有任何 harness 演化,只用一段通用提示詞,要求 agent 將交付成果轉成 PNG 並檢視,便使 GPT-5 high 的人類專家偏好分數從 38.8% → 43.1%(自我檢視率 15% → 97%、黑方塊 PDF 產物消失、嚴重 PPTX 格式錯誤從 86% → 64%),此外還搭配 best-of-N=4、judge 和容器 GET 存取權。兩項獨立測量都顯示,人類專業人士與模型之間的落差有相當一部分來自流程,而非能力——這也提醒本頁的 headroom 判別方式:GDPval 的起始 harness 並沒有壞掉,只是沒有檢視自己的輸出
-
Inference-Time Architecture Search — 受限形式的前身。Archon (2024) 透過外部 Bayesian optimizer,搜尋同類型的物件,使用封閉且由人工指定的操作詞彙和人工排序的層級文法,離線針對保留測試集執行;而非讓 meta-agent 重寫 harness 原始碼。Wang et al. 在預算匹配下得到的負面結果,只針對不受限制的形式;這暗示——但尚未測試——價值可能就在限制之中
-
Continuous Self-Modification Under Review — 第四個案例,也是唯一沒有任務說明書的案例:161 天、1,085 次自我修改 commit、多模型阻擋式審查閘門,且沒有目標函數。它顯示迴圈可以連續運行數月而無須人類重新下達任務說明(因此終止與否是基準協定的特性,而非自我修改的特性),也獨立重現了維護而非設計的判斷,卻沒有提供任何測量——其基準分數是在凍結的種子上、自我演化停用時取得
-
Cline — 執行這次活動、其 harness 也是最佳化對象的廠商
-
Agent Harness Engineering — 被編輯的模式;本頁探討的是 agent 而非工程師來編輯時會發生什麼
-
Agent Quality Flywheel — 同一種 eval-fix 迴圈,但每次修正都由人類核准;Google 將自主版本列為未來方向,並明確表示尚未推出,而這正是該版本在真實環境中的運作情況
-
Optimizer–Evaluator Decoupling — Cline 在架構上違反解耦,並以行為方式恢復(提示詞條款 + 人工 PR 審查);HarnessBank 則在架構上恢復解耦(不可變 kernel、確定性 evaluator、封存測試集),接著消融它,讓這條規則從原則變成數字;Guo et al. 的 SEAL 則對外生性本身進行鏡像消融,並將稽核的保密性列為第五項條件,而此處沒有任何實驗測試它
-
Deterministic Pre-Execution Gates — 來自一間從未提及 harness 演化的實驗室,為本頁最明確的發現提供第三方佐證。Reddy et al. (arXiv 2607.07405,
empirical) 手寫四個 runtime predicate,在 tool call 派送前攔截呼叫,於 τ²-bench airline 提升 +12.4pp,並在 15 個互不重疊的種子上重現——這與 GEPA 沒有任何獲認列測試所得出的結論相同:這類增益來自 runtime control-flow,而非可透過提示詞調整的機制,只是此處用的是人類撰寫的修補程式,而非演化迴圈。若要將其視為佐證,有兩項明確限制:他們沒有執行提示詞基準線(其限制 7),因此比較只是推定而非測量;而且閘門是根據 policy 撰寫,再於同一組任務上評估、只在種子而非任務上進行重現——這不具備 HarnessBank 所提供的保留任務紀律 -
Unproductive Self-Verification — 同一槓桿,方向相反:當 backbone 的主要病徵是過早定稿時,HarnessBank 的 evolver 會不斷發現 verify-finalize 自我檢查,並將其視為獲認列的修補;Anthropic 對 Opus 5 的建議卻是刪除驗證指示,因為該模型本來就過度驗證。病徵與修補的配對法則正好預測這種情況,而這也是該法則最明確的跨來源支持
-
Large-Scale Test-Time Compute — 本頁最新來源所提出、但 harness 演化表現不佳的方向。HarnessBank 在一個領域勝過一種 test-time scaling 實驗組(16× token 預算無法重現針對性的 control-flow 修正);Wang et al. 則在整個套件上以 K = 5 匹配預算,執行四種實驗組,發現所有模型在兩種 feedback 設定下,普通平行取樣都勝過 harness 演化。這是兩個直接相反的資料點,探討額外運算資源該投入 scaffold 還是執行軌跡——如今又有第三種做法選擇不執行該實驗組:DarwinX 主張其額外運算資源是針對性投入而非平均分配(新解出的六項任務使用 4.3× tokens,兩個 agent 都已能解出的 69 項任務則約使用 1.4×),這是資源分配的主張,不是預算的主張
-
Orchestration Sets Token Economics — 人工建構的對照案例,也說明此處負面結果的涵蓋範圍比表面看起來更窄:刻意設計的 orchestration layer 能讓六個模型的成本一致下降 −41%,而機器推導的 orchestration layer 卻無法勝過平行取樣。同一種物件,不同的作者,結論相反——上文已說明其中的差別
-
Harness-Induced Belief Divergence — 尚未測量的副作用:演化迴圈生成的 middleware(輸出截斷、定稿閘門、回合預算中斷),恰好屬於 Yi & Song 證明會改變 agent 信念狀態的介面類別。Harness 演化為了追逐分數而製造這些變化,卻沒有人檢視它們如何影響 agent 對當下狀況的理解
-
Reward Hacking — 透過指示禁止、而非藉由結構設計排除的失敗模式
-
Harness Activation and Adherence — 本頁問題的使用端面向;因為其他四篇文章都需要,所以另行拆出。演化產物是否進入解題 agent 的 context,以及 agent 是否遵循該產物,是兩項可分開測量、彼此也不會同步變化的指標——而本頁每個端對端分數都默默將這兩個數值相乘。這些數字也限制了本頁對作用機制的解讀:activation 失敗的層級,並不是此處任何案例運行的層級
-
RSI Autonomy Levels (B0–L5) — 這個迴圈在 2026 年 9 月階梯上的位置:L2,agent 對 harness 有策略自主權,但目標、基準及晉升規則仍由外部決定。這個階梯在此的價值是指出限制——說明 harness 演化結果無法證明什麼(改進機制本身受到繼承性改變),而本頁主張的界線正是逐一檢視個別案例
-
Recursive Self-Improvement — 廠商援引的術語;狹義 scaffold 爬坡和模型改進其後繼模型之間的區別,已在上文說明,且比共用的詞彙更重要
-
AI Accelerating AI Development — 這次執行實際支持的主張:AI 壓縮與 AI 相關的工程工作(四位工程師花數週 → 無人值守 17 小時)
-
Harness Shrinkage as Models Improve — 人類角色收窄的動態延伸到 harness 撰寫層次;不同之處是 agent 擴大了 harness,而非將它精簡
-
Open-Ended Discovery Harnesses — 將同一種預算匹配質疑套用到不同搜尋目標,答案則各有不同。SwarmResearch 搜尋的是解答,而非 harness,因此若表現不佳,代表「把運算資源花在別處」,而不是「產物無法轉移」;其比較對象是多 agent 基準線 CORAL(每項任務 $50、相同 runtime、相同模型,差距小到作者認為其中三項勝利還能透過修飾提升),但並未與演化基準線 EvoX 比較(平均每項任務約 $23.50,相較 $50,且那才是差距較大的地方)。目前這套文獻裡,控制組只做到一半
-
Client-Side Agent Optimization — 相鄰的槓桿:AgentOpt 固定 harness,搜尋模型配置;這裡則固定模型,搜尋harness 修補程式。兩者都在 client 端,但沒有任何研究比較過兩者
-
Cost-per-Task Over Cost-per-Token — 這次活動的成本效益:花約 $680 和約 1B tokens,將每次執行成本從 $79 降到 $49.8,回本門檻則未定義
-
Measuring Beyond Accuracy Saturation — 獨立測量單靠 scaffold 就能使分數變動多少(約 44pp 的差距;同一模型使用不同 scaffold 時,任務層級有 31% 不一致)
-
Compute-Controlled Benchmarking — 本頁結果有三處未控制的地方。Cline 的「以 $49.8 達到 88.8%,相較 Fable 5 的 $552」是未控制 harness 的比較;整個方法類別在有人執行預算匹配基準線之前,都屬於未控制運算量的實驗,而這正是 Brown 對 benchmark-maxxing 的批評首次落在一項有名稱且附帶實驗的方法上(pass@1 與 pass@5 的差異,是從中得出的可移植診斷);DarwinX 則是該文最明確的例子,呈現把類別式 effort 層級當成運算量控制——「medium / high / xhigh」沒有任何定義,protocol 附錄沒有運算量欄位,也沒有美元金額,且它自己的標題配對從
default對照到high -
Evaluation Awareness & Grader Gaming — 相鄰的威脅模型:長達數月針對單一套件最佳化,會構成效度風險;即使沒有編輯 verifier,也無法排除這種風險
-
Verification as the New Bottleneck — 人工 PR 審查是這個迴圈中最後一道解耦檢查,也是無法隨活動數量擴大的環節
-
Kimi (Moonshot AI) — 受測模型;Cline 報告稱,以通用 harness 達到 Moonshot 自家公布的 88.3% 廠商 SOTA
-
Capability-Gated Model Fallback — 實驗中放棄的實驗組:安全分類器不斷把 Fable 5 降級為 Opus 4.8,因此 Cline 捨棄 Fable 5 作為主力模型
-
Knowledge-Centric Self-Improvement — 第三個方向,也是對產物可移植性的直接反例:凍結整理好的知識庫而非 harness,便能在所有實驗格中跨 LLM 系列轉移。兩篇論文都各自將提示詞最佳化排在最後。Wang et al. 的 §5.1 提供了區別兩者的機制——harness 編輯「記住修正,而不是提煉策略」;Caltech 的 distillation 階段正是用來強制這種選擇——而這種預算匹配的質疑,從未套用到知識軸上。該文的 weights 列如今有一個受控對照:Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails 在同一組任務上同時調整 harness 與 weights,發現完整軌跡模仿會造成衝突,而 on-policy 修正則能讓兩者組合
-
What Makes a Self-Improvement Artifact Transfer? — 本頁轉移結果的綜合整理:配對法則的細節結構(修補程式能跨模型系列、但只在同一病徵類別內轉移)可泛化為「產物能轉移的範圍,恰好等同於它所編碼規律的適用範圍」;這統合了此處跨模型移植失敗與跨版本指示效力遞減,並導出文中提出的 RSI 區分準則。RRSI 從相反方向提供同一綜合理論的第五個資料點:它不追問一項不受限制的產物是為何種目標調整,而是限制產物的撰寫方式(洩漏篩查、剔除沒有持續增益的元件),結果讓產物轉移到未曾見過且能力較弱的 policy——規範撰寫階段,是事後挑選可轉移產物的另一種方式
-
RSI Autonomy Levels (B0–L5) — RRSI 自己的定位仍在本頁的 L2 界線上(harness 的策略自主權,目標和終止輪數由外部決定),與此處其他所有案例處在同一層級;新意在於,RRSI 首次固定 seed harness、基準套件及 policy 系列,只改變 L2 搜尋受到正規化的程度,因而能獨立檢驗第四項轉移判別因素,補足起始 harness 是否故障、activation/adherence,以及權重更新是否保留適配度等因素
尚待解答的問題#
- agent 撰寫的 harness 演化,是否真的勝過簡單的 test-time scaling?能否泛化至保留任務?**已有部分答案——而如今兩個子問題的答案方向相反。**Test-time scaling:已回答,結果為否。 Rethinking the Evaluation of Harness Evolution for Agents (
empirical) 補上本項原先指出缺少的全套件預算匹配實驗組——三個 frontier model 在 Terminal-Bench 2.1 上以 K = 5 比較四種方法,分別有無 unit-test feedback;harness 演化在所有情況下都落後普通平行取樣,而在沒有 unit test 時平均也低於不做任何事(67.4 對 68.2),其 pass@5 提升可追溯到多次嘗試後的選擇,而非 pass@1 能力。保留任務上的泛化:有爭議,尚未定論。HarnessBank: Semantic Gene-Bank Search with Gated Verification for Agent-Harness Self-Evolution 在七個封存的各領域測試中,有六個於 z ≥ 1.96 時獲得認列(+9.2 至 +15.4pp);Wang et al. 在 Terminal-Bench 2.1 的 45/10/34 切分中,平均提升 +0.6pp,GPT-5.4 則為 +0.0。提出的判別因素是基準線的 headroom(2026-08-13 修正:在關鍵配對中,分數 headroom 並不成立——Wang et al. 的 68.2 基準線低於 base Monet 的 75.5,得到的提升也較小;仍成立的判別因素是起始 harness 有多大缺陷。)仍完全缺少的是轉移至不同基準的測量,目前沒有任何來源測量這一點。**2026-08-13 更新:**由 DarwinX: Evolving Agent Harnesses Through Natural Selection 解決跨基準部分:在 TB2.1 演化出的 harness 不經修改,就能用於 SWE-bench Verified,並轉用至不同的 base-model 系列,官方 pass@1 達 84.2%,比 LSP fix-skill 參考高 +3.4;但要注意,SWE-V 上沒有匹配模型的 base 實驗組,而且所有比較的 harness 都落在 80.8–84.2。相同來源在 headroom 極大的套件上將保留測試增益提高到 +49.5(WebArena-Infinity,1,260 項未見過的真實任務),在小型套件上則得到 p = 0.45;因此保留測試部分仍有爭議,預算匹配部分仍無答案——DarwinX 沒有定義 effort 層級、沒有公布運算量欄位,也沒有美元成本。2026-09-24 更新:更明確,但尚未定論。RRSI: Regularized Recursive Self-Improvement of Agent Harnesses (empirical) 也沒有執行預算匹配實驗組,但進行了一項保留測試部分原先缺少的受控比較:在八個基準上,使用與 RRSI 相同的 H0、policy、演化資料集及候選預算,測試四種先前的 harness 演化方法(Meta-Harness、AHE、TTHE、HarnessX)。四種基準線中有三種在分布外保留任務上持平或呈負值(AHE 和 TTHE 的最終平均 OOD 分數低於 H0 的 39.7,Meta-Harness 則增加 0.9);RRSI 的正規化搜尋則以所有演化實驗組中最小的演化資料集增益,仍比 H0 高 +3.9(43.6 對 39.7)——而且消融實驗(Table 2)在同一篇論文中、固定 seed harness 與基準,再次重現未正規化迴圈的失敗模式。保留任務問題現在有了合理答案:不受限制的演化大多無法泛化,而此集群中另外四個實證來源(Cline、HarnessBank、Wang et al.、DarwinX)都屬於不受限制的案例。仍缺少的是針對 RRSI 本身的預算匹配 test-time scaling 實驗組,所以本項第一個子問題仍未觸及。 - 負面結果究竟是 harness 演化的特性,還是 Terminal-Bench 的特性?Wang et al. 的 §5.2 列出公平測試需要的兩個條件——目前 agent 分數之上仍有大量提升空間,以及基準的表現確實取決於 harness(專門工具、skills、workflows),而非「一個 shell tool 和基本提示詞就已足夠」的基準。Terminal-Bench 對 frontier model 兩者皆不符合,而且它是幾乎整個 harness 演化文獻都採用的基準,包括 HarnessBank 和 Cline。可直接證偽:在對 harness 敏感的套件上執行相同的四種預算匹配實驗組,觀察排名是否反轉。2026-08-13 部分回答——只回答第二項條件,第一項尚未回答。DarwinX: Evolving Agent Harnesses Through Natural Selection 的 WebArena-Infinity 實驗組意外成為對 harness 敏感的套件(把 coding agent 的 harness 指向 Chrome),演化使 1,260 項保留真實任務上的 audit-clean 分數從 43.5% 升至 93.0%。仍未執行的是這項實驗的預算匹配版本:還沒有人在 harness 確實產生限制的同一套件、同一個正規化預算下比較平行取樣和 harness 演化。#oq/source 2026-09-18 再次部分回答,這次處理的是第一項條件——完全脫離 Terminal-Bench 測試方法。Harness Updating Is Not Harness Benefit: Disentangling Evolution Capabilities in Self-Evolving LLM Agents 在三個非 Terminal-Bench 套件上執行固定的 solve-evolve protocol,發現有 headroom 時確實會進步:在 SWE-bench Verified 上,Qwen3-235B 提升 +19.3 pp,GPT-OSS-120B 提升 +15.8 pp;MCP-Atlas 提升 +7.0 pp;SkillsBench 提升 +15.1 pp,其無演化實驗組從空的 skill set起步,因此天生就對 harness 敏感,而不是碰巧如此。所以負面結果並非 harness 演化本身的特性。但同一張表也讓另一種解釋更明確:到了frontier 層級,這些增益在 SWE 和 MCP 上縮小到 +2.4 至 +3.6 pp,幾乎就是 Wang et al. 在 Terminal-Bench 上測得的零增益。尚未執行的實驗因此有了不同重點——不再只是「在對 harness 敏感的套件上執行預算匹配實驗組」,而是**「使用中階 backbone 執行」**,因為本頁所有負面結果都來自 frontier model,而 DarwinX 的 WAI 實驗組以外,語料中只有中階模型得出大幅正向結果。
- Wang et al. 與 DarwinX 的分歧,是否其實是搜尋預算不同?兩篇論文限制的搜尋量相差四個數量級,而且都沒有用可比較的單位報告:Wang et al. 固定 K = 5 輪 meta-agent 編輯;DarwinX 則經過「許多代」演化,在輪替子集上以 avg@3 篩選、再於完整 89 項任務套件上以 avg@5 確認 steering node,且全文沒有任何 generation 數量、rollout 總數或美元金額(唯一可重建的實驗組是 WAI 的 26 次保留/36 次還原迭代,每次在 300 個 intents 上以 avg@3 篩選)。可用兩種方式證偽:將 DarwinX 的 generations 限制在 Wang et al. 的 K,觀察增益是否保留;或要求兩篇論文公布 rollout 總數。#oq/source (2026-09-18 更新:原命題未變,但涵蓋範圍擴大:Harness Updating Is Not Harness Benefit: Disentangling Evolution Capabilities in Self-Evolving LLM Agents 在 21 組 agent-evolver 配對中固定「相同的 evolution budget β 和每項任務的回合上限」,卻沒有在論文或附錄任何地方公布 β 值、回合上限、rollout 總數、token 數或美元金額。語料中四篇受控的 harness 演化論文,有三篇如今都固定搜尋預算,卻沒有公布預算數字。) 2026-09-24 部分回答:有先例,但未解決問題。RRSI: Regularized Recursive Self-Improvement of Agent Harnesses 公布了完整的各領域超參數表——輪數、每項任務的試驗數、雜訊容忍度、編輯預算範圍、停滯視窗、修剪視窗、成本規則係數——並使用與自身相同的候選預算執行四種基準線。這沒有解決 Wang et al. 與 DarwinX 之間的差異(兩者方法不同,也沒有共同的計量單位),但這是本集群中第一個展示可公布可比較搜尋預算表格的來源,因此其他來源未交代運算量的問題,從「這個領域都不報告」收窄為「這個來源選擇不報告」。
- 六個月來 Cline 沒有針對某個 agentic 基準持續爬坡;若改在該基準測試,77.5%→88.8% 的增益還剩多少?每項修正都被描述為通用 harness 改進,這等於主張可以轉移,但沒有提供轉移測量。(HarnessBank 與此無關:它測量的是領域內保留任務,而非跨套件轉移。)
- 本頁所有負面結果中,有多少來自未啟用而非修補程式不佳?2026-09-18 由主要來源部分回答;答案縮小了假設範圍,卻沒有證實它。Harness Updating Is Not Harness Benefit: Disentangling Evolution Capabilities in Self-Evolving LLM Agents (
empirical) 提供本項所要求的逐模型 activation 測量,帶來三項發現。(i)「修補程式不佳」大致可排除為造成差異的因素:harness updating 的基礎能力表現持平——任一基準上七個 evolver 之間的差距最多只有 3.1 pp;在示範案例中,9B evolver 的 skill 在程序上與 Opus 4.6 幾乎相同。(ii) 未啟用的情況確實存在,幅度很大,也與未忠實使用分開:SkillsBench 的 skill-load rate 從 0.251(Qwen3-32B)到 0.961(Qwen3-235B),harness-following rate 則從 0.142 到 0.757,兩者變化並不同步——Qwen3-235B 的載入率接近 Opus 4.6,但遵循率不到一半。完整討論見 Harness Activation and Adherence。(iii) 但這無法解釋本頁的負面結果,因為這些結果都來自 frontier model,而 frontier 層級的啟用率約為 0.96,遵循率為 0.73–0.76。這個機制只出現在弱勢與中階模型;本頁語料從未測試這些層級。原本的證偽問題仍未解答,內容不變:HarnessBank 仍會為每項修補產生確定性的 activation beacon,卻沒有報告啟用率,也沒有人用 beacon 重跑 Wang et al. 的 +0.6pp 實驗組。公布其中一項資訊,就能把本頁所考察系統的端對端分數拆解,而非依據第三間實驗室的 protocol。2026-09-24 更明確,但仍未回答:Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails 提供一個 activation 並非缺失變項的案例——經 LoRA-SFT 的弱模型,使用演化 harness 中領域計算流程的比例從 30.8% 升至 76.1%,平均表現卻仍退步 -14.9pp;問題在於模型自身的規劃節奏是否仍符合 harness 的定稿契約,而非 harness 是否被啟動。這是本頁端對端分數混為一談的第四個量,除了產物品質、activation 和 adherence 之外,還包括同一模型的權重更新是否保留了它與既有演化 harness 的適配度。 - 完整軌跡模仿造成適配度失效的情況,是否能泛化至 LoRA-SFT 以外、特定軌跡模仿以外的情境?Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails 只測量一種權重更新方法(對完整專家軌跡進行 LoRA-SFT),並與一種修正方式比較(逐回合 on-policy 修正),測試對象是領域知識型 harness 編輯,且只涵蓋兩種模型系列。尚未測試的問題包括:完整微調或 RL 後訓練是否也會出現相同崩潰,而非只有 LoRA;harness 編輯若是推理預算槓桿(HarnessBank 的 solver-fitted 類別)而非任務領域知識,是否也會崩潰;以及在多輪共同演化後,on-policy 修正是否仍能順利組合,而非只在一輪時如此。可直接證偽:以 RL 後訓練取代 SFT,或以 HarnessBank 式、針對病徵調整的修補取代領域知識修補,執行同一個先演化後調適 protocol。
- 固定顯著性閘門後,語意品質多樣性 archive 相較單純的貪婪式「保留最佳」迴圈,是否值得其複雜度?HarnessBank 消融了閘門,卻從未消融 gene bank;其 archive 證據僅為觀察所得(獲認列的 harness 會結合多個實驗格中的機制),並非受控實驗組。2026-08-13 更新:問題更明確,但尚未回答。DarwinX: Evolving Agent Harnesses Through Natural Selection 將其整體貢獻建構於 archive 和跨 lineage 合併運算子之上,卻也沒有消融兩者——§9 以自己的文字如此表示(「recombination 相較單一 lineage mutation 的貢獻仍需受控消融」);archive 證據同樣來自觀察(四個專家分別解出 41 項中的 24/25/26/27 項,合併後解出 28 項,而該切分中一項任務就相當於 2.4 分),四個專家中有兩個無法勝過未演化的基礎版本;在 WebArena-Infinity 上,所有合併結果都被還原,因此語料中最大增益來自單一 lineage,recombination 機制完全沒有貢獻。現在有兩篇論文都以 archive 為基礎,卻都未曾單獨測量它的效果。
已解答的問題#
- 是否存在一項明確測試,能區分狹義 scaffold 爬坡與術語所指的遞迴自我改進——例如,能力是否轉移到無關任務,或是否能在沒有人類重新下達任務說明的情況下持續累積改進?2026-08-04 已回答:What Makes a Self-Improvement Artifact Transfer? 提出了測試方法:指出改進產物是針對什麼調整,再測量增益能否在範圍之外保留。HarnessBank 的兩項判別(跨模型移植在配對病徵之外幾乎為零且方向錯誤時為 -15.7;設有閘門時在 10 輪下限停止,未設閘門時收斂後 62–76% 的輪次仍出現虛假進步)、Wang et al. 的運算面判別(在預算匹配條件下,迴圈無法勝過五次取樣),以及 Caltech 的正交性結果(針對領域調整的產物可以可移植地累積,模型本身卻完全沒有改進),都體現了這項測試:針對 solver 的增益是維護,針對領域的增益是資產,而 RSI 必須讓增益存在於 solver 本身。這項測試仍未執行的案例,依然是證據缺口:跨套件轉移仍列於本頁的
#oq/source項目;Knowledge-Centric Self-Improvement 提出的兩產物受控測試亦然;目前也沒有任何來源執行會自行重新下達任務說明的迴圈。
資料來源#
-
Harness Updating Is Not Harness Benefit: Disentangling Evolution Capabilities in Self-Evolving LLM Agents — Minhua Lin、Juncheng Wu、Zijun Wang、Zhan Shi、Yisi Sang、Bing He、Zewen Liu、Tianxin Wei、Zongyu Wu、Zhiwei Zhang、Dakuo Wang、Xiang Zhang、Benoit Dumoulin、Cihang Xie、Yuyin Zhou、Suhang Wang 與 Hanqing Lu(17 位作者;The Pennsylvania State University、UC Santa Cruz、Emory University、Northeastern University、UIUC、Amazon),Harness Updating Is Not Harness Benefit: Disentangling Evolution Capabilities in Self-Evolving LLM Agents,arXiv 2605.30621,2026-05-28,12 頁加附錄,
empirical。以下調查摘要的主要依據,於 2026-09-18 閱讀。引用 §3 的 harness 更新/harness 效益形式化,以及原位評分規則;§4.1 的設定(七個骨幹模型、SWE-bench Verified/MCP-Atlas/SkillsBench、固定提示與演化預算);§4.2 與表 5–6 的演化器端平坦性、極端配對控制,以及flink-query同構案例研究;§4.3 與表 1的非單調 ∆效益曲線;§D.2 對 SkillsBench 低基準表現區段雜訊較大的自我承認;以及 §B.4 的可寫入範圍權限。啟動與遵循部分(表 2–3、§D.1、§D.3–D.4)則收錄於Harness Activation and Adherence。利益衝突:無——作者來自學界與業界,且沒有任何作者所屬機構推出受評估集合中的模型(七個骨幹模型全是第三方模型)。解析判定:乾淨,以此語料而言相當難得:匯入時所有自動檢查都通過(0 合併/0 位移/0 分列/0 焊接),表 1、2、3 已逐格對照pdftotext -layout驗證,而唯一的canary-recall軟性警告已確認為誤報(docling 將「3–6 tool calls」正規化成「3 - 6」)。表 4–6 未逐頁稽核;表 5 的 21 個 ∆更新儲存格改以自身通過率重新計算,21 個全數吻合,其錨點欄也與表 7 逐格一致。圖 4 和圖 7 依圖片兩輪規則閱讀,兩者都包含內文未提及的內容(技能長度;成對的通過軌跡)。限制:沒有與同等預算、但將相同算力用於非演化用途的基準比較,且完全沒有算力成本核算——β、回合上限、rollout 數、token 數與成本都有列名,卻未提供數值;啟動/遵循診斷僅限 SkillsBench;HFR 與階段遵循分數由 Sonnet-4.6-judge 產生,沒有一致性統計;模型集合早於 Claude 5,因此強模型區段的天花板反映的是 2026-05 的狀況;摘要中的程式碼可用性句子寫著「publicly available at here」,但 PDF 中沒有附上網址 -
The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement — Duan、Liu、Tang、Chen、Zhou 等(35 位作者;SJTU/Theseus Labs/Tsinghua/ByteDance/ModelBest/Xiaohongshu/Shanghai AI Lab/Humanlaya/Agent-Native Research Lab/Frontis.AI),arXiv 2609.11873,2026-09-10,79 頁(
practitioner-opinion)。引用 §3.5.2 對 Harness Updating Is Not Harness Benefit 的摘要(更新品質與執行效益的拆解、兩種失敗模式,以及「能力投資應放在解題代理程式中」的結論)、§3.3.2 的 L2 harness 搜尋列舉(Self-Harness、Agentic Harness Engineering、ADAS、AFlow、AgentSquare、Microsoft Foundry Agent Optimizer)、§3.5 的 HarnessDev 和 Evo-Harness 協定,以及 §3.3.4 對自適應基準的警告。以上每項結果的二手來源——vault 中沒有任何底層論文,因此上述發現是調查文章的描述,並非直接閱讀原始論文所得。涵蓋缺口:未引用 HarnessBank、DarwinX 或 Rethinking the Evaluation of Harness Evolution for Agents。§5 業界案例的利益衝突(六位作者的所屬機構報告了自家系統)與本文引用的文獻回顧段落無關。完整分析見 RSI Autonomy Levels (B0–L5) -
GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks — Patwardhan 等(19 位作者,OpenAI),arXiv 2510.04374 v1,2025-10-05,29 頁(
empirical)。僅引用 §3.4 與圖 9:推理力度級距(GPT-5 low 32.7% → high 38.8%;o3 29.8% → 34.1%)、提示調整組(人類偏好勝或平由 38.8% → 43.1%,並列多模態自我檢查與格式錯誤的變化),以及 scaffold 變更(best-of-N=4 搭配 GPT-5 評審、容器中的 GET 請求)。提示全文收錄於附錄 A.3。由供應商撰寫;完整分析與利益衝突見 GDPval Benchmark -
Sidekick's continual learning loop — Andrew McNamara 與 Cody Mazza-Anthony,Sidekick's continual learning loop,Shopify Engineering,2026-08-05,
case-study(作者對自家正式環境系統的第一手描述;沒有受控組、沒有留出切分,也沒有單獨量化 harness 階段的增益)。僅用於第六個實例段落:「最佳化目標是整個 harness」的說法、program.md自動研究設定及可編輯的prompts//tools//harness/範圍、由獨立校準評審擔任最佳化器無法編輯之指標的提出-評估-保留或捨棄迴圈,以及平台期說法(「harness 改進趨於平穩後,我們開始在參數空間中最佳化」)——這項主張沒有附分數、輪數或支出。完整來源分析見 Agent Quality Flywheel -
Recursive Self Improvement for Coding Agents — Ara Khan,Cline blog,2026-07-24(
case-study):五項實驗逐步說明,附 commit 雜湊、基準/候選/確認分數與成本、2026 年 1 月四位工程師的對照、約 $680/約 1B token 的核算、防止獎勵駭客的提示條款,以及已放棄的 Fable 5 實驗組。由供應商在自家 harness 上執行的基準測試;分數為自我回報,沒有第三方複現 -
Rethinking the Evaluation of Harness Evolution for Agents — Yike Wang、Huaisheng Zhu、Zhengyu Hu、Yige Yuan、Zhengyu Chen、Shakti Senthil、Hannaneh Hajishirzi、Yulia Tsvetkov、Pradeep Dasigi 與 Teng Xiao(Allen Institute for AI/University of Washington,arXiv 2607.12227,2026-07-14,
empirical,13 頁;程式碼位於 github.com/rethinking-harness-evolution):摘要中的兩項方法論批評(回饋與推論預算應匹配;搜尋與評估共用一個基準);§3.2–3.5 四種方法的預算形式化,包括harness scaling 作為論文自身採用的實例引導控制;§4.1 的設定(Terminal-Bench 2.1 的 89 項任務、三個模型、K = 5、m = 1、128k 生成預算、高推理力度、兩次執行取平均);§4.2 與表 1 的無單元測試結果;§4.3 與表 2 的單元測試結果及 pass@1 對 pass@5 的推論;§4.4 與表 3 的 45/10/34 泛化切分;§5.1 記憶與蒸餾診斷及上下文膨脹說明;§5.2 公平的 harness 演化基準必須滿足的兩項條件;附錄 A.1 的最小種子 harness(一個 bash 工具)、A.3 中停用的 AHE 探索代理程式、A.5 將評分基礎設施例外視為失敗;附錄 B 各任務的 harness scaling 案例研究。表 1–3 在匯入時已與 PDF 精確核對——沒有合併或位移,因此本文可引用該文件的表格;圖 1 依圖片兩輪規則閱讀,且獨立重現表 1 的 Average 欄(72.3/69.3/67.4/71.8,相較於 68.2 的基準)。限制:單一基準,每個儲存格僅執行兩次,全文未報告變異、誤差棒或顯著性檢定;harness 演化只以停用探索代理程式的 AHE 實作(未執行 HarnessBank);作者在 §5.2 自承 Terminal-Bench 可能不適合探討此問題 -
DarwinX: Evolving Agent Harnesses Through Natural Selection — Yifan Zhang、Yutong Dai、Juntao Tan、Luyu Yang、Rishi Mullur、Thai Hoang、Zhiyuan Hu、James Zhu、Phil Mui、Silvio Savarese、Ran Xu 與 Zeyuan Chen(Salesforce AI Research/Salesforce Agentforce,arXiv 2608.07545,2026-07-31,
empirical,33 頁/14 張表/10 張圖):§2 的保留並延伸契約、適應度啟動條件(g > 0、R ≤ δ)、依累積譜系增益選擇親代、合併運算子的聯集覆蓋接受規則,以及三種學習訊號;§3 四階段評估級距及 §3.2 自身指出「公開排行榜列使用不同模型與力度設定,因此僅供參考,不能作為受控比較」;§4 與表 2 的 TB2.1 排行榜列;§4.1 自稱的「力度受控比較」及圖 5 各任務的算力中位數;§4.2 獎勵駭客稽核(370 條獲獎軌跡、兩條標記、一條確認為捷徑);§5 與表 3 的 TerminalWorld 留出集,以及 §5.1 的 31.7 點代理指標/真實表現落差與 McNemar 注意事項;§6 與表 4–5 的 WebArena-Infinity、兩階段效度偵測器,以及無效軌跡由 293 降至 17;§7 對 SWE-bench Verified 的遷移;§8 與表 6 的七技能驗證/產物契約組合;§9 的限制,包括「推論力度並未獨立隨機化」;附錄 B 表 8 各基準協定表(沒有算力欄);附錄 C 表 9 重試掃描,以及同樣達到 28/41 的前 TW 參考值;附錄 D.1/D.3 的合成意圖建構與基準來源;附錄 E 未測量的跨模型世代 harness 問題。利益衝突:Salesforce 評估 Salesforce 自家的專有代理程式(Monet)——與 Cline 處於相同結構位置,但採用empirical協定;WAI 效度稽核僅套用於作者自己的軌跡,他們主張(且正確指出)這讓外部比較對自己較為保守。**解析判定:乾淨。**表 1–5 在匯入時以pdftotext -f <page> -layout逐格抽查——所有表格標題均位於表格上方,零合併、零位移;表 6–14 則依自動檢查通過(0 合併/0 位移),加上canary-recall20/20,recall 1.00,且沒有頁面遺漏。唯一問題是內文出現外觀上的小數點散落(「2. 2-6. 0-point」),表格儲存格沒有此問題。圖 5 和圖 6 依圖片兩輪規則閱讀,且都包含內文未提及的數字:圖 5 已解決任務的 token 中位數(125K → 172K),對照內文稱算力「幾乎沒有變動」;圖 6 顯示四位專家中有兩位的表現等於或低於未演化基準。限制:單一實驗室、預印本;全文沒有定義力度級別,也沒有美元成本;TB2.1 報告的是同分布結果;TerminalWorld 的 n = 41,McNemar p = 0.45(對基準)及 p = 1.0(對 Claude Code);SWE-V 沒有匹配模型的基準組;未針對存檔、親代選擇器、合併運算子或力度設定進行消融;摘要中「平均約 17 點」是四個異質基準、使用不同指標的平均值,並非本 wiki 引用的量值 -
Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution — Razzhigaev、Gritsaev、Kaznacheev、Dragunov、Yampolskiy 與 Kuznetsov(MSU/Skoltech/Joi Lab/AIRI,arXiv 2608.08311,2026-08-08,
case-study——編纂時從empirical降級):§3 的提交流程與核心演化兩種模式、§4 的 161 天部署與兩段演化實例、表 4 的計數器,以及附錄 C 對evolution offscaffold 的揭露。作者有全面的利益衝突;除 SWE-bench Pro 外,基準皆引用而未重新執行;在 SWE-bench Pro 上的直接比較結果為無顯著差異(58.2% 對 Codex 59.4%;對 655 項配對任務套用對稱污染篩選後,McNemar p = 0.40)。解析警告(表 2 合併、表 4 即使檢查器判定乾淨仍發生列位移),完整分析見 Continuous Self-Modification Under Review -
Knowledge-Centric Self-Improvement — Wang、Yoon、Qu、Wang、Sehgal、Mazumdar 與 Yue(Caltech,arXiv 2607.19592,2026-07-21,
empirical):§4.4 的留出知識遷移(與 HarnessBank §4.6 的負向結果相對的正向遷移案例)、§4.2 對 GEPA 的第二項獨立判定,以及 §4.1 與 DGM 和 HyperAgents 的成本比較。完整分析與解析說明見 Knowledge-Centric Self-Improvement -
HarnessBank: Semantic Gene-Bank Search with Gated Verification for Agent-Harness Self-Evolution — Luo、Xue、Wang、Hu 與 Deng(EverMind AI/Shanda Group,arXiv 2607.13683,v1 2026-07-15/v2 2026-07-30,
empirical):§3.2 的語意基因庫與依品質偏重的親代選擇、§3.3 的 Gated Harness Screening、§4.2–4.4 七項基準表格與歸因的留出增益、§4.3 在匹配 rollout 預算下與 GEPA/DGM 的比較、§4.5 對病理標籤的 LLM 假設警語、§4.6 跨模型匹配法則及 16× token 預算控制、§4.7 配對 2σ 消融。2026-08-03 已對照內文核對表 1–3(解析乾淨,沒有合併或位移);圖 3–4 已檢視頁面影像。預印本、單一實驗室,匯入時尚未釋出程式碼(「錄用後公開」),兩項基準皆由作者依自家協定重新執行 -
Self-Authored Verification Is Unreliable in Heuristic Self-Improving Agents — Guo、Cao、Yuan、Wang、Wang 與 Wang(Chinese Academy of Sciences,arXiv 2607.24300,2026-07-27,
empirical):發現 1(自行撰寫的驗證失去部署上的意義:35 個儲存格中有 35 個自評分高於 0.70,15/35 低於隨機參照值)、發現 2(endo-gate與leaky-anchor實驗組、區分回滾與外生性的算力匹配試點,以及 Breakout 軌跡追蹤)。解析警告:表 7 合併且片段破碎,不可引用——跨遊戲主張取自發現 3 的內文(2026-09-07:已在原始資料中依 PDF 手動重建)。完整分析及其餘解析說明見 Optimizer–Evaluator Decoupling -
How Bridgewater Built an AI Analyst That Does Hours of Expert Research in Minutes — McManus、Ran 與 Weight(Bridgewater Associates),LangChain 頻道,2026-07-24,演講長 25:44,
case-study。第七個實例(15:24–18:08):由代理程式撰寫失敗的基準測試,反覆調整上下文儲存庫與 harness 直到通過,對測試套件進行回歸檢查,再開 PR 到 Slack。完全沒有任何效能數字——僅用於說明機制。參見 Bridgewater Associates 與 Production-Sourced Evaluation -
Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails — Zhou Yu、Bin Bi、Shiva Kumar Pentyala、Shubham Mehrotra、Sougata Chaudhuri、Shilpa Bhagavath、Zeyuan Chen、Ran Xu、Phil Mui、James Zhu 與 Sitaram Asur(Salesforce AI Research),arXiv 2609.09134,2026-09-08,10 頁,
empirical。第八個實例:§3.2 的向上遷移結果(演化 harness 專家表現 84.4%→93.6%,編輯採用率 93.6–100%);§3.3 與表 1 的模仿退步(78.0%→63.1%,平均 -14.9,各任務 -4.2 至 -29.9),以及 §3.3.1 的基準 harness 消融(29.2%→35.5%,+6.3);§3.3.2 的 Gemma Webarena 複現結果(55.6%→41.1%,低於預設 harness 的 46.7% 底線);§3.3.3 與表 3(解析乾淨,已與內文核對)的失敗組成拆分(模仿下規劃失敗由 1.1%→14.6%,校正下則為 1.1%→1.8%;知識失敗為 46.2%→44.5%/43.2%),以及兩個追蹤案例(附錄 D:78 步驟但未完成的薪資發放流程、未篩選總額的 Webarena 答案);§3.4 的 on-policy 校正流程與結果(79.7%、+1.7,七項任務中五項有增益);附錄 A 各任務的 harness 調整表;附錄 B 的 LoRA-SFT 與校正資料配方。表 1 嚴重解析受損(儲存格連在一起,形成無法解析的分數字串,例如「13. 9. 00 67. 5 ± 1. 03」),本文完全不引用該表——上文引用的所有表 1 數值(29.2/78.0/84.4/93.6/63.1/35.5/79.7 等主要數字及各任務變化量)均取自論文內文對該表的重述,並逐句對照 §3.2–3.4。表 2(harness 編輯採用率)有一處列標籤焊接——gemini-3.1-pro-preview 那列的標籤與下一列的「qwen3-coder-30b-a3b」文字連在一起——但其儲存格數值前後一致,且本文取用的兩個數字(網域計算欄的 94.2%、30.8%、76.1%)均有 §3.2 和 §3.3.3 內文佐證。圖 1(共同演化迴圈圖)未開啟——圖說已完整重述摘要及 §1 所述的迴圈,沒有額外量化資訊。利益衝突:十一位作者全數來自 Salesforce AI Research——Salesforce 使用自家的 harness 演化流程評估一套任務組合與搜尋框架(Yang 等,2026,vault 中無此文),與 DarwinX 的結構位置相同。限制:單一實驗室、預印本;沒有與同等預算、改用抽樣而非演化或 SFT 的基準比較(本文未處理 Large-Scale Test-Time Compute 所提出的質疑);on-policy 校正修正僅在網域知識 harness 編輯上測試,未涵蓋 HarnessBank 中符合求解器的推理槓桿類型;論文沒有留出任務切分——所有數字皆為同一七任務套件上的同分布結果,而 harness 也是以該套件演化而成 -
RRSI: Regularized Recursive Self-Improvement of Agent Harnesses — Peng Xia、Rujun Han、Zifeng Wang、Yanfei Chen、Yufan Zhang、Yoonho Lee、Chengsong Huang、Han Yu、Zhongying CuiZhu、Yifei Ming、Huaxiu Yao、Burak Gokturk、Tomas Pfister 與 Chen-Yu Lee(Google Cloud AI Research/UNC-Chapel Hill/Stanford University/Washington University in St. Louis),RRSI: Regularized Recursive Self-Improvement of Agent Harnesses,arXiv 2609.24972,2026-09-21,24 頁 docling 解析(7 張表、5 張圖片),
empirical。第九個實例:§3.1–3.3 提案端正則化器(退火式 L0 風格編輯預算餘弦排程,式 4;具證據意識的信用分配;停滯時的結構化探索)與選擇端正則化器(洩漏篩選、噪音調整穩定性底線,式 5;Ridge/L2 風格的成本門檻接受機制,式 7;Lasso/L1 風格的結構剪枝);§4.1 的八項基準、三個領域設定及四個預算匹配基準(Meta-Harness、AHE、TTHE、HarnessX);§4.2、圖 3 與表 1的主要結果和受控代理式工作空間比較;§4.3 的提案/接受消融(表 2)、兩項政策的穩健性檢查(表 3)、向未見過的較小政策跨模型遷移(表 4)與圖 4 的成本比較;附錄 D.1 與表 5完整的各領域超參數表。利益衝突:無——作者來自 Google Cloud AI Research 與學術界,評估時採用 Claude Opus 4.8(Anthropic)及 Gemini 3.5 Flash/3.1 Flash Lite(Google DeepMind)作為政策模型,使用的基準全為第三方(Harvey AI、Merrill 等人的 Terminal-Bench、Jimenez 等人的 SWE-bench、Guo 等人的 EngDesign、Chi 等人的 Frontier-Eng);提案器/批判器/分析器使用的是競爭對手的模型,不是 Google 自家模型。解析判定:表 1–5 解析乾淨,並已與 §4.2–4.3 的內文重述交叉核對,沒有出入;表 6(附錄 E 的質性案例研究)在匯入時有輕微表格合併標記,本文只引用周邊內文所述的模式,不引用個別儲存格數值。限制:單一實驗室的預印本,未經第三方複現;任何最終報告數字都沒有顯著性檢定、誤差棒或信賴區間,儘管搜尋時以內部噪音帶δ篩選候選項;全文沒有報告美元成本,只列 token 數與步數;範圍僅限凍結骨幹模型(沒有在演化時更新權重的設定);沒有與測試時擴展預算匹配的基準(四個基準彼此間只匹配候選預算,沒有平行抽樣或循序精煉組);作者在自述限制中承認超參數敏感,且仍需針對不同代理程式架構與更長時間執行的流程進行更廣泛驗證
Cited by 37
- Open-Ended Discovery Harnesses×6
So the measured result is a harness whose structural mechanisms (fresh context, branch isolation,…
- Compute-Controlled Benchmarking×5
Agent Authored Harness Optimization — both halves of this page's critique, on one method class, and…
- Knowledge-Centric Self-Improvement×5
This reproduces, from an independent lab on disjoint benchmarks, the verdict Agent Authored Harness…
- Open Questions Backlog×5
Agent Authored Harness Optimization: Is the negative result a property of harness evolution or of…
- Agent Harness Engineering×4
Agent Authored Harness Optimization — the inversion: the agent edits the harness instead of a human…
- Agent Quality Flywheel×4
Someone ran that direction anyway. Cline's July 2026 campaign (Agent Authored Harness Optimization,…
- Cline×4
Jul 2026 — ran the same climb autonomously: one prompt, GPT-5.6-Sol as leader model, 17 unattended…
- Continuous Self-Modification Under Review×4
This is the corpus's first source where an agent's self-modification is continuous, unbriefed, and…
- Recursive Self-Improvement×4
That is a real result and it is not this page's subject. The model's weights were untouched; the…
- RSI Autonomy Levels (B0–L5)×4
Agent Authored Harness Optimization — L2 strategy autonomy over a harness, with the acceptance rule…
- Harness Value Is a Product, Not a Score — Why the Artifact-Payoff Questions Keep Returning Partially Answered×3
cross-model table on Agent Authored Harness Optimization has a model that "thinks too little"
- Optimizer–Evaluator Decoupling×3
HarnessBank (Luo et al., arXiv 2607.13683, empirical) runs the same loop with all three substitutes…
- What Makes a Self-Improvement Artifact Transfer?×3
DarwinX (Agent Authored Harness Optimization, empirical, Salesforce, 2026-07-31) supplies the test…
- AI Accelerating AI Development×2
Agent Authored Harness Optimization — an outside-Anthropic data point of the same shape: Cline's…
- Capability-Gated Model Fallback×2
A workload abandoned over it (2026-07-24). Cline reports trying its autonomous harness-optimization…
- GDPval Benchmark×2
Agent Authored Harness Optimization — GDPval as a domain in HarnessBank's sealed-split harness…
- Harness Patterns Under Scale and Domain Shift: Context Routing, Other Domains, Large Action Spaces, and the Overseer×2
Agent Authored Harness Optimization — HarnessBank's seven domains; patterns transfer, settings…
- Harness Shrinkage as Models Improve×2
darwinx evolving agent harnesses — Zhang, Dai, Tan, Yang et al. (Salesforce AI Research /…
- Inference-Time Architecture Search×2
Archon and agent-authored harness optimization are the same idea one level apart, and the corpus's…
- Kimi (Moonshot AI)×2
Every number above is Moonshot's. The first outside result on K3 comes from Cline a few days after…
- Unproductive Self-Verification×2
Agent Authored Harness Optimization — the opposite pole of the same lever, from an evolution loop…
- Benchmark Contamination and Decontamination
Agent Authored Harness Optimization — repeated optimization against a fixed suite by the party…
- Bridgewater Associates
Agent Authored Harness Optimization — the loop's back half: an agent that edits PAT's own context…
- Client-Side Agent Optimization
Agent Authored Harness Optimization — the sibling lever, searched by an agent rather than a bandit:…
- Context Lifecycle Management
Agent Authored Harness Optimization — accumulation cost with a bill attached. A harness-evolution…
- Cost-per-Task Over Cost-per-Token
Agent Authored Harness Optimization — the campaign-cost question asked of an optimization campaign…
- Deterministic Pre-Execution Gates
Agent Authored Harness Optimization — genuine corroboration from a different lab that the wins in…
- Evaluation Awareness & Grader Gaming
Agent Authored Harness Optimization — the adjacent validity threat at the campaign level rather…
- Harness Activation and Adherence
Agent Authored Harness Optimization — the page this decomposition was built for, and where the same…
- Harness-Induced Belief Divergence
Agent Authored Harness Optimization — where these interface perturbations get generated…
- Headroom-Closed Index (HCI)
The benchmark constituents of each domain, which the prose never names: general knowledge =…
- Large-Scale Test-Time Compute
Two things generalize past the method under test. Without an external correctness signal, depth…
- Measuring Beyond Accuracy Saturation
Agent Authored Harness Optimization — the model-vs-scaffold axis exploited deliberately: Cline held…
- Agent Systems & Harness Engineering
Agent Authored Harness Optimization — An agent runs the whole eval-fix loop on its own harness —…
- Orchestration Sets Token Economics
Agent Authored Harness Optimization — the hand-built / machine-evolved split, and the reason this…
- Production-Sourced Evaluation
Step 1 is the one that separates this from the other instances on this page: a red test before the…
- Reward Hacking
Agent Authored Harness Optimization — a campaign that banned reward hacking by prompt instruction…
Related articles
- Open Questions Backlog
Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…
- Cost-per-Task Over Cost-per-Token
Anthropic's inverted model-selection default: start with the most capable model and dial effort down — a stronger model…
- Compute-Controlled Benchmarking
Noam Brown's critique: the single-number benchmark grid is broken because it ignores test-time compute — plot performan…
- Optimizer–Evaluator Decoupling
The architectural rule in eval-fix loops that whatever proposes a fix (coding agent, automated optimizer, human) never…
- Measuring Beyond Accuracy Saturation
Princeton-led case study (arXiv 2606.26158): accuracy saturation is not benchmark saturation — re-instrument a saturate…
