資料來源#
- Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails
- Knowledge-Centric Self-Improvement
- Muscle Memory for Agents: Compile not Merely Retrieve
- ProofEvolve: Neuro-Symbolic Evolution for Formal Automated Theorem Proving
- Rethinking the Evaluation of Harness Evolution for Agents
- Sidekick's continual learning loop
- The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement
摘要#
以知識為核心的自我改進探問每種自我改進代理程式設計都會默默回答的問題——系統累積經驗時,什麼應該持續存在?——答案是既非代理程式本身,也非其腳手架,而是外部整理的知識庫。代理程式維持通用、無狀態且可拋棄:每次都建立全新執行個體,使用乾淨的上下文,接收蒸餾後的知識包,只嘗試一項任務,把證據寫回去,然後就被丟棄。私有記憶、角色專精、任務專屬架構和修改過的提示,都不會帶到下一代。唯一會改變的物件就是知識庫。
研究來自 Wang、Yoon、Qu、Wang、Sehgal、Mazumdar 和 Yue(Caltech,arXiv 2607.19592,2026-07-21,empirical,程式碼位於 recursive-knowledge/KSI)。他們反對以代理程式為核心的預設做法,理由在於維護,而非能力:「單一持續存在的代理程式必須吸收許多局部教訓,其中有些只適用於特定任務、彼此重複,或互相矛盾;隨著代理程式日益龐大,有用行為可能被互相衝突的更新稀釋。」
由於每次嘗試都會重新建立代理程式,這項實驗設計有個特別清晰的特性:世代之間的任何進步都必定來自知識。其他一切都不會留下。
三階段整理流程#
這套流程刻意保持簡單——作者明確表示:「我們不主張這套流程是最佳的」——形式則像一個分串討論板。三個階段構成一條抽象階梯:
- 任務層論壇。 每次嘗試後,各代理程式在該任務的討論串發文:不是答案或修補程式,而是它採用的關鍵假設、支持該假設的證據、給下一位處理此任務的代理程式一項具體改動、一項可證偽的預測,以及信心程度。發文不只是單向寫入——代理程式會閱讀先前的貼文,並以 id 引用支持或反駁自身經驗的貼文。輸出是局部指引,說明哪些因素重要、哪些做法不應重試,以及後續代理程式應優先驗證什麼。
- 跨任務論壇。 每一代都有一個涵蓋所有任務的共用討論串,負責決定哪些局部觀察值得保留,並帶到產生它們的任務之外。第 0 輪提供具體原語作為起點;第 1 輪及之後的貼文必須對一則引用的同儕貼文明確表態
AGREE/DISAGREE/SYNTHESIZE,並以非空的任務 id 清單作為依據。 - 蒸餾。 將留下的主張整合成每個尚未解決任務各一份的知識包,以及每代一份跨任務知識包,並呈現在下一位代理程式工作區中的
MEMORY.md。兩種知識包共用六個具型別欄位:transferable_insights、confirmed_constraints、rejected_hypotheses、pitfalls、checks、next_steps。
蒸餾被定位為篩選步驟,而非摘要步驟——蒸餾器保留「可採取行動、有證據支撐且適用範圍明確」的主張,刪除「沒有指出適用條件的空泛建議」。每個保留的 Insight 除了文字和證據引文,還會附上 applies_when 和 does_not_apply_when。
由結構定義品質,而非靠提示要求#
這套設計最值得借鏡的細節是:流程的品質門檻由具型別的結構和伺服器端閘門維持,而不是靠提示勸說:
- 檢索閘門將貼文綁定到檢索到的證據。 MCP 伺服器會拒絕
forum_post,除非代理程式已在同一個工作階段呼叫knowledge(task_id)和query(task_id, query=...)。你不能對一項從未查閱過的任務發表自由形式的文字。 anti_meta_self_check是結構欄位,不是建議。 每則跨任務貼文都必須用一句話說明,為何其中的concrete_primitive不是從教學照搬的建議;未通過這項元測試的貼文會在蒸餾時遭到丟棄。結構會明確拒絕「關注點分離」、「兩階段管線」、「方法」、「策略」、「架構」等說法。concrete_primitive必須是原文。 具名 API 呼叫、錯誤類型、檔案路徑、語言功能、測試執行器旗標或數值不變條件,都必須引自任務或引用的貼文;還要有至少 40 個字元的原文佐證引文,而且其中必須含有與該原語相同的非停用詞。- 各任務知識包和跨任務知識包的輸入彼此分開,「避免跨任務猜測污染每項任務的整理,反之亦然。」
EXHAUSTED是流程認可的訊號。 真正找不到更多搜尋空間的代理程式,會寫下這個固定字串,而不是憑空編出下一步。
Anthropic 的提示快取也影響了實作:每個論壇提示都分成含有 cache_control 標記的 cacheable_prefix(任務 id、描述、工具清單、回合指示、輸出結構),以及 variable_suffix(此代理程式先前的嘗試、工作階段記憶、同儕貼文);後者以純文字區塊附加。這正是 Prompt-Cache Economics 定價的具體工程模式。
結果#
所有主要數字的設定如下:每組 50 項任務、10 代、每代一次任務層論壇回合和兩次跨任務回合、temperature 0.0;OURS 使用三個種子,基準方法則各跑一次。每一代都會將已解決的任務從作用中任務池移除,因此解題率是十代累積值,並非排行榜上的 pass@1——應將這些數字視為預算相同的比較,而非絕對基準分數。
對比以代理程式為核心的自我改進(全程使用 Haiku 4.5)#
| 方法 | ARC-AGI-1 | 成本 | ARC-AGI-2 | 成本 | Polyglot | 成本 | SWE-bench Pro | 成本 |
|---|---|---|---|---|---|---|---|---|
| OURS | 86.7% ± 4.2 | $76 ± 16 | 82.7% ± 6.1 | $80 ± 1 | 68.0% ± 2.0 | $126 ± 6 | 64.0% ± 2.0 | $208 ± 19 |
| HyperAgents | 70% | $234 | 60% | $188 | 52% | $190 | 42% | $431 |
| DGM | 不適用 | 不適用 | 不適用 | 不適用 | 58% | $281 | 54% | $713 |
每個項目都是解題率最高、成本也最低——SWE-bench Pro 的花費約為 DGM 的三分之一。在 Terminal-Bench 2(完整 89 項任務)上,OURS 達到 43.8% ± 3.4,高於 Meta-Harness 的 37.6%、Goose 的 35.5%、Terminus-KIRA 的 33.7%、Mini-SWE-Agent 的 29.8%、Terminus 2 的 28.3%,以及 OpenHands 的 13.9%——但這些是各系統以自有 harness 取得的公布排行榜分數,並非重新執行的結果;而且 Meta-Harness 使用 Claude Opus 4.6 作為提案模型、Haiku 4.5 作為基礎代理程式。
基準方法的重新執行比多數研究控制得更仔細。兩個分支都保留上游的最佳化演算法不變,並加入以下控制:預算相同(每項任務上限 3600 秒,是作者原本 1800 秒的兩倍)、temperature 固定為 0.0、透過採用允許清單的 HTTP CONNECT 代理伺服器隔離對外網路,避免具備 shell 能力的代理程式取得隱藏測試的公開副本;以及資訊對等閘門——自我改進 LLM 只能看到已解決/未解決的純量結果,不能看到黃金修補程式;停用隱藏測試資料播種;清除 Polyglot 的 git 歷史,避免解題器從 git log 還原參考解答;零個測試有執行的執行結果一律算失敗,而非空洞的通過。成本計算涵蓋所有呼叫,包括基準方法在中繼迴圈自我修改時使用的 token;依照公布的 API 費率計價,也包含快取寫入與讀取費率,讓快取特性不同的方法仍可比較(以每項任務成本衡量,而非每個 token 成本)。
對比提示最佳化#
預算配合主要執行的實際成本(GEPA 在 ARC-AGI-1/Polyglot 上分別跑 15/7 次迭代;OpenEvolve 分別跑 81/46 次):
| 方法 | ARC-AGI-1 | Polyglot |
|---|---|---|
| OURS | 86.7% ± 4.2 | 68.0% ± 2.0 |
| OpenEvolve | 54% | 46% |
| GEPA | 44% | 36% |
這項研究由另一個實驗室在彼此不重疊的基準測試上重現了 Agent-Authored Harness Optimization 從 HarnessBank 得出的結論:提示最佳化是最弱的自我改進軸線。 HarnessBank 中,GEPA 在五項封存測試中一項也沒得到肯定;這裡則在兩項基準測試上都排三者之末。兩個團隊、改進對象不同,結論相同——這類問題的進步不在提示裡。
跨 LLM 家族#
| 方法 | Polyglot | 成本 | SWE-bench Pro | 成本 | ARC-AGI-1 | 成本 | ARC-AGI-2 | 成本 |
|---|---|---|---|---|---|---|---|---|
| OURS haiku-4.5 | 68.0% ± 2.0 | $126 ± 6 | 64.0% ± 2.0 | $208 ± 19 | 86.7% ± 4.2 | $76 ± 16 | 82.7% ± 6.1 | $80 ± 1 |
| OURS gpt-5.4-mini | 72.7% ± 2.3 | $56 ± 1 | 70.7% ± 2.3 | $157 ± 11 | 93.3% ± 7.0 | $16 ± 3 | 90.0% ± 5.3 | $20 ± 1 |
GPT-5.4-mini(中等推理)在四個項目中,解題率和成本都勝出——ARC-AGI-2 的成本是 $20 對 $80,相同流程下差距達 4 倍。Haiku 的執行結果仍以其成本的一小部分勝過所有以代理程式為核心的基準方法。這套流程不受限於單一模型家族,但不同家族間的差距確實存在。
凍結的產物可以遷移#
最有力的結果。凍結第 10 代的知識資產,丟棄產生它的流程,然後交給零樣本接收者處理 20 項保留任務;這些任務事先挑選為兩個接收模型在先前都無法解決的題目——不開新論壇、不由接收者蒸餾,只透過依任務調整的轉接器,把共用資產轉成簡短備忘錄:
| Polyglot 捐贈者:無 | GPT | Haiku | ARC-AGI-1 捐贈者:無 | GPT | Haiku | ||
|---|---|---|---|---|---|---|---|
| GPT 接收者 | 8.3% ± 2.9 | 20.0% ± 5.0 | 11.7% ± 2.9 | 23.3% ± 2.9 | 43.3% ± 2.9 | 38.3% ± 12.6 | |
| Haiku 接收者 | 3.3% ± 2.9 | 11.7% ± 2.9 | 11.7% ± 2.9 | 13.3% ± 2.9 | 28.3% ± 2.9 | 23.3% ± 2.9 |
八種捐贈者與接收者配對,每一種都比沒有知識時進步,兩個跨家族方向也都成立。由於接收者沒有自行整理知識,增益完全來自推論時使用的凍結知識包——這證明它「承載的是與捐贈者無關的結構,而非捐贈者特有的習慣」。作者也提出兩項坦率的保留:GPT 撰寫的知識包在每個項目中都是較強的捐贈者(因此某些捐贈者特有的品質確實仍會保留),而 Haiku 遷移至 GPT 的 ARC 項目種子變異最大(± 12.6),所以跨家族遷移幅度「只能作為指標參考,不能視為精確數值」。
有一項遷移限制比論文的表述更值得注意:20 項 Polyglot 評估任務中有 7 項,與捐贈者任務是同一個 Exercism 練習,只是使用不同語言(例如 go__ledger 和 java__ledger),因此同一練習的回想可能有所貢獻。ARC-AGI-1 的切分沒有類似結構,是結果中更乾淨的部分。
轉接器的設計本身就是一項發現。 它是一次 temperature-0 呼叫,明確禁止自行解題,並輸出固定結構的備忘錄(relevant_constraints、relevant_heuristics、pitfalls_to_avoid、checks_before_submit、candidate_plan、knowledge_use_rationale);每個清單欄位最多 0 到 3 個項目,而且指示模型在先驗知識關聯性不高時,回傳簡短清單或空清單。作者觀察到「可泛化知識的數量因基準測試而異」後,才加入這項設計;若固定數量的知識被遷移,接收者的記憶就會「雜訊過多」。它最後一條規則是:「如果目前任務與先前知識衝突,以任務為優先」——這是一項供機器使用記憶的覆寫政策。知識少一點、依任務調整,效果反而勝過更多知識。
以歧見作為證據#
這套流程與記憶和經驗重用相關研究的差異,在於它把代理程式之間的衝突視為證據,而非不穩定性。先前系統仰賴代理程式自行抽象化——單一代理程式把自己的行動軌跡壓縮成可重用產物。這裡,一項主張必須先經受同儕以矛盾證據回應,再通過跨任務的重現性測試,蒸餾時才會被保留。
跨任務回合中的立場分布(Haiku 4.5,種子 1;一則貼文可能結合多種立場):
| 基準測試 | 貼文數(第 1 輪及之後) | AGREE | DISAGREE | SYNTHESIZE |
|---|---|---|---|---|
| ARC-AGI-1 | 141 | 37 | 10 | 104 |
| ARC-AGI-2 | 123 | 38 | 9 | 81 |
| Polyglot | 249 | 80 | 14 | 167 |
| SWE-bench Pro | 265 | 61 | 15 | 201 |
| Terminal-Bench 2 | 576 | 296 | 25 | 308 |
| 總計 | 1,354 | 512 | 73 | 861 |
明確的不同意只有 1,354 則貼文中的 73 則——數量很少,作者認為這正是預期的狀況:「立場要求讓衝突明確呈現,並迫使它帶有證據;它不會製造衝突。」綜合判斷才是主流。(GPT-5.4-mini 的執行結果會以自由文字表達對比,不會輸出明確的關鍵字,因此統計只涵蓋 Haiku 的執行結果——這些頻率反映的是某個家族遵守結構的情況,而非流程本身的測量特性。)
三個追蹤案例呈現了這種機制的實際作用,三者都在於界定主張的適用範圍,而非選出贏家:
- 縮小被證偽的範圍,而非消滅整類假設(ARC-AGI-1,任務
b548a754)。一次失敗的嘗試過度概括為:「標記存在,並不代表它是延伸目標或方向限制。」第 1 輪貼文提出不同意見,引用同一代中一項已解決的任務作為反例:若採用中心點比較,標記確實可以控制幾何形狀。蒸餾器將證偽範圍縮小至實際測試過的單一參數設定,並讓其餘假設家族以明確的UNTRIED狀態保留下來。新一代的代理程式從這份知識包取得起始資料,並以保留下來的家族中的一項規則解決任務。如果第 0 輪貼文形成共識,整個家族都會被視為無效。 - 將一項主張拆成兩項、各有明確範圍的主張(Polyglot)。一項主張指出,Java 和 Rust 的
react都需要相同的 equals 閘門;作者讀過 Rust 嘗試的貼文後自行修正了主張:Java 的同步傳播會在一次呼叫堆疊中達到穩定狀態,Rust 的迴圈式傳播則需要先取得快照,再與迴圈後的最終狀態比較。蒸餾結果是一項有條件的洞見,以及一筆附有證據、狀態為FALSIFIED的項目,而非選出勝者。後續世代的兩項任務都以完全符合範圍的防護條件解決。 - 保留尚未解決的衝突(Polyglot
go__connect,十代都未解決)。論壇多代討論了取決於奇偶性的六角格鄰居偏移,與統一的 8 鄰居聯集;兩種立場都未能解題,知識庫便保留雙方為FALSIFIED/UNTRIED,並附上支持和反駁它們的證據,而不強迫形成共識。「證據真正互相矛盾時,流程的任務是讓未來的代理程式看清楚衝突,而不是把它平均掉。」
這最後一句與 LLM-as-Compiler Knowledge Base 獨立得出的編譯期矛盾處理規則不謀而合;後者是由建構機器可讀知識庫、而非人類可讀 wiki 的團隊提出。
自我改進的第三條軸線#
如今,知識庫中三項不同改進對象各有一項受控制的研究,終於可以放在一起比較:
| 改進對象 | 來源 | 對產物的判斷 | 對流程的判斷 |
|---|---|---|---|
| 代理程式(提示、工作流程、自有程式碼) | DGM、HyperAgents——本研究重新執行;HarnessBank 也包含 DGM | 在此處表現最弱;在 HarnessBank 的閘門下,Omni-MATH 的成績退步 | 維護成本高;代理程式吸收互相矛盾的教訓時,增益會被稀釋 |
| harness(執行環境、控制流程、設定) | Agent-Authored Harness Optimization(HarnessBank、Cline、Wang 等人) | 保留集增益為 +9.2 至 +15.4pp,且符合模型特性(離開配對的病理問題後增益近乎為零,槓桿方向設錯時則為 -15.7)——但在唯一一項預算相同的測試中,增益不存在:Terminal-Bench 2.1 的保留集僅提升 +0.6pp,預算相同時還輸給單純的平行取樣 | 可遷移資產是「診斷→搜尋→驗證」迴圈;預算相同時,它並不比取樣五次更值得投入 |
| 知識(以證據為基礎、經過蒸餾) | 本文 | 可移植:八種捐贈者與接收者配對全都有正向結果,兩個跨家族方向皆然 | 成本低到流程被描述為刻意未最佳化 |
兩篇論文對產物是否可移植得出相反結論;這種矛盾提供了資訊,無須裁定誰對誰錯。 HarnessBank 的核心負面結果是演化後的 harness 無法跨模型家族遷移;本研究的核心正面結果則是蒸餾後的知識包可以遷移。兩者都是 empirical,都採用封存或保留資料集,也都沒有錯——可能的調和方式在於產物是依據什麼調整的。harness 修補程式編碼的是對某個模型失敗分布的修正(過度思考的骨幹需要調低推理槓桿,思考不足的骨幹則要調高,因此同一修補程式換到另一模型上會產生相反效果)。蒸餾出的洞見編碼的則是任務領域中的事實——ARC 網格不變條件、Rust 迴圈式傳播語義、測試執行器旗標——不論由哪個模型讀取都成立。
如果這種解讀成立,設計原則就是:持續存在的產物應依據問題調整,而非依據解題器調整。 沒有人在同一套流程下測試兩種產物,因此這仍只是假說,但有兩項有力且方向單一的證據支持。
提示最佳化是第四種改進對象,兩次都輸給另外兩者,而且來自兩個獨立實驗室。
這套分類法漏掉的對象:權重(Shopify,2026 年 8 月)#
上表每一列都在改善凍結模型周邊的事物,而這套分類法默默沿用了來源研究的限制。Shopify 對 Sidekick 的說明(McNamara 和 Mazza-Anthony,Shopify Engineering,2026-08-05,case-study——作者對自家生產系統的第一手報告,沒有重現或對抗性審查;其證據權重低於本文每一項 empirical 來源)是知識庫中第一個將模型參數當作持續性產物的來源,並直接指出這項遺漏:
「部署後的前沿模型同樣是凍結的。它沒有機制能將生產環境教會它的事內化。改進反而累積在周邊各種離散產物中:提示編輯、檢索範例、路由規則和 harness 程式碼。生產環境的知識堆積在文字與程式碼裡,模型權重卻原封不動。」
這個迴圈的順序是本研究沒有類比之處:先由一個受校準評審器把關的 autoresearch 代理程式最佳化提示、工具定義和 harness 程式碼,接著「等到 harness 改進停滯後,我們便開始在參數空間中最佳化」——由批評者小組修正生產環境中的失敗案例,重新播放,再以 SFT 和 GRPO 每日將結果納入權重。因此,第五種改進對象確實存在,而且它位於 harness 那一列的下游,而非與之並列;唯一同時報告兩個階段的來源指出,harness 階段先耗盡了進步空間。完整機制、蒸餾曲線和經濟效益詳見 Agent Quality Flywheel。
有兩項限制,使它還不足以在上表另列一行。這是一項單一代理程式的 case-study,沒有對照組——沒有任何因素能區分「權重變好了」和「八個月的工程投入」;唯一的品質數字是評審分數,最高點只比前沿模型參考值高 0.4 分,而且沒有信賴區間。其遷移特性也完全沒有測量:沒有人把微調過的 Sidekick 交給不同任務或不同模型家族,這正是上表每一列都接受評估的軸線。從設計上來看,權重空間產物若不是五者中最難移植的,至少也最接近這種情況——它的定義就是依照某個模型的參數調整,也就是 What Makes a Self-Improvement Artifact Transfer? 中「依解題器調整」失敗模式的極端案例。
本文尚未回答的質疑#
第三項 empirical 來源(Rethinking the Evaluation of Harness Evolution for Agents,Ai2/UW,arXiv 2607.12227)從方法論角度質疑 harness 那一列,且其論點同樣適用於本研究:自我改進迴圈本身就是一種搜尋程序,會反覆運用任務回饋評估並修訂候選方案,因此必須拿它與使用相同預算搜尋行動軌跡的方法相比——例如平行取樣、序列式精煉——否則無法把公布的增益歸因於改進後的產物,而不是更多測試時運算。在 Terminal-Bench 2.1、K = 5 的預算配對測試中,抽取五個樣本再由模型挑選,在兩種回饋設定下都勝過自動 harness 演化,而且適用於每種模型。
本研究的基準方法是以代理程式為核心的自我改進(DGM、HyperAgents)和提示最佳化(GEPA、OpenEvolve),兩者彼此的預算相同,控制也很嚴謹。但沒有一種是測試時擴展的對照組。針對 50 項任務池,進行十代論壇和蒸餾是龐大的搜尋預算;每一代都會移除已解決的任務,報告的指標則是累積解題率——反覆獨立嘗試同樣會使這條曲線上升。論文沒有任何設計能區分「知識庫有幫助」和「嘗試十次有幫助」,而最簡單、能補上這項缺失的對照組——讓相同的通用可拋棄代理程式跑十次,不開論壇、不蒸餾、不使用 MEMORY.md,再計算累積解題數——正是本文第一個尚待探討問題中提出、只是切入軸線不同的缺失對照組。
有兩點使這成為限制,而非推翻結果的理由。遷移結果不受此質疑影響:零樣本接收者在 20 項保留任務上使用凍結知識包,只有一次嘗試,因此八個項目中觀察到的提升不可能來自重複取樣。成本比較的方向也合理——SWE-bench Pro 花費 $208,而 DGM 花費 $713——所以不論流程帶來什麼,都不是靠花更多錢買來的。不過,主要解題率並未與最簡單、可能產生同等結果的做法進行預算配對;如今這已是具名且經測量的風險,而非假想問題。
不是 RSI——但它的累積效應勝過那個自稱如此的系統#
本研究明確落在 Recursive Self-Improvement 劃定的界線內,而且理由比 harness 案例更充分。模型權重未受影響;代理程式不只是被修補,而是明確設定為可拋棄;改進中的產物是所有模型之外的文字知識庫。論文沒有另作主張(儘管其程式碼儲存庫名為 recursive-knowledge/KSI),結論也相當謹慎:「自主推理的瓶頸或許不在代理程式架構的複雜度,而在於其能存取資訊的品質與結構。」
有個值得注意之處:就 RSI 文獻真正關注的兩項特性而言,本研究表現得比 harness 自我演化更好,但依定義卻更不像 RSI:
- 累積效應。 harness 演化會收斂——在顯著性閘門下,HarnessBank 會在第 10 輪的下限停止;每換一個模型或領域,都要由人類重新提出需求。此處則可在單一流程下無人介入地執行十代,且新代理程式會持續使用該產物。
- 遷移。 harness 修補程式離開其配對的病理問題後,效果近乎為零。蒸餾知識包在每個跨家族項目中都有正向效果。
因此,累積效應與 RSI 是彼此獨立的軸線:系統可以累積真正可移植、真正具有累積效應的資產,而模型本身完全沒有改善。這進一步釐清了術語問題,也反駁了「有累積效應」就代表更接近 RSI 的解讀。
對於累積效應本身的主張,還有兩項誠實的檢查。每一代都會把已解決的任務從任務池移除,因此作用中的任務池會單調縮小,世代之間曲線上升的部分原因只是簡單任務逐漸離開。所有執行結果也都不超過 10 代,因此沒有資料能衡量剩餘任務變難後,基礎方法是否仍持續增加價值。
論文沒有測量什麼#
缺口清單很短,但每一項都足以左右判斷:
- 沒有對三個階段進行消融測試。 沒有對照組移除任務層論壇、跨任務論壇或蒸餾。代理程式總是同時取得具型別的嘗試紀錄表和兩種知識包,因此無從區分「整理後的洞見有幫助」與「嘗試紀錄有幫助」。
- 「整理勝過儲存」只是論述,從未實際測試。 論文與記憶和經驗重用研究(ExpeL、AgentKB、Agent Workflow Memory、Voyager、MemGPT)之間的概念區隔,全放在相關研究章節。這些系統沒有任何一個出現在表格的對照組中。實際比較的是以代理程式為核心和以提示最佳化為核心的基準方法;兩者主張不同。
- 沒有針對個別主張歸因,也沒有顯著性閘門。 唯一的歸因依據是整體解題率。沒有證據能證明任何個別蒸餾主張有所幫助,也沒有機制淘汰沒有幫助的主張。Optimizer–Evaluator Decoupling 在結果層面符合要求——基準測試評分器是決定性的、外部的,且無法變動——但在主張層面則不符合要求;HarnessBank 的消融測試正是在此處發現,未經閘門認可的歸因會在收斂後回合中造成 62-76% 的虛假進步。
- 完全沒有顯著性檢定。 OURS 使用三個種子,基準方法只各跑一次,沒有配對檢定,而且有些 ± 區間重疊(ARC-AGI-1:86.7 ± 4.2 對 93.3 ± 7.0)。
- 沒有測試時擴展對照組。 每一項基準方法都是另一種自我改進方法,沒有任何一項是「讓相同的通用代理程式跑 K 次,再計算累積解題數」。詳見上文的本文尚未回答的質疑。
- 基準方法是作者以替代 LLM 重新執行的結果。 DGM 公布的數字使用 Claude 3.5 Sonnet 和 o3-mini;此處的項目則使用 Haiku 4.5,因此不能與 DGM 論文本身的結果相比。作者明確說明這點,而且對等性閘門控制得非常仔細,但這仍是標準的保留事項。
- 保留集的挑選方式使遷移基準成績必然偏低——每項評估任務都是因為兩個接收模型在種子 0 時都無法解決,才被選入。
- 未來工作會研究人類專家對知識庫的貢獻,本文並未進行研究。
第二篇論文也重現了同一項缺失對照組,這使它成為次領域的共同模式,而非單篇研究的遺漏。 Muscle Memory for Agents(Omran、Lanka、Zhang 和 Dixit,Google Cloud FDE,arXiv 2608.08995,2026-08-10,empirical)正面主張應編譯而非檢索——其相關研究章節將 MemGPT、LongMem、Reflexion、A-Mem、Voyager、SWE-agent 和代理程式技能列為它要取代的典型範式,摘要更稱該範式「預設就錯了」——接著卻只將編譯後的專家代理程式,與完全相同但沒有記憶工具的助理比較。跟本文一樣,沒有任何檢索或記憶系統作為對照組。三週內出現兩篇彼此獨立的 empirical 論文,都以檢索相關研究為目標,也都只測量編譯與什麼都不做之間的差異。下方第一個待探討問題不會因此被削弱,也沒有因此獲得答案;改變的是,如今無人測試的對照組已成為整個領域的共通特徵。
它也提出了首項經測量的反例,顯示產物未必勝過其製作者;界線很有啟發性,並不矛盾。 在該研究中,編譯後的產物在技術準確度上不如它取代的通用助理——專家代理程式內嵌的提示帶有捏造的 API 引數(針對 use_continuity 提供 continuity=True),執行時因此崩潰,得分是 1/4,而未編譯基準方法為 4/4——但在閘門設定的指標上則明顯勝出。作者的診斷是,閘門「以一般事實依據為目標……卻沒有驗證領域專屬的 API 正確性」。這不是對本文知識包的結果;本文採用的決定性外部基準評分器,會將這項產物判為失敗。可遷移的主張應更精確,也值得保留:編譯後的產物只會在閘門測量的指標上勝過製作者,在其他方面則不受限制——因此遷移結果之所以有力,依賴的是評分器設在結果層,而非編譯本身。
持續性知識庫變大後會如何(2026 年 9 月)#
本文流程執行十代後便停止。2026 年 9 月的 RSI 調查(arXiv 2609.11873,§3.5.3 和 §6;作為文件分類為 practitioner-opinion,調查第三方 empirical 研究)整理了此後發生的相關研究,補上本文缺少資料的生命週期面向。以下四項結果,其原始研究都不在知識庫中——因此這些是調查對研究的描述,而非本文作者直接研讀論文後的判斷:
無限制累積會在分數反映出來之前,先使知識庫品質下降。 Library Drift 研究發現:「無限制累積會逐漸降低檢索品質、使進展停滯,而且通常在任務分數顯示出影響之前就已發生。」它提出的生命週期有三部分:只增不減的證據紀錄,追蹤每項技能對任務結果的貢獻;當測得的貢獻消退時將技能退役;以及限制有效技能的數量,使新條目必須與現有技能競爭。這正是本文探討第 10 代之後狀況的待解問題,如今由另一項研究明確指出並測量——但同時也警告別採取顯而易見的解法:「過度積極地讓技能退役,效果比不加指引地使用技能庫更差。」 同一節的第二項分析發現,對技能編輯進行篩選,勝過根據任務結果反覆重寫技能。
可以用測試來決定是否納入,而非只靠論辯。 HDSO 以配對的控制組與處理組設計,補上本文缺少的個別主張閘門:策展者提出一項假設,並附上明確的驗證計畫;每個候選項目都在相同任務上測試兩次——一次使用目前核准的儲存庫作為控制組,一次將候選項目加入作為處理組——只有在差異支持該假設時才納入候選項目;實驗規模逐步增加,最後再以獨立任務確認。這直接回答了上方缺口清單中的問題:「沒有證據能證明任何個別蒸餾主張有所幫助,也沒有機制淘汰沒有幫助的主張」;而這套系統正是針對該問題指出的風險而設計(「從帶有雜訊的行動軌跡蒸餾技能……可能編入虛假的捷徑或執行器無法遵循的規則」)。
將文字提升為程式碼,可以用重現性作為門檻。 Metis 維護雙重儲存:一邊是文字計畫、環境事實和陷阱,另一邊是可呼叫工具庫;某個文字計畫反覆被使用後,只有在它跨任務重現,並通過沙箱中的相依性與編譯檢查後,才會改寫成可呼叫工具。 以重現性作為證據,是本文蒸餾階段以人工方式近似採用的篩選規則。
此外,本文從未測試消費端的失敗。 §6 對持續性狀態提出的方向說得很直接:「保留某項產物,並不能證明後續代理程式會從中受益」;失敗可能發生在啟用和執行兩個階段——「相關技能可能從未被檢索到,代理程式也可能檢索了技能卻沒有正確遵循。」建議的分析方式是分別測量更新品質、啟用、忠實使用和後續效益。本文每個數字都只測量後續效益。遷移結果不受這點影響——凍結知識包提升保留任務的解題率,確實是測量過的後續效益——但這也表示知識庫仍無法判斷,知識包跨家族都有效,究竟是因為內容本身,還是因為它們短到容易讀取。
調查還提出一項限制,對本文的跨家族結果構成反向提醒:「對作者有用的技能,對不同執行器可能並不適用。」Caltech 的知識包在每種捐贈者與接收者配對中都能遷移,這是反駁該疑慮的證據;調查指出的是,當產物是程序式內容而非宣告式內容時,這項疑慮尚未經過測試。
經認證的實例,以及它的曲線在哪裡趨平(ProofEvolve,2026-08)#
ProofEvolve: Neuro-Symbolic Evolution for Formal Automated Theorem Proving(UVA + Meta AI,arXiv 2608.26334,empirical)是在唯一能以「證明」而非論證來確認儲存庫正確性的領域中,實際測試本文主張的案例。所有權重都固定不變;唯一持續保留的物件,是由證明器自行撰寫、經 Lean 驗證的定理綱要庫。值得在此納入,理由有三。
准入依據是核心檢查,不是裁判。 本文缺口清單反覆要求的逐項主張閘門,在此以最強形式實現:只有當 Lean 能展開抽象化後的宣告、沒有未解的中介變數,且核心驗證其證明項時,綱要才會進入資料庫;只有在具型別的代換使結論與目標於定義上相等,且每個尚未解除的前提都重新顯示為子目標時,綱要才會被套用。因此,檢索錯誤的內容會明確失敗,且不會造成任何改變。對照前述 HDSO 的成對控制組與處理組設計:HDSO 測試一項主張是否有幫助,Lean 測試它是否為真。這是不同的閘門,而形式化領域能免費取得第二種閘門——這也正是它不能充當範本的原因。在 Lean 之外,真偽無法檢查,而 HDSO 的實用性測試是現有的近似方法。
本頁一直缺少的「整理勝過儲存」組,已經執行——但形式很狹窄。 測量結果:5,546 個由證明器自身產生、且經核心接受的證明,744 個經篩選的保留定理,每個定理嘗試一次,共三次執行。相關檢索在 K=8 時,解題率從 49.5% 提升至 53.4%(+3.9 個百分點);從完全相同的資料庫隨機檢索,則提升至 49.6%(+0.1 個百分點)。儲存庫相同、提示範本相同、範例數量相同——只有選擇規則不同,而全部增益都來自選擇。這並非本文所說的「整理勝過儲存」(兩組都讀取同一個累積資料庫;變動的是檢索方式,而非哪些內容獲准納入),但它清楚顯示,持續性儲存庫光是存在並不會帶來任何貢獻。它也排除了對增益的貶抑解讀:檢索補上了零樣本未解的 351 個定理實例,其中 322 個(91.7%)沒有逐字重現任何展示過的證明,因此資料庫提供的是結構,而非答案。
還有一項飽和數據,與累積論相悖。 ProofEvolve 自行進行的資料庫規模掃描,在 K=8 固定時顯示:1,000 個證明時為 +3.3 個百分點,2,000 個時為 +2.6,4,000 個時為 +4.2,完整 5,546 個時為 +3.9——沒有單調趨勢,而且每個數據點彼此相差都不到約一個執行間標準差。規模大了五倍半的資料庫,與一千個證明的資料庫相比,沒有可測得的額外價值。無論資料庫提供什麼,幾乎都已由最初一千筆提供。關鍵在於,這項測量沒有受到本文第 10 代問題所指出的混淆因素影響:所有條件下的評估集都固定為 744 個定理,沒有任何項目被移除,因此此處的平坦曲線不能歸咎於任務池縮小。
首次受控的 harness 與權重交互作用測試(Salesforce,2026 年 9 月)#
上方的改善對象表格中,每一列都單獨研究一種槓桿;Shopify 的先 harness 後權重排序(見上文)則是依序報告兩個階段,而非彼此對照。Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails(Yu、Bi、Pentyala 等人,Salesforce AI Research,arXiv 2609.09134,2026-09-08,empirical)是本資料集第一個在同一組任務上結合 harness 列與權重列,並測量兩者相遇時結果的來源。
設定如下:以弱模型(qwen3-coder-30b-a3b,GEPA-style 搜尋)為基礎,針對七項企業級代理任務演化出一個 harness;確認它能順利向上移轉至較強的專家模型(gemini-3.1-pro-preview 在為弱模型建立的 harness 上,表現從 84.4% 提升至 93.6%,並在 93.6–100% 的執行軌跡中觸發其編輯);接著在同一個演化後的 harness 下,使用專家模型的執行軌跡對弱模型進行 LoRA-SFT,預期模型能縮小剩餘差距。結果卻在全部七項任務上都適得其反(78.0% → 63.1%,平均 -14.9,且在第二個模型家族中重現),而且只有在演化後的 harness 下才如此——完全相同的配方在未演化的基準 harness 下反而有幫助(+6.3)。診斷結果是:微調後的模型採用了專家的規劃風格,卻缺乏執行能力,因此不再適合以自身原生規劃節奏演化出的 harness——知識與 harness 編輯使用率在 SFT 後都提高了(某個領域運算配方的使用率從 30.8% 升至 76.1%),但規劃失敗占比也從 1.1% 跳到 14.6%。採用 on-policy 修正後,元層級代理會定位弱模型自身執行軌跡中的失敗回合,並請專家只重寫該回合,保留原有規劃分布;這使演化後 harness 的表現再提高 +1.7,而非損失 14.9。
以本文的分類法來看,這是對分類法排序未明說之風險的受控展示:一旦 harness 是針對特定模型調整過,harness 與權重就不再是彼此獨立的物件。 權重更新若使模型轉向另一種規劃風格,即使 harness 本身沒有任何變化,也可能抹去它原本帶來的增益;即使模型之後更常使用 harness,也一樣如此——啟用率與遵循度都提高,結果卻崩落。完整處理、失敗模式表格及案例研究見 Agent-Authored Harness Optimization 的第八個實例。
有兩項限制,因此不能將此視為已解決下方開放問題所提的三方實驗。它沒有納入本文自己的產物類別——蒸餾後、經整理的知識包——因此它只比較分類法五種物件中的兩種(harness、權重),並未涵蓋三者;此外,有別於 Shopify 的依序報告,它只研究一輪共同演化,沒有檢驗此模式在多輪之後是否仍成立。
延伸閱讀#
- Harness Activation and Adherence — RSI 調查建議、而本文原本缺乏數據的使用端拆解(「分別測量更新品質、啟用、忠實使用與下游效益」),如今已由一項主要研究執行。該研究對程序性產物的結論是,限制因素在於忠實使用,而非更新品質——在從 9B 到前沿級演化器的範圍內,更新品質持平,但遵循率介於 0.142 至 0.757。宣告式知識包是否更容易通過同一道閘門,尚未測試;這正是本文跨家族移轉結果最明顯的可能機制:事實沒有程序可在第 8 回合放棄
- RSI Autonomy Levels (B0–L5) — 正交軸線。本文問的是什麼東西持續存在;那個階梯問的是由誰決定讓它存在。依其判準,由人設計整理流程的策展知識庫屬於 L1——這最有力地證實了本文自身的正交性主張,因為移轉與累積效果最佳的產物,位於自主性階梯的最低一階。其 L4 章節是上文持續狀態治理結果的來源
- LLM-as-Compiler Knowledge Base — 本文首次獲得外部實證佐證的架構:知識只編譯一次,形成持續性產物,而非每項任務都重新推導。關於蒸餾即選擇、以證據為基礎,以及保留矛盾的趨同結果,都列於該文
- Agent-Authored Harness Optimization — 相鄰的軸線,以及對產物可移植性的直接矛盾:演化出的 harness 是針對模型調整的修正,無法移植;蒸餾知識包則在每個跨家族條件下都能移轉。兩篇論文也都各自將提示最佳化排在最後。該文現在還納入第三個來源,其預算匹配協定發現 harness 增益完全不存在——而其方法論質疑也同樣適用於本文,目前尚未回應。該文也納入第八個實例:harness 與權重在同一組任務上結合,完整執行軌跡模仿會造成衝突,而 on-policy 修正則能使兩者相輔相成——這是目前最接近本文缺失之三方實驗的來源
- Evolutionary Proof Search — 同一項主張,但其下有可靠的驗證器:權重固定不變,唯一持久產物是經 Lean 檢查的綱要庫,准入閘門檢查的是真偽而非實用性。這是此架構所能達到的上限,也是其規模曲線在約 1,000 筆之後呈現平坦的測量案例
- Recursive Self-Improvement — 本文位於其外部的界線:模型沒有任何改善;上文則已論證累積效應與 RSI 彼此正交
- Loop Engineering — 「代理會忘記,repo 不會」從記帳原則提升為改善基礎;0–3 項的 adapter 上限,是迴圈記憶檔案的具體設計備註
- Compounding Data Moat — 將經整理的儲存庫視為持久資產,並加以測量:即使產生它的執行過程、任務與模型家族都已消失,固定知識包仍保有價值
- Multi-Agent Collective Intelligence — 該論壇是一個合作式集體實例,產出是文字產物而非專業分工,也是少數有測得立場分布的案例之一(1,354 篇貼文中有 73 次意見分歧)
- Context Lifecycle Management — 互補的另一半:該文管理執行期間的有效提示檢視;本文則將知識永久移出其中,並把執行期間之外的儲存庫作為改善對象
- Prompt-Cache Economics — 論壇提示建構器中的可快取前綴/可變後綴切分,是該文計算成本的工程模式;成本表則以公布的快取寫入與讀取費率計算
- Cost-per-Task Over Cost-per-Token — 該論文正是基於本文提出的理由,以美元而非 token 報告結果;其核心成果是成本與準確度雙雙改善,而非以一方交換另一方
- Optimizer–Evaluator Decoupling — 在結果層符合要求(代理無法編輯的確定性外部基準評分器),但在主張層則沒有(沒有閘門會認可或駁回個別蒸餾出的見解)。Guo 等人的 SEAL 結果精確評估了這種區分:最低要求是有一項部署接受訊號,最佳化器無法撰寫、觀察或最佳化它,而此協定恰好具備這一項——外部評分器、輸出隔離、資訊對等閘門——因此通過必要條件;但它缺少逐項主張閘門,而 HarnessBank 的消融研究指出,缺少這道閘門會產生虛假進展
- Agent Quality Flywheel — 第五種改善對象,來自生產環境而非受控研究:Shopify 的 Sidekick 迴圈會持續改善權重,也是唯一指出 harness 增益先耗盡的來源(「harness 改善一旦趨於平緩,我們就開始在參數空間中最佳化」)。它也是本文尋找「整理對儲存」問題資料的來源,並解釋了為何該問題仍然開放——其累積是位於三道整理閘門之後、作用於權重空間的防遺忘限制,並非對上下文空間整理的定論
- What Makes a Self-Improvement Artifact Transfer? — 解答本文移轉問題的綜整文章:以什麼為對象調整的區辨,經四項進一步的資料集測試後仍成立(跨版本折舊是同一現象、跨供應商的上下文檔案層、透過本文自身綱要於寫入時進行選擇、編排層的程序對產物),其一般形式為:「產物能移轉的範圍,恰好等於它所編碼的規律能延伸的範圍」
開放問題#
- 整理真的勝過儲存嗎?論文在 Related Work 中論述了自己與經驗重用及記憶系統(ExpeL、AgentKB、Agent Workflow Memory、Voyager)的概念差異,卻從未將其設為實驗組;其自身協定也沒有任何消融實驗移除論壇或蒸餾步驟。只需一個實驗組——僅使用原始嘗試表格,不用論壇、不做蒸餾——就能解答此問題。問題已更明確,但尚未解答(2026-08-13):Muscle Memory for Agents: Compile not Merely Retrieve 將「編譯優於檢索」列為明確論旨,並將同一批記憶文獻列為它所取代的典範,但其基準測試也只比較無記憶基線——現在有兩篇彼此獨立的
empirical論文論證此點,卻沒有任何測量,而兩者都缺少同一個未執行的實驗組。仍標記為#oq/source;進一步釐清之處在於,若有來源執行該實驗,就能同時解答兩篇文章的問題。此軸線已查核,但仍未解答(2026-08-13):Sidekick's continual learning loop 曾被調查為反向數據——一個每分鐘處理 2,000 個請求的生產系統,會保留累積經驗,而非整理篩選;每天使用「累積資料」(新執行軌跡加上所有先前資料)重新訓練,並將保留資料描述為「限制各週期的漂移與災難性遺忘」的方式。仔細閱讀後會發現,它沒有解答這個問題,原因有二,值得記錄下來,免得後續讀者重新爭論。(1) 兩項主張位於不同空間。 Shopify 在權重空間中累積資料,保留資料是訓練動態的限制——從微調語料中丟棄舊執行軌跡會導致遺忘,這種效應在推論時讀取文字包的情境中並無對應,因為丟棄一項主張只會失去該主張。本文的問題關乎上下文空間中的整理:選出未來代理要讀取的內容,是否勝過直接交付原始日誌。災難性遺忘與此無關。(2) 就其自身軸線而言,該來源在兩個方向上都嚴格整理。 訓練語料的納入要通過三道閘門——裁判必須給對話低分(硬負例選擇)、前沿評論小組必須產生能讓重播通過的修正,而評論者無法修正的失敗則升級給人工標註員,而非原樣保留——因此,無限期保留的是一組已整理的資料,而非原始流量。部署模型實際讀取的產物,整理程度也比本文任何案例都更高:系統提示從約 6,000 個 token 壓縮為約 1,500 個學得的精華 token;提示、工具與 harness 編輯也只有在提高裁判分數時才會保留。因此,唯一真正的新數據並非「儲存勝過整理」,而是生產系統會針對不同物件同時進行兩者——這使人懷疑此條目提出的二分法在概念層次上有誤,卻尚不足以改變其狀態。 - 在同一套協定下,測試兩種自我改善產物類別——演化出的 harness 與蒸餾知識包——使用相同任務、預算、保留集與跨模型切分。What Makes a Self-Improvement Artifact Transfer? 預測 harness 的增益離開匹配的病理條件後會消失,而知識包的增益會跨求解器持續保留;這項預測可以證偽,卻尚無來源執行過此測試。問題已擴充為三個實驗組(2026-08-13):Sidekick's continual learning loop 在比較中加入權重空間實驗組,但只依序報告它實際測試的兩種方式,沒有互相比較——先在 harness 空間最佳化直到增益趨平,再轉向參數空間——既沒有單獨測量任何一者,也沒有對排序做反事實比較。因此,缺少的實驗如今是三方比較(演化出的 harness/蒸餾知識包/微調後權重,同一組任務、同一份預算),而一個生產來源則提出了該實驗要檢驗的排序。2026-09-24 再度釐清,且比先前任何來源都更接近:Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails 在同一組七項任務上結合 harness 與權重進行測試(而非依序執行),發現直接組合會造成衝突(完整執行軌跡模仿,平均 -14.9),經修正後則能互補(逐回合 on-policy 修正,+1.7)——這是三方比較中 harness × 權重的那一格,仍缺少蒸餾知識包實驗組,以及任何預算匹配的基線。
- 經整理的基礎知識在 10 代之後是否仍持續增加價值,還是容易解決的任務移除後就會飽和?每次執行都在第 10 代停止,且已解決任務會從任務池移除,因此報告的曲線混淆了知識累積與任務池縮小。2026-09-21 部分解答——移除混淆因素後,答案是「會飽和」。ProofEvolve: Neuro-Symbolic Evolution for Formal Automated Theorem Proving 在固定檢索深度下掃描儲存庫規模,使用一個固定的 744 定理評估集,沒有任何項目被移除;相較於零樣本,提升幅度在 1,000/2,000/4,000/5,546 筆時分別為 +3.3/+2.6/+4.2/+3.9 個百分點——從最初一千筆開始,就一直在雜訊範圍內持平。因此,即使任務池固定,持續擴大的資料庫也可能停止帶來效益;這正是此問題的乾淨版本,也排除了「看起來飽和只是因為容易的任務已消失」這種說法。它仍屬部分解答而非定論,有三個原因:測試軸線是儲存庫規模,不是代數(ProofEvolve 一次建立資料庫,因此沒有測試反覆整理週期是否持續增加價值);使用端條件被簡化為單次嘗試、不做修正,因此測量的是檢索進入上下文的效果,而非經整理基礎資料驅動完整代理的表現;此外,該領域是形式化證明,資料庫項目都經認證且可以互換,蒸餾出的見解則不是如此。同一篇論文也提供了反向數據:在合成的組合式家族中,每個目標都必須用到較早目標的引理;在此情境下,逐漸擴大的資料庫解題率為 19.8%,重設後則為 7.3%——高出 2.7 倍。只有當後續任務在建構上依賴先前結果時,累積才有價值;若只是彼此相似,曲線就會趨平。
已解答問題#
- 什麼因素決定一種自我改善產物能否移轉?2026-08-04 已解答:What Makes a Self-Improvement Artifact Transfer?——產物能移轉的範圍,恰好等於它所編碼的規律能延伸的範圍。「針對任務調整」與「針對模型調整」的二分,是經測量的特例:harness 修補程式編碼的是求解器病理(可在同一病理類別內移轉——Qwen 27B→397B 提升 +11.0,幾乎沒有損失;Gemini 在共同病理上跨家族提升 +13.5——但離開該類別就失效);蒸餾見解編碼的是領域規律(重用時領域維持不變,因此求解器更換後,八個條件全都保留效果)。跨版本指令折舊是在時間軸上的同一現象(綜整文章附有證據);可在寫入時強制確保可移轉性(本文的綱要就是實作方式);而產物無法移轉時,能移轉的是程序。上方受控的雙產物測試仍未解答。
資料來源#
- ProofEvolve: Neuro-Symbolic Evolution for Formal Automated Theorem Proving — Ye、Guan、Xie 等人(University of Virginia + Meta AI),ProofEvolve: Neuro-Symbolic Evolution for Formal Automated Theorem Proving,arXiv 2608.26334,2026-08-26,28 頁,
empirical。本文僅引用 §5.6 與附錄 F:資料庫建置流程(從 9,968 個定理的來源串流中取得 5,546 個核心接受的證明)、相關檢索與隨機檢索的對照、91.7% 非逐字重現率、組合式家族對照,以及表 7 的資料庫規模掃描。撰寫上文數字前,曾以pdftotext -layout重新檢視表 7;論文的table-collapse警示指向另一個表格(附錄表 4),是標題列造成的假象。本文所有數字都須注意:檢索研究對每個定理只嘗試一次完整證明,不做修正,也沒有第二次取樣,因此測量的是檢索至提示的效果,而非方法章節所定義的具型別綱要重組。完整來源分析見 Evolutionary Proof Search - The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement — Duan、Liu、Tang、Chen、Zhou 等人(35 位作者;SJTU / Theseus Labs / Tsinghua / ByteDance / ModelBest / Xiaohongshu / Shanghai AI Lab / Humanlaya / Agent-Native Research Lab / Frontis.AI),The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement,arXiv 2609.11873,2026-09-10,79 頁(
practitioner-opinion)。本文引用 §3.5.1 的執行軌跡蒸餾分類法(文字記憶/結構化記憶/程序技能庫/可執行產物)、§3.5.3 的三個控制點——候選驗證(HDSO 的成對控制組與處理組准入、Metis 以重複出現為閘門的文字升級為程式碼)、資料庫維護(Library Drift 生命週期、上限及過度退役警告)與受治理的部署——以及 §6 關於持續狀態方向和啟用與忠實使用拆解的內容。全文均為次級來源:知識庫中沒有收錄任何一篇主要來源,因此上方所有描述都來自該調查。完整分析見 RSI Autonomy Levels (B0–L5) - Sidekick's continual learning loop — Andrew McNamara 與 Cody Mazza-Anthony,Shopify Engineering,2026-08-05,
case-study(完全來自第一方,且存在 COI;沒有複現,也沒有受控實驗組)。本文僅引用其第五種改善對象的論點,以及「整理對儲存」的註記:上文引述的固定模型架構、harness 趨平後的排序、每天對「累積資料」進行完整參數微調及其防止災難性遺忘的理由,以及訓練語料前的三道閘門(裁判評分的硬負例、必須通過重新評分的評論小組修正,以及將其餘案例升級處理)。本文沒有任何數字以此為關鍵依據。完整來源分析、蒸餾曲線、兩張僅含圖片的圖表,以及推測限制,見 Agent Quality Flywheel - Muscle Memory for Agents: Compile not Merely Retrieve — Omran、Lanka、Zhang 與 Dixit(Google Cloud FDE),arXiv 2608.08995,2026-08-10,
empirical:本文僅引用其 Related Work 的框架設定(它所對照的記憶/技能系統)、無記憶基線,以及 §6 中mannwhitneyu案例所界定的「產物勝過創造者」主張範圍。完整來源分析、結果表格及解析警示(表 1 儲存格合併並已重建;canary-recall回報ok,但實際上並未執行),見 LLM-as-Compiler Knowledge Base - Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails — Zhou Yu、Bin Bi、Shiva Kumar Pentyala、Shubham Mehrotra、Sougata Chaudhuri、Shilpa Bhagavath、Zeyuan Chen、Ran Xu、Phil Mui、James Zhu 與 Sitaram Asur(Salesforce AI Research),arXiv 2609.09134,2026-09-08,
empirical。本文僅引用 harness × 權重交互作用論點及其在本文分類法中的定位:向上移轉的設定、模仿導致的退步及規劃與知識的拆解,以及 on-policy 修正方案。該論文沒有任何數字是本文自身結果表格的關鍵依據。完整來源分析、解析警示及失敗模式案例研究,見 Agent-Authored Harness Optimization - Knowledge-Centric Self-Improvement — Xuefei (Julie) Wang、Lauren Hyoseo Yoon、Chengrui Qu、Amanda Zichang Wang、Atharva Sehgal、Eric Mazumdar 與 Yisong Yue(Caltech),Knowledge-Centric Self-Improvement,arXiv 2607.19592,2026-07-21,
empirical(32 頁,11 張表,8 張圖;NSF #2505096 / #2240110 及 OpenAI 與 Point72 贊助;程式碼位於 github.com/recursive-knowledge/KSI)。§3 的三階段整理協定;§4.1 以代理為核心的基準及表 1;§4.2 提示最佳化及表 2;§4.3 跨 LLM 泛化及表 3;§4.4 保留集移轉及表 4;附錄 C 的立場頻率(表 5)及三個已分析的意見分歧案例;附錄 E 的貼文與知識包綱要、MCP 檢索閘門及快取穩定提示切分;附錄 G 的成本計算;附錄 H 的基準來源、輸出隔離及資訊對等閘門;附錄 I 的超參數;附錄 J 的 Polyglot 移轉切分中相同練習的重疊;附錄 L 的知識移轉 adapter。依照圖片兩階段規則檢視圖 1 與圖 2——圖 1 的 Pareto 圖呈現 Polyglot 切片,且獨立重現表 1a 與表 2 中 Polyglot 的數據。解析註記:原始解析中,表 3 的 ARC-AGI-2 成本欄位儲存格合併(兩個模型的數值都落在 Haiku 列,GPT 列則為空);此處引述的 $80 ± 1 與 $20 ± 1 是從本機 PDF 的pdftotext -f 8 -layout輸出找回的。擷取檢查器對表 4 標記的欄位位移是誤報——該表是捐贈者對接收者矩陣,合理地重複模型名稱,且十二個儲存格都已重新對照 PDF 確認。表 1、2、5 都已與正文核對。單一實驗室的預印本;OUR 正式版本使用三個隨機種子,基準則是單次執行,沒有顯著性檢驗;兩個以代理為核心的基準皆由這些作者在替換 LLM 的情況下重新執行
Cited by 19
- LLM-as-Compiler Knowledge Base×7
Muscle Memory for Agents: Compile not Merely Retrieve (Pouya Ghiasnezhad Omran, Soujanya Lanka, Qin…
- Agent-Authored Harness Optimization×6
It is the only source that reports the loop terminating, and what the team did next. Every instance…
- Recursive Self-Improvement×4
A third self-improvement axis clarifies the vocabulary further, by scoring better on the properties…
- What Makes a Self-Improvement Artifact Transfer?×4
The controlled test still does not exist. No one has run both artifact classes under one protocol —…
- Bridgewater Associates×3
This is worth isolating as a claim about what the scarce input to an agent deployment actually is.…
- Agent Quality Flywheel×2
Knowledge Centric Self Improvement — the taxonomy of objects an improvement loop can persist into…
- Evolutionary Proof Search×2
The deeper difference is what persists. AlphaProof Nexus's population database and goal cache are…
- Harness Activation and Adherence×2
Does the activation gate behave the same way for declarative artifacts as for procedural ones?…
- Loop Engineering×2
Knowledge Centric Self Improvement — the memory primitive promoted to the object of improvement and…
- Open Questions Backlog×2
Knowledge Centric Self Improvement: Does the curated base keep adding value past 10 generations, or…
- OpenHands×2
Knowledge Centric Self Improvement — a reported Terminal-Bench 2 comparator (13.9% on the Haiku 4.5…
- RSI Autonomy Levels (B0–L5)×2
Three L4 results in the survey are load-bearing elsewhere in this wiki and are developed on the…
- Compounding Data Moat
Knowledge Centric Self Improvement — "model quality is rented" measured rather than asserted: a…
- Context Lifecycle Management
Knowledge Centric Self Improvement — the complementary half of the same boundary: this page governs…
- Cost-per-Task Over Cost-per-Token
Knowledge Centric Self Improvement — a self-improvement comparison run entirely in dollars rather…
- Agent Systems & Harness Engineering
Knowledge Centric Self Improvement — Caltech's inversion of self-improving agents: keep the agent…
- Multi-Agent Collective Intelligence
Knowledge Centric Self Improvement — the cooperative-collective case measured on benchmarks, with…
- Optimizer–Evaluator Decoupling
Knowledge Centric Self Improvement — the rule satisfied at one layer and absent at the next, which…
- Prompt-Cache Economics
Knowledge Centric Self Improvement — the design pattern this page prices, implemented in the wild:…
Related articles
- Agent-Authored Harness Optimization
An agent runs the whole eval-fix loop on its own harness — read traces, hypothesize, patch, re-run. Nine instances (Cli…
- Client-Side Agent Optimization
AgentOpt's framing of developer-controlled agent optimization (model-per-role, budget, routing) as distinct from server…
- Open Questions Backlog
Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…
- Agent Quality Flywheel
Google's eval-fix loop packaged as a skill your coding agent drives: Build & Test → Ship & Monitor → Learn & Refine, ex…
- Harness Shrinkage as Models Improve
Prompt scaffolding shrinks each model release; Cat Wu's pruning discipline; Boris Cherny "100 lines of code a year from…
