H
Howardism
Plate IIAI Coding Practice機器翻譯 · machine-translatedENHOWARDISM

由人類治理的技能維護

Shen & Hruschka (Megagon Labs, arXiv 2609.05677):首次縱向衡量誰在維護公開的 SKILL.md 檔案,以及維護工作包含哪些內容——在五個目的性挑選的 AI 工具儲存庫中,共有 254 次實質編輯,每次都由具名人類帳號撰寫或合併;其中 62% 帶有 AI 共同作者標記,但各儲存庫呈現明顯雙峰分布(93% / 92% / 16% / 5% / 0%);60% 是增補、38% 是修正,退役僅 254 次中 1 次;技能維持穩定至增補的狀態,中位維護間隔為 5 天;一項預先註冊且具足夠統計檢定力的遷移任務測試發現,維護後版本並不優於最早版本(1–5 分量表上 −0.09,CI [−0.28, +0.10])

Article metadata
Publication details
Published:September 22, 2026
Filed:Concept
Domain:AI Coding Practice
Tags:AI Coding WorkflowAgent EngineeringHarnessEngineering MetricsEmpirical
Reading:26 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

由人類治理的技能維護插圖

資料來源#

摘要#

自動化策展文獻將人類技能維護視為尚未衡量、亟待取代的瓶頸。Shen & Hruschka(Megagon Labs,arXiv 2609.05677,2026-09-04,empirical;獲 COLM 2026 Workshop on Lifelong Agents 接受)透過挖掘 git 歷史,直接衡量維護流程:五個將代理程式技能視為一級 Markdown 檔案來維護的公開儲存庫,從 2025 年 10 月到 2026 年 6 月共計 873 次提交、143 個追蹤改名歷程的 SKILL.md 檔案、631 筆提交與檔案的歷史紀錄、254 次建立後的實質編輯(變更至少 5 行、非機器人撰寫、非瑣碎變更)。研究有三項發現。**誰在維護:**每次實質編輯都由具名人類帳號撰寫或合併;254 次中有 158 次(62%)帶有 AI 共同作者標記,但這個整體數字掩蓋了雙峰分布——getsentry 與 trailofbits 分別為 93% 和 92%,obra 為 16%,anthropics 為 5%,cloudflare 為 0%。**維護什麼:**這些編輯確實是在策展,60% 為增補、38% 為修正,主要是擴充內容(72 次)和修正事實(56 次);整併(10 次)和退役(1 次)幾乎沒有。**是否有幫助:**一項預先註冊且具足夠統計檢定力的遷移任務研究發現,技能最新版與研究期間最早版本無法區分;以 1–5 分的評審品質量表計算為 −0.09,95% CI 為 [−0.28, +0.10]。作者為終身代理程式提出的說法是:公開技能維護「目前看起來不像自主化管線,更像由人類治理、AI 輔助的迴圈;未來的策展者必須以此為衡量基準,並在其中運作。」

本文是代理程式工作系統化中產物生命週期觀點的流程面對照:Gao 等人衡量多數採用的技能往後不再變動;本研究則衡量少數持續維護的技能實際如何維護,以及由誰維護。

證據說明。 這是 empirical 研究,須始終一併考量三項範圍限制。(1) 樣本是目的性挑選——選出五個持續有提交活動的 AI 工具組織,在編碼前即凍結並釘選樣本,沒有候選者普查——因此維護深度數據較像上限,各組織的治理比例取決於組織本身,不能視為母體基準率。(2) 操作類型與觸發因素標籤由 LLM 編碼(Opus 4.8 對全部 254 次編輯進行單次分析,並以相同模型對 50 次編輯樣本進行第二次分析),再由一位盲測的人類編碼者檢驗 50 次編輯樣本,並以跨模型家族重新編碼驗證;主要主張只依據二分的修正/增補分類(人類 κ 0.72),細分類數量僅作描述用途。(3)「由人類治理」的定義僅指具名人類帳號撰寫編輯,或透過網頁合併編輯——也就是 pull request 網頁合併流程,並非已核實的審核批准。論文發表於工作坊;作者釋出語料、編碼手冊、腳本及評估 harness。

語料,以及「實質」排除哪些內容#

repositorySKILL.md實質編輯編輯天數時間跨度
getsentry/skills2881402026-01 – 2026-06
trailofbits/skills7478222026-01 – 2026-06
obra/superpowers1462262025-10 – 2026-05
anthropics/skills1819112025-11 – 2026-06
cloudflare/skills914102026-02 – 2026-04
total143254

這些組織涵蓋應用程式監控(Sentry)、安全研究(Trail of Bits)、由單一維護者管理的個人收藏(obra)、網際網路基礎設施(Cloudflare)及 AI 實驗室(Anthropic)——它們全都是自家代理程式產品的使用者。研究單位是透過 git log --follow 追蹤的單一檔案;一次多檔案提交會依其觸及的技能各計一列,這點對下文很重要。依定義排除機器人撰寫的提交;作者也檢查這項排除並非「沒有只有代理程式參與的實質提交」這項發現的成因:排除的 13 次機器人提交全都透過平台網頁合併身分處理,其中只有 8 次原本可能符合實質編輯條件(在原本可能符合條件的集合中約占 3%)。對 50 次編輯進行稽核抽樣後,70% 被歸類為技能內容變更,其餘為遷移(8 次)、相依項目版本變動(5 次)及純格式調整(2 次)——因此實質編輯的定義並未被機械式變更主導,但約 30% 的紀錄並非策展,作者也未聲稱提出完整的維護分類法(適應/遷移編輯不在編碼手冊涵蓋範圍)。

誰在維護:每次發布都有具名人類,AI 揭露情況因儲存庫而異#

repositorynAI 標記人類提交人類合併(PR)
getsentry/skills81756–
trailofbits/skills787215
obra/superpowers621052–
anthropics/skills191–18
cloudflare/skills14–113
total2541586036

治理狀況是根據提交中繼資料確定性地推導而來(指明 AI 工具的 Co-Authored-By 標記;作者與提交者身分),遵循儲存庫挖掘的慣例,將該標記視為 AI 撰寫的訊號。254 次編輯中,158 次(62%)帶有 AI 共同作者標記;缺少標記的 96 次編輯中,有 60 次由人類撰寫並提交,36 次由人類撰寫並透過網頁合併。改以提交次數而非編輯列計算,比例為 61%(187 次中的 114 次)。在非機器人編輯中,每次編輯都由具名人類撰寫或合併,沒有觀察到僅由代理程式完成的實質提交——「這是關於提交歸屬的主張,而非經核實的作者身分。」

整體的 62% 描述的是雙峰分布,而非母體基準率。 單一維護者的專案幾乎全由人類撰寫(obra 有 84% 是人類提交);兩個組織幾乎將所有維護工作都透過人類合併的 pull request 處理,而且沒有共同作者標記(anthropics 有 95%、cloudflare 有 93% 由人類合併);另兩個組織則有絕大多數編輯是人類與 AI 工具共同署名(getsentry 為 93%,trailofbits 為 92%)。作者刻意按組織呈現治理情況,並引用 Yu 等人的結果:跨異質儲存庫彙總標記訊號可能導致結論反轉;他們明確指出,這種差異「同樣反映揭露與合併文化的分歧,也反映 AI 使用情況的分歧」——實際 AI 參與程度、標記產生做法、會丟棄標記的 squash 工作流程,以及各儲存庫的歸屬慣例,都無法從提交中繼資料中區分出來。

低估程度的參照點是 Anthropic 自己的儲存庫。 anthropics/skills 看起來是 19 次編輯中僅 1 次帶有標記;然而 Anthropic 表示,截至 2026 年 5 月,其生產程式碼庫中合併的程式碼有超過 80% 是由 Claude 撰寫,並採用由工程師主導的審查模式(Anthropic Institute 的〈When AI builds itself〉)。技能儲存庫屬於文件,而非生產程式碼,因此論文只用這項落差來標示低估幅度可能有多大,並未將其當作語料的比率。對標記訊號進行 50 次提交的人工作業稽核後發現,明確的自動注入情況很少(有標記的 25 次提交中有 1 次),而缺少標記的提交中有 2 次可找到獨立 AI 證據;另有 50 次中的 31 次無法判定——也就是「很少出現明確假陽性,但通常無法獨立驗證」,因此報告的 62% 嚴格來說只是標記可見的共同作者比例。研究全程區分四種構念:實際 AI 使用(未衡量)、標記可見的共同署名(有報告)、人類撰寫或合併的中繼資料(有報告),以及經核實的人類審核(無法從提交資料衡量)。

治理訊號無法預測編輯內容。 有 AI 標記與沒有標記的編輯,在規模上沒有差異(變更行數中位數分別為 15 與 21,Mann-Whitney p = 0.20),範圍也沒有差異(分別涉及 4 與 6 個檔案,p = 0.31)。編輯者類別也無法預測技能的哪些部分會變更:沒有任何元件的治理分布能通過三項預先註冊的控制檢驗(Holm 校正 Fisher、排除大量重構、按儲存庫分層的 Cochran–Mantel–Haenszel)。原始交叉表會造成誤導——frontmatter 編輯看似有 90% 帶有 AI 標記,高於 62% 的基準率(Fisher p < 10⁻³)——但這個效果完全是少數 AI 共同署名的多檔案重構所造成的擴散假象;排除它們後,剩下的六次 frontmatter 編輯比例回落到基準率(p = 1.0)。路由資訊(名稱/描述)呈現人類較多的傾向,標記比例為 47%;排除大量重構後此傾向仍成立(p = 0.015),但分層後不成立(p = 0.12),作者因此不作主張。這組檢驗的統計檢定力偏低,且進行了多重檢定,因此結論是「沒有偵測到分工差異」,而非「分布完全一致」。

維護內容:每兩次修補,就有三次增補#

每次編輯都依預先註冊的八種操作分類法編碼(論文圖 1;數字取自圖中文字層,並以 §4 和附錄 C 確認):

操作n類別
擴充內容72增補
修正事實56修正
重組50增補
修復失敗41修正
調整描述19增補
整併10增補
退役1增補
其他5—

套用經典 Swanson/ISO 14764 的修正與增補二分法(修正事實與修復失敗歸為修正;其餘五種歸為完善型增補)後,語料中有 152 次(60%)增補、97 次(38%)修正,另有 2% 為其他。僅擴充內容與修正事實兩類就占所有編輯的一半。採用更嚴格的分母只會讓差異更加明顯:35 次經稽核確認的策展編輯中,增補與修正比例為 77%/23%;每次提交等權計算時,在 187 次提交中比例為 67%/31%/2%——在所有檢視過的加權方式中,按編輯列計算的 60% 是最低的增補占比。

修正比例部分來自批次修補。 事實修正紀錄中,有 75% 來自多檔案大量重構的提交,主要是 trailofbits 一次規格修正貢獻的 25 列。排除 89 列大量重構紀錄(剩下 165 列)後,事實修正從第二大類降至第四(14 次);擴充內容(59 次)、修復失敗(41 次)和重組(31 次)則相當穩定。

幾乎沒有修剪。 整併(10 次)與退役(1 次)合計僅占編輯的 4.3%(254 次中的 11 次):「技能持續累積並被修正,遠多於被修剪;對於永無止境的技能學習中無限制增長的疑慮,這種模式有直接參考價值。」這是在流程層面確認了代理程式技術債在上下文層的複雜度遞增效應;研究對象是確實有人維護的技能,而非無人維護的副本。

依可靠性層級陳述。 八個細分類的同家族模型跨次一致性 κ = 0.62(原始一致率 0.70);跨家族重新編碼在 50 次編輯上降至 κ = 0.36/0.40,在全部 254 次上為 0.46;對 50 次編輯進行盲測人類重新編碼,κ = 0.46(95% CI [0.29, 0.62])。二分分類則較穩定:同家族 κ = 0.64(原始一致率 0.82),50 次編輯的跨家族 κ = 0.51–0.61,全部 254 次為 0.65(原始一致率 0.83),與人類編碼者比較則為 κ = 0.72(CI [0.51, 0.88])——人類與 LLM 在細分類上的 21 次分歧中,有 14 次仍落在同一個修正/增補類別。作者指出,在 n ≈ 50 時,κ = 0.62 的 95% 區間跨越 0.70 的慣用門檻,因此各細分類 κ 值應視為彼此無法區分。治理編碼是機械式處理,並用作品質控制檢查(254 個編碼標籤中有 252 個與中繼資料一致;兩個例外是標註錯誤)。

規則性軸未能通過門檻,這項失敗本身也提供資訊。 預先註冊的一項分析軸詢問每次編輯編碼的是可泛化規則,還是只適用於單一情境的修補。跨次一致性 κ = −0.02(原始一致率 0.56),主因是基準率悖論——第二次分析將 50 次編輯中的 38 次判定為規則型,因此觀察到的一致率略低於機率水準(0.57);經盛行率調整的 PABAK = 0.34,Gwet's AC1 = 0.44。依預先註冊規則,不報告其分布。之後以更窄的二分操作化方式進行跨家族重新編碼(只有新增的特定行明確陳述可重用規則時才算有規則),得到 κ = 0.43(原始一致率 0.72),顯示問題可能出在抽象的三分構念,而非規則這個想法本身;三分版本跨家族仍只有 κ = 0.17,「兩個模型家族給出幾乎相同的邊際分布,卻將規則分配給不同的編輯,證實這個軸衡量的是雜訊。」這帶來的設計後果是:策展者若要從編輯中歸納規則,就會遇上兩次獨立 LLM 分析都無法克服的編碼障礙。

原因:失敗證據取決於所用工具#

觸發因素證據依 0–3 級階梯編碼(L3:明確連結到問題或失敗;L2:指出具體失敗;L1:一般性描述;L0:無)。依主要分析結果,254 次編輯中有 61 次(24%)帶有具體失敗證據(L2/L3),其中 12 次為 L3;其餘 193 次是未明確連結到特定失敗的一般維護;沒有任何編輯落在 L0。跨次一致性 κ = 0.59,勉強達標,且分歧方向性明顯。提交後進行的跨家族重新編碼(gpt-5.5,使用相同編碼手冊)將 63% 的編輯解讀為帶有具體證據(與主要分析結果比較,κ = 0.18),幾乎全是把 L1 編輯升為 L2,同時確認主要分析中 61 次 L2/L3 編輯裡的 59 次。因此 24% 是較嚴格的判讀,不是穩定數值;作者不會從觸發因素計數推導結構性主張,而是將其記為其他人重用編碼手冊時的校準提醒。他們提出的設計啟示才是重點:目前還無法穩定衡量失敗脈絡,因而不能將其當作策展者的主要監督目標。

技能如何演變:維護頻繁、穩定至增補,且集中在內文#

在 至少有兩筆大小觀察值的 120 個技能中,32 個的常駐 token 長度增加超過 10%,7 個縮短超過 10%,81 個維持穩定。相鄰提交觸及同一技能的時間中位數為 5 天(涵蓋所有技能檔案提交的 488 個間隔;僅看實質編輯時結果不變),但各組織不同,從 obra 的 1.5 天中位數到 trailofbits 的 14.5 天。研究窗口右設限於 5–8 個月,資料深度也不一,因此作者不採取複利增長或衰退的敘事:「維護頻繁且主要呈現穩定至增補狀態,既沒有全面複利增長,也沒有淨衰退。」深度維護只占少數:以至少 5 行門檻並計入大量重構,27 個技能有至少 3 次實質編輯;套用更嚴格條件後,分別降至 22、16、15 個。

確定性解析器將每個 SKILL.md 拆成六個元件,並歸屬每一行變更(254 次編輯全部完成歸屬):85% 的編輯涉及指令、56% 涉及嵌入式程式碼、38% 涉及名稱/描述路由資訊、15% 涉及 frontmatter、11% 涉及範例,4% 涉及獨立參考資料。維護主要是內文工作;代理程式上下文檔案視為啟動契約的路由介面,受到觸及的比例不到五分之二。

維護是否有幫助?有統計檢定力的有限零結果#

論文的第二項貢獻,是預先註冊的試驗重現;先前試驗曾指出維護後版本優於最早版本。先前試驗有四項缺陷——解題模型只看 SKILL.md,而非完整套件;單輪對話;評審與解題模型來自同一供應商;統計檢定力約 20%——新研究逐一修正。**設計:**從四個儲存庫挑選 13 個至少有 6 次實質編輯的公開技能,每個技能有 11 個遷移任務(總計 143 個;設計成測試技能所屬領域,但不洩漏其慣例,並已凍結及雜湊);實驗條件為 {無技能、v_old(當前路徑上的研究期間最早版本)、v_new(最新版)},每個條件組合有三次獨立重複;解題模型為 gpt-5.4-mini,透過按需讀取檔案來取得完整套件,並採用回合數相同的多輪流程(最多三輪,由受限的 gpt-4o-mini 使用者模擬器根據任務簡述回答);一組封存的盲測 Claude 評審以正確性、涵蓋度、可行性與非冗餘性(1–5 分)為去識別、移除特徵資訊並隨機排序的三元組評分;另以 gpt-5.5 參照組評審 100 組三元組。推論單位是技能(n = 13);在固定 N 的前提下,對先前試驗規模的效果,預先註冊的檢定力從 0.77(符號檢定)到 0.90(t-檢定)。

**結果:**技能層級的 v_new − v_old 差異為 −0.09(95% CI [−0.28, +0.10];符號檢定 p = 0.58;Wilcoxon p = 0.55;d = −0.29;13 個技能中有 5 個偏好 v_new)。控制長度重新分析後結果仍相近(−0.06,p = 0.58),僅看深度維護的五個技能時也一致(−0.14);以較弱、非推理型解題模型(gpt-4o-mini)重新測試四個深度維護技能,結果約為 0,因此不是解題模型能力太強所造成的天花板效應。探索性的「維護版與無技能」比較同樣沒有顯著差異。評分 harness 是較弱的一環,作者也坦承如此:在 100 組重疊三元組上,跨模型家族的評審一致性為 Spearman 0.51,單次測量 ICC(2,1) = 0.52,低於預先註冊的 0.6 門檻;因此測量雜訊可能會削弱小幅真實效果,而信賴區間也容許小幅正向效果。應解讀為「在這個 harness 下,沒有證據支持維護帶來先前試驗規模的效益」,而非「維護毫無作用」——這是在作者與模型共同建構的遷移任務上得到的有限零結果,不適用於儲存庫的原生工作流程。

**為何各技能效果不同。**兩個極端案例(圖 3)的長度都大約增加一至三倍,因此長度不是區別因素。brainstorming(−0.95)新增了結構化引導步驟——設計前把關、檢查表、流程圖——在一次性的遷移任務中引導解題模型轉向流程管理,反而壓低設計內容(評審判定的涵蓋度從 2.06 降至 1.33,兩個技能版本都低於無技能基準)。pr-writer(+0.31)新增了輸出限制——重寫而非附加、以散文取代標題、禁止使用佔位參照——這些要求轉移到了受評產物上(非冗餘性從 3.45 提升至 4.58)。在 13 個技能中,兩種模式彼此抵銷(5 個正向、8 個負向)。先前試驗看似有益的結果,「在異質技能集以遷移任務評分後就平均抵銷了」。先前試驗實際發現的是:任務層級符號檢定中有 15 次勝出、6 次落敗、9 次平手(p = 0.08);評分規準的 Wilcoxon 檢定為 p = 0.02,平均增益 +0.27;技能相較無技能基準則以 12 比 45 大幅落後,後來證實這是單輪對話造成的假象(若技能會先提出澄清問題,不完整的答案就會受到懲罰)。

這是Harness 啟動與遵循所提出分解方式在人類維護情境中的實例:該文發現不同演化方法的產物更新能力都相近,但效益會隨使用者而變;本研究則發現人類更新六輪以上後,產生的版本並未讓下游解題模型獲得可測量的效益。兩者從不同方向指出同一件事:產物有變動,不代表產物有所改善;效益取決於產物、使用者與任務三者的組合,而非編輯歷史。

自動化策展者的設計啟示與重播流程#

作者提出五項「根據觀察到的維護模式而來、但尚未驗證的假設」:

  1. 明確編列修剪預算——整併與退役僅占人類編輯的 4.3%,因此策展者可能需要明確的整併/退役預算。
  2. 由人類掌握策展工作的發布或合併權限——每次實質編輯都經過具名人類參與的儲存庫流程,因此自主策展者應在該關口呈現建議變更。
  3. 監督時不可只依賴失敗脈絡——具體證據占比取決於所用工具(24% 對 63%),在單一模型家族內的一致性也僅勉強達標,規則性分類更未通過門檻。
  4. 先按操作類型分類,再考量大小——操作類型是編碼一致性最高的軸;治理狀況無法預測規模或範圍。
  5. 按儲存庫建模治理狀況,不要當成單一的全域分布。

討論中將這些發現與知識庫已有的兩種願景作對照:Karpathy 的 LLM wiki,即「由代理程式維護、幾乎不需人力成本、彼此連結的 Markdown 知識庫」;以及 WiNELL 永無止境更新 Wikipedia 供人類審查的構想——「我們的衡量結果顯示,觀察到的迴圈仍透過由人類掌控的儲存庫流程運作。」作者建議的策展者更接近對具型別知識庫進行永續學習:記錄可追溯的編輯理由,再將其整併為經維護者核准的一般性指引,而非根據個別案例重寫技能文字。

釋出的語料支援一項重播流程(並非基準測試——沒有保留測試的排行榜,也沒有基準策展者):輸入先前版本的 SKILL.md,以及當時可用的脈絡(提交訊息、相關 issue/PR、儲存庫);以後續人類實質編輯為目標;依時間順序對每個技能切分,或採用保留儲存庫的留出法;評估操作類型與元件是否符合、正規化 token 重疊率、單句摘要的 ROUGE-L、WiNELL 風格的原子事實涵蓋度(軟比對:事實出現在任何位置即可;硬比對:事實必須出現在正確元件——WiNELL 發現,模型更常能辨認該新增什麼,而非該放在哪裡),以及一項修剪檢查——策展者是否曾整併或退役,而非一味新增;以人類約 4% 的比例作為帶有雜訊的參照值,而非目標值。

放在其他語料中解讀#

  • 對照 Gao 等人的生命週期研究(agentic-work-systematization)。 兩項研究並不矛盾,而是取樣同一分布的兩端。Gao 等人發現,在 5,876 個 GitHub 儲存庫中,有 53% 的採用技能從未修改,維護時新增與移除的比例為 2.7:1;本研究則挑選五個因為持續有維護活動而入選的儲存庫,發現維護間隔中位數為 5 天。兩者都支持「少數核心持續維護,多數外圍技能無人維護」的情況,也都發現累積多於修剪——前者新增與移除比例為 2.7:1,後者整併加退役占 4.3%——但衡量的是不同構念(變動方向對照主要目的),因此數字相互印證,而非重現同一結果。
  • 對照上下文檔案的增補型態。 論文對其穩定至增補的大小軌跡,與 AGENTS.md/README 類上下文檔案呈現的增補主導型態,提出「僅供參考、尚未嚴謹建立的對照」,並指出兩者指標不同(常駐 token 淨變化軌跡,對照每次提交的字詞新增/刪除數)。相關研究顯示,提示檔、規則檔與上下文檔案挖掘研究都呈現增補主導特徵;CI 工作流程編輯則偏向修改。
  • 對照知識庫中的 harness 縮減主題。 有時有人將零結果解讀為「更強的模型能繞過過時技能」,並視為支持模型進步後 harness 縮減的證據。但這並不成立:較弱解題模型的測試組(gpt-4o-mini)結果也約為 0,因此研究中的任何能力層級都沒有從新版獲益。零結果指出的是,維護後的內容無法遷移到建構的任務上——這反映編輯新增了什麼,而非模型不再需要什麼。
  • 對照知識庫自身的實務。 這個 wiki 是由代理程式彙編而成、遵循 Karpathy 模式的知識庫;論文衡量的最相近公開案例——由供應商維護的技能儲存庫——會讓每項實質變更都經過人類發布關卡,而且即使維護六輪,產物在遷移任務上的表現仍無可測量的改善。這裡的彙編流程由人類負責合併,但完全沒有衡量維護效益。

關聯文章#

  • 代理程式文件行為——這是本文追蹤其編輯歷史之產物類別的使用面。Gao & Chen 衡量這些檔案在真實工作階段中被觸及的頻率(3,033 次文件互動中,指令檔占 35.4%;代理程式工作筆記占 25.1%;生產環境的查閱率是諮詢率的 0.87 倍),以及代理程式在公開 PR 中重寫這些檔案的頻率(AGENTS.md 692 次、CLAUDE.md 362 次、copilot-instructions.md 287 次)——本文發現同一個輸出轉輸入的迴圈,每次實質編輯仍都經過具名人類。
  • 代理程式工作系統化——補足本文的採用與生命週期文章:Codex 遙測衡量技能的使用情況,Gao 等人衡量複製後的產物如何變化(多半毫無變化),本文則衡量少數持續維護的技能實際接受了哪些維護,以及由誰執行。
  • 代理程式技術債——流程層級的複雜度遞增效應:對積極維護的技能進行 254 次實質編輯,只有一次退役內容,十次整併內容;持續維護的技能群體和被棄置的群體一樣不斷累積。
  • 代理程式上下文檔案——高一層的產物家族;論文的相關研究脈絡將 AGENTS.md/README 挖掘(粗略、未編碼、沒有作者資訊)和針對 CLAUDE.md 維護的註冊報告,與本文的編碼分類法並列;元件歸屬結果則顯示維護主要發生在內文(指令 85%),而非路由資訊(38%)。
  • Harness 啟動與遵循——同樣拆分「更新」與「效益」,但演化者是人類:六輪以上的維護,產生的版本在遷移任務上未讓任何解題模型層級獲得可測量的效益。
  • LLM 編譯器知識庫——論文引用 LLM wiki 「幾乎零人力成本」策展願景,並以研究結果界定其適用範圍:觀察到的迴圈仍透過人類掌控的儲存庫流程運作;若策展者要從編輯中歸納規則,就會遇上規則性編碼失敗的問題。
  • 代理程式貢獻下的開放原始碼——以 Co-Authored-By 標記作為來源訊號及其限制:很少明確出現假陽性、通常無法獨立驗證,也可能因 squash 工作流程而遭移除,因此某個儲存庫的 0% 並不表示它沒有使用 AI。
  • 代理程式供應商異質性——同樣警告不要彙總:前文的代理程式與人類差異主要受供應商身分影響;本文的 AI 與人類差異主要受儲存庫揭露文化影響;兩篇論文都引用標記訊號中的 Simpson 反轉結果,說明應按分析單位分別報告。
  • Skill Lift——兩項技能效益衡量對效果方向結論不同,但對限制的看法一致:NVIDIA 的 +41 正確性是在根據受測技能生成的評估集上衡量;本文的零結果是在作者與模型建構的遷移任務上衡量,評審組甚至未通過自身的可靠性門檻;兩者都沒有獨立來源的任務集。
  • 模型進步後 harness 縮減——零結果不是縮減證據:較弱解題模型的測試組結果也約為 0,因此任何解題模型層級都無法從維護後版本受益。
  • 分層監督——這些產物所屬的層次:在 Stolze & Strässle 的分類中,SKILL.md 檔案屬於「預防性護欄」(將意圖外部化到指引檔案中,卻沒有任何機制檢查);本文首次衡量這一層由誰維護,以及維護有沒有成效——遷移任務的零結果顯示,這一層的維護成效也未獲驗證。

待解決的問題#

  • 維護效益的零結果,在技能作者沒有建構的任務上仍成立嗎?95% CI [−0.28, +0.10] 容許小幅正向效果;評審組的 ICC(2,1) = 0.52 低於預先註冊的 0.6 門檻;任務也是作者與模型共同生成的遷移情境,而非儲存庫原生工作流程。釋出的 harness 讓這項測試成本不高:在獨立來源的任務集(例如 SWE-Skills-Bench 風格的真實儲存庫任務)上,重跑同一批 13 個技能的 v_old/v_new 配對,並以通過自身門檻的評審組回報技能層級差值。
  • 標記的雙峰差異代表 AI 使用程度,還是揭露文化?getsentry 和 trailofbits 的編輯標記率為 92–93%,anthropics 為 5%,cloudflare 為 0%——但 Anthropic 表示其合併的生產程式碼中超過 80% 由 Claude 撰寫。論文無法區分實際參與情況、標記慣例與 squash 工作流程。可用各儲存庫的標記率搭配其合併設定(是否啟用 squash)及維護者使用的代理程式工具來檢驗,也可直接詢問維護者。
  • 是否有任何工具能可靠編碼技能編輯是否包含可重用規則?抽象的三分軸在同家族分析中 κ = −0.02、跨家族 κ = 0.17;較窄的二分操作化方式(新增的特定行是否明確陳述規則)則達 κ = 0.43。若沒有任何操作化方式能超過 0.6,論文提出的「從人類編輯中歸納規則」策展設計就沒有可用的監督訊號;若能找到一種,原先有結果卻未公布的分布便可報告。可用新編碼手冊在釋出的 254 次編輯語料上檢驗。

資料來源#

  • From Agent Behaviour to Agent-Friendly Documentation — Gao & Chen(Peking University),arXiv 2608.20195,2026-08-20,empirical。本文引用此研究,只用來補充互動量資料,與本文的編輯歷史衡量相對照:§4.1.2/表 1(指令檔 1,074 次事件,工作筆記 760 次)、§4.1.3(生產環境 1,401 次,諮詢 1,615 次的 0.87 倍),以及 §4.3(AGENTS.md/CLAUDE.md/copilot-instructions.md 是 33,097 個代理程式 PR 中變動最頻繁的文件之一)。該研究沒有編碼作者資訊或治理訊號,因此無法說明由誰進行編輯。完整討論見代理程式文件行為
  • Who Maintains Agent Skills? A Longitudinal Study of Human-Governed, AI-Assisted Skill Maintenance — Chen Shen & Estevam Hruschka(Megagon Labs),Who Maintains Agent Skills? A Longitudinal Study of Human-Governed, AI-Assisted Skill Maintenance,arXiv 2609.05677 v1,2026-09-04,18 頁,empirical;PDF 頁尾(而非 abs 頁面)寫著「Accepted at the COLM 2026 Workshop on Lifelong Agents」。§3(語料、實質編輯定義、機器人篩選檢查、三套編碼手冊)、§4+圖 1+附錄 A/C(操作類型數量、二分分類、可靠性階梯、大量重構敏感度、規則性分類失敗)、§5+圖 4+附錄 B(大小軌跡、維護間隔、元件歸屬)、§6+圖 2+表 3(治理情況、構念效度、anthropics 參照點、規模/範圍無差異)、§7+圖 3+附錄 D(具統計檢定力的遷移任務零結果及其取代的先前試驗)、§8(策展者設計假設)、附錄 E(重播流程)。**本頁慣例中的解析警告:**表 5(四個編輯範例)有未標示的列錯位——原始資料中第 1、2 列內容互相溢出;正確對應方式記錄於原始資料的 [!note] 區塊,本文未引用其中任何儲存格。表 6(穩健性檢驗組合)有未標示的整欄合併——每列的「Statistic / check」欄都重複同一段串接內容;上文引用的各列數值取自 pdftotext -layout 和附錄 D 的文字。表 2 的 table-collapse 警告是假警報(日期範圍使用 en dash)。圖 1 的八種操作計數只以圖片形式存在;研究者從圖中洩漏的文字層找回數據,並以 §4 和附錄 C 確認。五張圖都已檢視,圖說對應關係也已確認。
§ end
Cited by 12
  • Agent Context Files×4

    Agents rewrite this file class at scale. Among the most-changed individual documentation files in…

  • Agentic Technical Debt×3

    And on the skills that are maintained, the ratchet is the same shape. Gao et al. sample the whole…

  • Agentic Work Systematization×3

    What the maintenance consists of is 60% enhancement, 38% correction (content expansion 72, factual…

  • Harness Activation and Adherence×3

    Human Governed Skill Maintenance — the updating-is-not-benefit split with a human evolver: six-plus…

  • LLM-as-Compiler Knowledge Base×3

    Karpathy's design document promises an agent-maintained knowledge base at near-zero human cost, and…

  • Agent Documentation Behavior

    Human Governed Skill Maintenance — the maintenance side of the artefact class this paper counts:…

  • Agent-Vendor Heterogeneity

    Human Governed Skill Maintenance — the same pooling warning on the human-vs-AI axis: a 62%…

  • Layered Supervision

    Human Governed Skill Maintenance — the preventive-guardrail layer's maintenance, measured: 254…

  • AI Coding Practice

    Human Governed Skill Maintenance — Shen & Hruschka (Megagon Labs, arXiv 2609.05677): the first…

  • Open Questions Backlog

    Human Governed Skill Maintenance ×3 (oldest 7d) — Does the maintenance-benefit null survive tasks…

  • Open Source Under Agent Contributions

    Human Governed Skill Maintenance — the Co-Authored-By trailer as a provenance signal, audited: on…

  • Skill Lift

    Human Governed Skill Maintenance — the opposite sign from a design with the opposite weakness: a…

Related articles
  • Agent Context Files

    The cross-vendor markdown-as-control-plane pattern: repo-versioned plaintext (CLAUDE.md / AGENTS.md / SOUL.md / WORKFLO…

  • Open Questions Backlog

    Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…

  • Verification as the New Bottleneck

    Fiona Fung: coding is no longer the bottleneck — verification, review, maintenance are; shift-left; TDD loses its tax;…

  • Acceleration Whiplash

    Faros 2026: AI floods a human-paced SDLC with output it can't absorb — throughput up (tasks +34%, epics +66%), quality…

  • Agent Documentation Behavior

    The first trace measurement of what coding agents actually do with documentation (Gao & Chen, arXiv 2608.20195): across…