H
Howardism
Plate IIModel Capability & Training機器翻譯 · machine-translatedENHOWARDISM

資料之牆與驗證公地其實是同一項供給限制

兩個待解問題都在問:某項供給是否會在預測軌跡到達前耗盡——一個關乎擴大規模所需的訓練資料,另一個關乎達到 Stockfish 門檻所需的人類驗證者——結果竟是同一個問題,因為兩種供給都是*經驗證的判斷*。語料庫中經實測的一面指出,預訓練 token 之牆不會依其自身條件獨自構成限制:自我生成資料所需 FLOPs 很少,真正限制它的是驗證器是否可用、驗證器的*延遲*,以及生成器的多樣性崩塌。因此,資料之牆並未降格為運算力問題(如 RSI 摩擦因素綜述所言),而是轉化為該文已列為首位的驗證摩擦。至於先後順序,答案是有所保留的否定:語料庫中沒有任何領域顯示公地規模的驗證者耗竭(Lovett 本人也如此表示),最接近的實測案例是大腸鏡檢查中的技能退化;整體風險比原先所述更小,因為可驗證性同時決定門檻何時到來,以及驗證者何時不再必要——但在下一層的子任務邊界上,風險又比原先所述更尖銳:形式數學已顯示,在可驗證的階段完全自動化後,人類剩餘的工作(檢查形式化,而非證明本身)仍會留在其中。

Article metadata
Publication details
Published:August 17, 2026
Filed:Essay
Domain:Model Capability & Training
Tags:DerivedData WallVerificationSynthetic DataForecastingWorkforce
Reading:22 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

《資料之牆與驗證公地其實是同一項供給限制》插圖

兩個問題#

兩個來自不同領域的 #oq/now 待解項目,因為都在問兩種供給的同一件事,所以合併為一篇綜述:

  1. Effective Compute Scaling — 資料生成(合成、模擬、互動式)真的能跟上模型規模的增長嗎?還是資料之牆會先構成限制?
  2. Post-Scarcity Macroeconomics — 如果驗證能力是公地,而 Stockfish 門檻在不同領域以不均勻的速度到來,那麼在仍需要驗證者的領域,門檻到來前公地就會遭到耗盡。是否有任何領域觀察到這種先後順序?

兩者都在問,某項供給是否會在預測軌跡完成前耗盡。結果發現,每個問題的答案都取決於同一項稀缺資源:既不是 token,也不是人,而是可靠、便宜、快速的驗證器;沒有驗證器時,才會退而仰賴人類。

本文對既有摩擦排名的補充#

RSI Growth Curves: Which Friction Binds First? 為 DeepMind 的六項摩擦因素排序,將資料之牆列在第 4 級——兩家實驗室都「將它降級」,理由是合成資料與蒸餾回流資料會「隨運算力一同擴展」,因此原本預期會受它限制的指數成長,反而能吸收這項摩擦。該頁的排名以兩份 2026 年實驗室報告為依據(From AGI to ASI、When AI builds itself),兩者都是預測文件。

此後,語料庫補上了這個機制經過實測與教學的一面——CS329A 系列課程講義,於 2026-08 彙整——而且並不支持這種降級說法。結果顯示,自我生成資料所需 FLOPs 很少,限制它的是三項非運算力因素:是否有驗證器、驗證器運作有多快,以及生成器是否持續產出真正不同的結果。因此,資料之牆並未轉化為運算力問題,而是轉化為驗證與監督摩擦,正是同一頁早已排在首位的項目。這會收緊既有排名,而非增添新項目:六項摩擦中有兩項其實是同一項,而且它既限制迴圈的輸入供給,也限制輸出檢查。

本文也做了摩擦排名頁未做的事:將同一項限制套用到勞動力面向;在那裡,同樣的稀缺性稱為公地。

Q1——資料之牆會先構成限制嗎?#

簡短回答:不會,而「跟上」是錯誤的切入角度。 預訓練 token 之牆尚未到來,就已被驗證供給之牆取代;後者並非在整個前沿均勻分布,而是在不同任務拆解間呈現參差不齊的狀態。

預測方的主張#

Effective Compute Scaling 引述 DeepMind 的判斷:高品質預訓練文本耗盡「是一項摩擦,而不是根本障礙」——因為合成/自我生成資料(將測試時搜尋蒸餾回權重的 AlphaZero 式做法)、模擬與互動資料,以及其他模態,都有望透過運算力以相近速度擴展。AGI-to-ASI Pathways 將它列為六項摩擦中的第一項,並提出相同的反駁。兩者都屬於 prediction 層級——報告中的預測,資料供給主張背後沒有測量,因此應視為 DeepMind 的說法,而非已確立的事實。Intelligence Explosion Dynamics 也將同一機制列為四種 RSI 引擎之一(「資料」——由 AI 為下一代策展並生成更高品質的資料集),來源與層級相同,並自行加註保留:迭代遞迴「往往會停滯……或退化」。

語料庫對這條脫困路徑實際測量了什麼#

維基所收錄關於自我生成訓練資料的所有具體結果,都指出真正的限制項不是數量。

  • 這個迴圈幾輪之後就會停滯,並非運算力不足所致。 STaR 是實際運作的原型——生成推理鏈、保留廉價驗證器接受的結果、微調,再重複——而課程本身的總結是:「這其實不太算真正的 RL……如果你基本上反覆做這件事,過一陣子就會開始停滯。」限制它的是基礎模型的能力範圍,以及篩選器是否可用,這也解釋了為何整個文獻都集中在數學與程式碼。
  • 這種停滯有明確的機制名稱,而且關乎分布。 Multiagent Finetuning(ICLR 2025,透過 CS329A 第 9 講)指出多樣性崩塌:即使「溫度很高」,單一模型生成的內容仍會收斂,因為預訓練的多樣性來自「人類長期生成的文本」,而模型重新生成自己的訓練集,等於壓縮一個同時又被它縮窄的分布(Rationale Bootstrapping (STaR))。讓同一模型製造更多 token,並不會製造更多資訊。
  • 同樣的上限在推論時也出現過兩次。 只有在生成仍具隨機性時,重複取樣才有效;溫度超過約 1.2 後,額外多樣性便會退化成亂碼(Latent Capability Overhang)。而 Selection Under a Submission Budget 明確說明,外推覆蓋率冪律的限制是:「如果你多取樣 10 倍……但沒有得到更多樣的解答,實際上就不會有改善。」三種獨立說法指向同一限制——燃料是多樣性,而 FLOPs 買不到多樣性。
  • 驗證器免費時,迴圈便能閉合,人類輸入也可以完全移除。 RLEF 將直譯器納入訓練迴圈,提升整條「解題率對預算」曲線,因此用更少樣本就能達到相同水準。Absolute Zero 更進一步,移除由人類策展的題目集,改由一個模型提出任務、另一個模型用程式碼解題,因為直譯器是免費的驗證器;它使用可學習性獎勵(1 − average success rate),只有在解題模型有時會失敗的任務上,才獎勵出題模型(Rationale Bootstrapping (STaR))。據報導,它在程式碼基準測試上達到最先進水準,完全沒有使用人類策展的提示資料——practitioner-opinion,根據投影片讀得的 ASR,沒有留下任何圖表。

三項配給限制,以及階梯上原先漏掉的一項#

綜合以上,合成資料供給受到下列因素配給:

  1. 驗證器是否存在。 The Verifiability Thesis 的四階驗證器階梯——形式證明、單元測試、輸出等價、以模型為基礎的評分——依照可以免費取得的驗證程度排序;生成與驗證的落差存在於第 4 階。有人提議以 LLM 評審團延伸到軟性領域,但語料庫的測量結果與此相反:無參照評審會過度給分,彼此錯誤的相關係數為 ρ = 0.664–0.972,並非獨立投票。
  2. 驗證器延遲。 CS329A 第 9 講新增、本文視為關鍵的一個維度:「在 RL 微調或測試時擴展中,我們需要這些驗證器幾乎即時運作……如果 RL 訓練需要數百或數千輪迭代,我們不能等上好幾天。」晶片設計模擬或濕實驗室檢測是完美的驗證器,卻也毫無用處。若將耗時數天的獎勵乘上數千個 RL 步驟,該領域在原理上完全可驗證,實務上卻無法驗證(The Verifiability Thesis)。再多運算力也改變不了這點;唯一提到的替代方法是學習式代理模型,但其通用性「取決於你有多少資料」——也就是把資料問題往下一層重述。
  3. 生成器多樣性,如上所述。

關鍵是,可驗證性是任務拆解的屬性,而非領域的屬性——Chowdhery 的 KernelBench 範例:編譯器輸出與執行結果可為單一 GPU 核心提供免費驗證器,但若要閱讀串接程式的效能分析結果,就沒有同樣的驗證器(The Verifiability Thesis)。因此,即使在看似已解決的領域內,供給仍參差不齊。

語料庫自身 2025 年末的資料顯示,限制已經轉移#

Effective Compute Scaling 記錄了 Aakanksha Chowdhery 的估計:一年內,RL 與預訓練的比例從約 99:1 變成可能的 95:5;Grok 4 公開宣稱有 50% 的 RL——她隨即也對此評價:成效「並未按比例改善」,因為「瓶頸在於獎勵不夠強,或獎勵中存在雜訊」。這些數字屬於 practitioner-opinion——講師未附來源的回憶,並明確指出並非任何實驗室公開的數字。這筆資料只支持一個方向:在邊際上,後訓練項受獎勵限制,而非受運算力限制;提高它在整體執行中的占比,並未明顯帶來轉化。

不宜把這看成好消息的反證#

這條脫困路徑不能取代擴大規模。兩位講師各自指出,較大型模型更能吸收自我改進飛輪的效果——這是 Absolute Zero 自身的結果,也獲 SWiRL 的 RL 面向印證——於是,The Bitter Lesson 便出現在這套為了繞過資料之牆而建立的方法之中(Rationale Bootstrapping (STaR))。自我生成資料與運算力是互補關係,所以它既無法挽救停滯的擴展曲線,也不會限制仍在運作的曲線。

Q1 結論#

在可驗證的領域內,資料生成能跟上模型規模增長;維基在這些領域有存在性證明(RLEF、Absolute Zero、AlphaCode 的百萬樣本流程)。在其他領域則無法跟上,而運算力預算無從改變這點,因為缺少的是對正確性的判斷,而非文本數量。因此,資料之牆不會以問題所想像的形式——token 耗盡——「先行構成限制」,也不會就此消失。它改變了衡量單位,從 token 變成經驗證的判斷;換了單位後,它與 Q2 的限制便是同一個。

Q2——是否觀察到這種先後順序?#

簡短回答:尚未達到公地規模,而且語料庫明確指出原因。一個領域測得侵蝕的一面;形式數學顯示風險在問題所指層級之下一層的形態;整體的先後順序風險則因一項結構性理由而小於問題假設。

先坦承沒有觀察到#

這個維基中沒有任何資料觀察到職業層級的驗證能力耗竭。Lovett 在論文中談及自己的架構時也如此表示:「本文描述的職業層級耗竭是結構性預測……而非已觀察到的結果」——他也將自己的主張分入證據階梯的第 2 與第 3 級。語料庫還收錄了正在形成的反證:丹麥兩年生成式 AI 採用期間,薪資與工時皆無顯著影響;Ramp 公司樣本中,密集採用者的初階職位人數成長最快(+12.0%);以及 AEI 調查發現,委派工作較多的人反而更樂觀,且沒有自陳學習能力下降(The Tragedy of the Cognitive Commons)。按設計,讓這種先後順序變得可見的機制——機制 2,即增強能力卻未內化——無法被目前蒐集的任何指標觀察到,因為「就業數字看起來可能仍然健康,能力再生品質卻在無聲中退化」。這裡的否定判斷,部分是在說明測量工具的限制,而非世界本身的狀況。

唯一實測到先侵蝕、後達門檻的案例#

大腸鏡篩檢。 Budzyń 等人(2025 年《Lancet Gastroenterology & Hepatology》,此處透過 The Tragedy of the Cognitive Commons 二手引述)發現,內視鏡醫師採用 AI 輔助偵測後,其獨立偵測準確率下降——這是語料庫中最明確的實測技能退化案例,發生在安全攸關領域,而 Stockfish 門檻顯然尚未到來(AI 偵測仍只是輔助,結果仍交由臨床醫師判讀)。這符合問題字面所問的先後順序:在仍需要驗證者的領域,驗證能力已經退化。

三項保留說明,讓這個案例還不足以定論公地問題:

  • 它測量的是現有人力存量的萎縮,而非再生機制失靈。Lovett 討論的是人才管線;此處談的是已身在其中的從業者。機制不同,方向相同。
  • 在 Lovett 的架構中,醫療屬於低脆弱性群組——執照制度與安全攸關性理應形成反向壓力——因此唯一實測案例恰好出現在架構預測最能長期抵抗退化的領域;這可能強化發現,也可能代表五因素模型設定有誤。語料庫無法判定是哪一種。
  • 這項研究在此維基中是二手資料;raw/ 中沒有原始研究。

其他測量也顯示相同的失敗形態,方向一致,但都未達公地規模:在帶有偏見的 AI 建議中,80.7% 的參與者察覺到錯誤,卻仍照做,之後在沒有 AI 輔助時又重現了偏見(Vicente & Matute 2023);Dell'Acqua 的精英顧問在 AI 能力前沿內表現提升、前沿外卻下降,而且無法判斷任務位於哪一側;而 Contractor & Reyes 隨機分配 AI 使用權,發現採用自動化模式的使用者,在移除 AI 後增益消失;採用增強模式者一週後仍保有 +0.29 SD 的增益——這是在受控條件下量得的機制 2,試驗則是在有監考的一週實驗室中,由精英大學生參與。

軟體工程:Musk 點名的領域,以及當地實際測到的情況#

Musk 自己舉的例子是軟體——「AI 至少勝過 90% 的專業軟體工程師……之後會勝過 99%」(Post-Scarcity Macroeconomics,prediction)。語料庫在此領域有成效測量,結果顯示驗證表現遠在門檻到來前就已失效:

  • 在硬編碼憑證這種程式碼異味中——這是唯一有專用自動偵測工具的一類——七種不同機器人和人類審查者合計只對 4,022 個代理程式 PR 中找到的真實有效憑證,留下 18.9% 的評論;而人類提交了其中 67.6% 的憑證。作者將此解讀為:在代理程式看似負責處理正確性的工作流程中,警覺性降低(Security Debt of Agent-Generated Code,empirical)。
  • 代理程式 PR 的審查覆蓋率正逐漸接近人類基準,但審查效能仍停留在該低點——覆蓋率與效能是兩項不同的指標,而只有前者有所改善(Security Debt of Agent-Generated Code)。
  • DX 的調查小組回報,一季之內變更信心下降 6.1%,而程式碼可維護性上升 3.8%(Verification as the New Bottleneck)——屬於 vendor-claim,測量的是感受,僅涵蓋一季與自我選擇的調查小組,因此它是溫度計,不是機制。

這裡看得到先後順序的後果,卻看不到其機制:最接近門檻的領域中,驗證已經失效,但沒有任何資料測量驗證者的供給。測到的是現有驗證者的表現。應將此視為驗證繫繩正承受壓力的旁證,而非公地正在消失的觀察結果。

為何整體先後順序風險小於問題所述#

問題將「門檻到來」與「仍需驗證者」視為兩個獨立變數,因此到來速度不均,看起來就像擲硬幣,結果可能不利。但在這個語料庫中,它們是同一個變數的兩種相反表現。

Stockfish 門檻最先出現在有可靠、便宜、快速驗證器的領域:

  • 形式數學。 Lean 會以機械方式驗證每一步,因此只要編譯器接受、沒有 sorry 也沒有注入公理,證明便正確——而 DeepMind 的代理程式自主解出 9/353 個 Erdős 問題與 44/492 個 OEIS 猜想,其中包括約 56 年來未解的問題(AI-Driven Formal Proof Search)。
  • 競技程式設計。 隱藏測試案例就是裁判;在符合實際情況的十次提交預算下,AlphaCode 2 約落在參賽人類的第 85 百分位,只需 100 個樣本就能達到 AlphaCode 用 1,000,000 個樣本才達到的解題率(Selection Under a Submission Budget)。
  • 有測試套件的程式碼。 RLEF 僅憑執行結果便能閉合訓練迴圈(RL from Execution Feedback (RLEF))。

這些正是人類驗證公地從未承擔關鍵作用的領域——編譯器一直都是驗證者。反過來說,人類驗證者不可或缺的領域,正是能力曲線最後才會抵達的領域,原因也相同:沒有廉價驗證器,就沒有獎勵訊號;沒有獎勵訊號,就沒有 RL;能力便參差不齊(The Verifiability Thesis,以及這種參差不齊作為其表徵)。Karpathy 較樂觀的看法——軟性領域可以交由 LLM 評審團處理——是唯一能打破這種連動的提議,也是語料庫測量結果最直接反駁的主張。

因此,門檻到來的順序與驗證需求的順序是彼此相關,而非互不相干。Musk 將 Stockfish 的主張一概延伸到「一切」時,他的論點便在此失效;他如此延伸而引入的先後順序風險,並非一般情況。

先後順序風險真正存在之處,以及比原先所述更尖銳之處#

若將尺度從領域下移一層,來看子任務,風險便會再度出現——因為可驗證性是拆解方式的屬性(The Verifiability Thesis)。

形式數學是實際觀察到的案例,而且呈現出有啟發性的順序。 Lean 會為每一步證明提供認證,人類剩下的工作不是檢查證明,而是檢查命題是否正確形式化。AI-Driven Formal Proof Search 正好記錄了這件事:代理程式將「密度」解讀為自然密度而找到證明,因此必須修正為「下密度」(#125)與「上密度」(#741(i));排名靠前的證明草稿有時會將核心難題卸載到輔助引理中的單一 sorry,以重述目標,或引用實際上是幻覺的「已知」引理。論文自身的說法,正是以肯定語氣表述這個先後順序:「形式驗證可作為一種篩選器,用來判斷哪些證明值得人類審查。」可驗證的階段已完全自動化;無法驗證的階段——形式化後的命題是否仍代表非形式化的原意?——仍然仰賴人力,而且並非證明檢查實務所培養的技能。

軟體也有相同形態:自動化審查涵蓋機械式的階段,留下來的則是「我究竟有沒有說清楚什麼才是對的」、法律審查、風險容忍度及信任邊界判斷(Verification as the New Bottleneck)。

精確來說,先後順序風險不是「A 領域自動化了,B 領域仍需要驗證者」,而是「同一領域中可驗證的子任務自動化了,無法驗證的部分仍需要驗證者;但他們所需技能,原本是由剛剛消失的子任務培養出來的」。 語料庫觀察到了這種形態——剩餘工作確實存在、舉足輕重,而且需要不同技能;但沒有觀察到耗竭:沒有人測量形式化人員、資安審查者或規格撰寫者是否正在變得稀少或能力變差。

Q2 結論#

這個語料庫中沒有任何領域顯示公地規模的先後順序。一個領域(大腸鏡檢查)在個別從業者層級,實測到門檻前技能侵蝕;另一個領域(形式數學)則完整呈現子任務版本的風險,並記錄了人類剩餘任務,但門檻仍遙不可及。而整體風險受到一項因素抑制:可驗證性同時決定門檻何時到來,以及驗證者何時不再必要。公地問題只在可驗證領域之外仍然存在——這正是 Q1 所得出的相同邊界。

兩個問題其實是一個問題#

最能證明兩者其實是同一問題的資料,是 Q2 的前提竟然出現在 Q1 的文獻中,作為研究動機。CS329A 說明 Absolute Zero 為何移除由人類策展的題目集時,理由是供給,而非成本:可驗證獎勵的 RL 需要專家策展問答配對——「如果是 IMO 題目,就需要 IMO 專家」——而且隨著模型超越人類專家水準,能夠撰寫下一題的人也會供不應求(Rationale Bootstrapping (STaR))。

這就是 Lovett 所說的公地,在一堂訓練方法課程中出現;談的是同一群人,原因也相同。訓練迴圈脫離資料之牆的方法,是移除人類出題者;而它之所以有效,正是因為機械驗證器能取代出題者——程式碼領域有直譯器執行,數學領域有 Lean 檢查。沒有這種驗證器的領域,迴圈仍需要專家,監督制度也一樣。

兩種供給都是經驗證的判斷。 有可靠、便宜、快速的驗證器時,這種判斷可以製造出來;其他地方則仍靠人類配給。這個單一事實回答了兩個問題:它解釋了為何資料之牆在程式碼與數學領域不構成限制、為何晶片設計和濕實驗室化學無法脫離資料之牆、為何 Stockfish 門檻恰好先在從不需要驗證者的地方到來,以及為何仍需驗證者的領域,兩種供給都無法被製造出來。

哪些資料能解答這些問題#

Q1(語料庫缺少的資料——以上每項結果都屬於 prediction 或根據投影片解讀的 practitioner-opinion;沒有任何關於資料供給的前沿規模 empirical 資料,不論支持哪一方):

  • 一次前沿規模訓練,逐代回報合成資料與人類資料的占比及其相對有效運算力的變化。99:1 → 95:5 的 RL 占比估計,是語料庫中唯一觸及此事的資料,而且只是單一講師的回憶。
  • 在前沿規模下,將嵌入不相似度與準確率並列繪圖,呈現多輪自我訓練的變化;而非只看 Multiagent Finetuning 使用的三個開放權重模型——這是成本低、可常態採行的診斷方式,可區分多樣性崩塌與基礎模型能力範圍的限制(Rationale Bootstrapping (STaR))。
  • 自行提出課程的 pass@K。語料庫沒有任何資料回報此指標,因此目前的限制——RL 提高了 majority@K,卻沒有提高 pass@K——對 Absolute Zero 式迴圈而言仍未經測試,而非已被推翻。

Q2:

  • Lovett 自己提出的設計——依照群組與 AI 使用程度分層,評估無 AI 輔助時的能力——不應用於一般人,而應用於機械式階段已自動化領域中的剩餘任務,例如 Lean 形式化人員或資安審查者,而非整體軟體工程師。
  • 若要讓大腸鏡檢查成為公地證據,而非技能萎縮的證據,應在新進世代進行同樣的測量,而非只測量從受訓基準退化的從業者。
  • 按審查者年資分層,分析 18.9% 的憑證評論率。該數據目前是七種工具的混合平均值,而且沒有記錄模型配對情形(Security Debt of Agent-Generated Code、Same-Model Review Blindness)——按群組分層便能將它從表現數字轉換為供給數字。
  • 將形式化產出序列(每位數學家每小時形式化的命題數)與證明搜尋解題率並列繪圖。這是原則上可行、最乾淨的領域內部子任務先後順序測試,但至今無人發表。

資料來源#

  • Effective Compute Scaling — 每年約 10 倍的有效運算力引擎、資料之牆及其三項反制因素、STaR 的上限,以及 99:1 → 95:5 的 RL 占比估計與 Grok 4 比較。資料之牆的判斷屬於 prediction(DeepMind);RL 占比數字屬於 practitioner-opinion(講師未附來源的回憶)
  • Post-Scarcity Macroeconomics — Stockfish 門檻、90%→99%→「無從競爭」的軟體主張,以及將主張延伸到「一切」。全篇皆屬 prediction,歸於 Musk
  • Rationale Bootstrapping (STaR) — STaR 的停滯及其三項假設;Multiagent Finetuning 對多樣性崩塌的診斷及「不相似度與準確率並列」工具;Absolute Zero 的可學習性獎勵、有效性閘門與專家供給動機。屬於 practitioner-opinion,根據投影片讀得的 ASR,三篇論文都不在 raw/ 中
  • The Verifiability Thesis — 四階驗證器階梯、生成與驗證的落差及其兩種失敗模式、評審團的適用範圍,以及相關獨立性測量、驗證器延遲維度(晶片設計、濕實驗室化學),以及可驗證性是任務拆解的屬性
  • AI-Driven Formal Proof Search — Lean 作為可靠驗證器(9/353 個 Erdős 問題、44/492 個 OEIS 猜想)、以驗證作為判斷哪些內容值得人類審查的篩選器,以及指出人類剩餘任務的錯誤形式化發現
  • Selection Under a Submission Budget — 十次提交預算下的 AlphaCode/AlphaCode 2、第 85 百分位數據,以及外推覆蓋率冪律的多樣性上限
  • RL from Execution Feedback (RLEF) — 免費驗證器訓練迴圈,以及因此提升的解題率曲線
  • Latent Capability Overhang — 覆蓋率冪律、最難解題僅占萬分之 1 至 3 的稀有程度,以及溫度約 1.2 的多樣性上限
  • The Tragedy of the Cognitive Commons — 公地架構、其證據階梯及「結構性預測,並非已觀察到的結果」聲明、Budzyń 的技能退化案例、Vicente & Matute 的 80.7% 結果、Dell'Acqua 的顧問,以及丹麥和 Ramp 的反向證據。屬於 practitioner-opinion,概念性論文,所有數據皆為二手資料
  • Security Debt of Agent-Generated Code — 18.9% 的憑證評論率、67.6% 的人類提交占比,以及覆蓋率與效能的差異。屬於 empirical,沒有以人類 PR 為對照組
  • Verification as the New Bottleneck — 驗證是稀缺資源、DX 的變更信心 −6.1% 數據(vendor-claim),以及人機協作流程中留下的人類工作(法律、風險、信任邊界)
  • Experimental Learning Impact of Generative AI — 隨機分配增強與自動化模式,以及最接近實測機制 2 的結果
  • Intelligence Explosion Dynamics、AGI-to-ASI Pathways — 資料作為 RSI 引擎,以及本文 Q1 結論所修訂的六項摩擦因素清單
  • The Bitter Lesson — 較大型模型更能吸收飛輪效果,因此自我改進與擴大規模互補
  • RSI Growth Curves: Which Friction Binds First? — 本文據以延伸,並修訂其資料之牆級別的摩擦排名
§ end
Cited by 19
Related articles
  • Open Questions Backlog

    Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…

  • CS329A: Self-Improving AI Agents (Stanford)

    Stanford's graduate course on self-improving agents, taught by Azalia Mirhoseini and Aakanksha Chowdhery (Autumn 2025,…

  • Aakanksha Chowdhery

    Adjunct professor at Stanford, co-instructor of CS329A, and a researcher at Reflection AI; previously Google Brain, whe…

  • Large-Scale Test-Time Compute

    Noam Brown's thesis that model capability is now a function of inference budget (tokens/cost/time): with good scaffoldi…

  • Recursive Self-Improvement

    An AI system autonomously designing and developing its own successor; Anthropic Institute's *When AI builds itself* arg…