H
Howardism
Plate IIAI Economics & Labor機器翻譯 · machine-translated過時翻譯 · stale translationENHOWARDISM

Augmentation/Automation 的區分,能解釋職場技能嗎?

結論:這項區分在方向上適用於職場,但尚未成為一種經驗證的測量方式。四項職場去技能化研究落在自動化那一側(Budzyń 的內視鏡醫師、Dell'Acqua 的顧問、Vicente & Matute 的 80.7%、Wiles et al.),另有兩項落在增能那一側(Everett 的協作式臨床工作流程、Brynjolfsson 的客服代理)——但這六項研究都是透過同一篇 `practitioner-opinion` 架構論文,才以二手資料進入知識庫;沒有任何研究在同一設計中區分使用模式,也沒有任何研究在撤除 AI 後測量無輔助表現。真正造成差異的不是菁英樣本,也不是一週的時間跨度:實驗室中的機制是在總任務時間*固定*的情況下重新分配時間(寫作 −5.3 個百分點/閱讀 +4.4 個百分點),而 AI 在職場最顯著的效果是節省時間,知識庫裡沒有任何研究測量省下的一小時拿來做什麼。職場的工作量還會產生第三種模式,這是 35 分鐘的監考測驗不可能引發的——跳過審查(31.3% 的 PR 未經審查便合併;81.1% 的真實外洩憑證沒有收到任何審查者留言)。這不屬於自動化那一側,因為使用自動化的學生仍提交了自己讀過的作業。AEI 無法裁定此事,因為「自動化占比」把 Directive 和 Feedback Loop 混為一談,並且在定義上排除分類器自己的 Learning 模式;而這個軸正朝著空洞的那一側偏移(43–45% 且持續上升,相較於實驗室的 32%)。唯一的隨機職場案例則呈現相反方向:受控變異研究中的招募人員,把專業判斷重新投入未自動化的階段(降低對 AI 面試訊號的權重,−0.047/−0.029),付出的代價是延遲(20→24 天),而不是技能。

Article metadata
Publication details
Published:September 5, 2026
Filed:Essay
Domain:AI Economics & Labor
Tags:DerivedWorkforceHuman CapitalHuman AI CollaborationEconomics
Reading:22 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

說明 Augmentation/Automation 區分是否能解釋職場技能的插圖

問題#

Generative AI 的學習成效實驗中的 #oq/now 待解問題是:

同一種使用模式區分是否也支配職場技能累積(開放問題 自動化與樂觀的關聯和 AI 腦霧留給工作者的問題),還是監考的一週學術任務與在職學習差異太大,無法套用?

要套用的區分,是 Contractor & Reyes 隨機實驗中的關鍵結果:研究者根據受試學生的 ChatGPT 紀錄進行分類後發現,增能使用者(把 AI 當作家教/解說者,49%)在一週後的無輔助測驗中高出 +0.29 SD;而自動化使用者(由 AI 起草文字,32%)在第一場次作文中高出 +0.54 SD,但在第二場次的無輔助作文中只高出 +0.02 SD——短期增益來自 AI 產出的內容,工具一旦撤除,這項增益便不復存在。

簡答#

  1. 方向適用。 知識庫裡有四項職場或專業研究結果明確落在自動化那一側,也有兩項落在增能那一側,涵蓋了與實驗室迥異的情境。這種模式在監考任務之外也重現了。
  2. 測量方式不適用。 這六項研究全都以二手資料的形式進入知識庫,來源是認知公地的悲劇——一篇 practitioner-opinion 架構論文,作者將自己的機制稱為「一項結構性預測……而非觀察到的結果」。沒有任何研究在同一設計中區分使用模式;也沒有任何研究在撤除 AI 後測量無輔助表現。能套用的是跨研究拼湊出的模式,不是重現過的係數。
  3. 真正造成差異的是時間,而不是研究對象。 實驗明確提出的機制是在總學習時間固定下重新分配時間——寫作 −5.3 個百分點/閱讀與搜尋 +4.4 個百分點,而且明確表示花費時間沒有改變。在職場,AI 最顯著的效果是節省時間,作者也坦言這正是他們不宣稱實際工作中學習成效提升的原因。知識庫裡沒有任何研究測量省下的一小時拿來做什麼。
  4. 職場還有實驗室無法引發的第三種模式。 AI 腦霧(小錯誤 +11%/重大錯誤 +39%)、加速反噬(31.3% 的 PR 合併時完全未經審查),以及代理程式生成程式碼的安全債務(81.1% 的真實外洩憑證未經留言便進入整合階段)描述的是工作者在工作量壓力下完全跳過審查步驟。這不屬於自動化那一側——使用自動化的學生仍提交了自己讀過的作文——而 35 分鐘的監考測驗不可能引發這種情況。
  5. AEI 無法裁定,原因正是實驗揭示的問題。 自動化與樂觀的關聯中的「自動化占比」是 Directive + Feedback Loop,將兩種結果不同的模式合併,而同一分類器的 Learning 模式則在定義上被排除於該軸之外。因此,自陳的學習曲線持平,完全可能與真實存在的空洞那一半並存。
  6. 使用組合正朝著錯誤方向移動。 AEI 的自動化占比為 43–45% 且持續上升(ATLAS在質疑這個數值時提到此趨勢),高於實驗室的 32%。若這項區分適用,職場使用組合正朝著空洞的那一側移動。
  7. 唯一的隨機職場案例呈現相反方向。 在受控變異:AI 透過降低分散度取得優勢中,面試工作自動化的招募人員並未失去技能——他們把判斷力重新投入留下來的階段,降低對 AI 面試訊號的權重,並倚重獨立測驗。代價是延遲,而不是技能。

結論:部分獲得解答。 這項區分是目前解釋職場技能累積的最佳假說,在方向上也獲得多方支持;但知識庫中的任何資料都尚未在職場證實它,而且這項套用的兩個前提(固定任務時間、沒有工作量壓力)在實驗室之外都不成立。

1. 可套用之處:方向與四項職場研究結果相符#

知識庫中職場技能證據,主要來自認知公地架構論文的證據階梯(認知公地的悲劇)。將各項結果歸入實驗的兩種模式後,便能看出對應關係:

研究(全為透過公地論文取得的二手資料)情境模式
Budzyń et al. (2025),Lancet Gastro & Hepatology——內視鏡醫師採用 AI 輔助偵測後,獨立偵測準確率下降篩檢大腸鏡檢查,職涯年資累積的實務自動化
Vicente & Matute (2023)——80.7% 的參與者察覺有偏誤的 AI 建議中存在錯誤,卻仍然採納,之後在 AI 移除後的判斷中重現了偏誤實驗室,但移除設計與本實驗相同自動化
Wiles et al. (2024)——AI 輔助提升使用期間的表現,之後的無輔助評估則沒有顯著優勢有輔助任務,並在之後進行無輔助測驗自動化
Dell'Acqua et al. (2026)——菁英顧問在 AI 能力前沿之內表現提升,在前沿之外則表現退步,且無法判斷任務位於哪一側專業顧問工作自動化
Everett et al. (2025)——需要積極臨床參與的協作式 AI 工作流程,提升了診斷準確度臨床工作增能
Brynjolfsson 的客服代理 會學習(Generative AI 的學習成效實驗將其列為職場增能模式的對照案例)客戶支援增能

這張表有兩項意義。第一,移除工具後的表現特徵——使用工具時表現出色,沒有工具時則毫無優勢——正是自動化那一側的形狀,而 Budzyń、Wiles 及 Vicente & Matute 各自在非學生族群中獨立觀察到這種特徵。第二,這項區分的方向不是教室情境下的偶然結果:Everett 的研究在安全攸關的專業情境中呈現增能那一側;它與 Budzyń 研究的差異,在於是否保留實務工作者自己的嘗試過程,而這正是 ChatGPT 紀錄分類器讀取的變項。

公地論文從理論得出相同結論,並用實驗本身的術語說明其適用條件:AI 將認知努力從生成性思考轉移到協調與評估,而「這種重新分配究竟會累積或侵蝕專業能力,取決於工作如何設計。」這就是使用模式區分,只不過被表述成組織設計變項,而不是單次對話的變項。

2. 無法套用之處:沒有研究在職場設計中區分使用模式#

實驗的價值不在效果量,而在於同一個隨機分派族群透過同一種結果測量工具,依照自身紀錄區分成兩種使用模式,測得不同的技能發展軌跡——而且有內部驗證(自動化使用者的作文有 53.6% 被標記為 AI 生成,增能使用者則為 20.9%;閱讀與搜尋時間少了 17%)。知識庫中沒有任何職場研究做到這一點:

  • Budzyń、Dell'Acqua、Wiles、Vicente & Matute,以及 Everett 是五項各自探討不同情境的獨立研究,這些資料全是透過一篇概念論文取得。知識庫沒有直接讀過其中任何一篇;所有數字都是公地論文的轉述。這不足以支持對係數的主張。
  • 公地論文本身提出的適用界線,也不支持過度延伸這些拼湊結果:它承認,丹麥採用 AI 後兩年間,收入與工時沒有變化;整體勞動資料顯示出適應能力(Manning & Aguirre 2026);重新訓練能力也有差異(Hyman et al. 2025)——「這些發現證明,耗損機制並非普遍存在。」
  • 知識庫中最有力的職場資料衡量的,是錯誤的數量。代理式程式設計中的專業經驗回報測量的是一個人持有的專業經驗能從代理程式獲得什麼(每個專業程度增加 +9% 操作數/+13% 輸出;驗證成功率從新手的 15% 上升到中階專家的 28–33%,呈現凹形曲線,增益大多來自新手到中階的提升)。這衡量的是作為投入的專業能力存量,而非作為產出的能力累積——它告訴我們技能退化的工作者會失去什麼,卻不能說明 AI 使用是否讓他們技能退化。

3. 真正造成差異的是時間,而不是研究對象#

常見的質疑——菁英文理學院大學生(GPA 3.68、SAT 1386)、35 分鐘、一週、一個主題——確實有道理,但不是會破壞這項套用的因素。真正的問題在於結構,而論文本身就指出了:

這項研究衡量的是每單位時間的學習成效,並固定任務時間。AI 改變的是這一小時的使用方式(寫作 −5.3 個百分點/閱讀與搜尋 +4.4 個百分點),不是時長——可能是因為實驗室裡能和學習時間競爭的用途不多。作者明確表示,不主張實際採用 AI 會提升整體學習成效:離開實驗室後,學生可以自行決定學習多久,而且許多人使用 AI 是為了節省時間。

在職場,固定的是產出,而不是時間;知識庫中的職場測量工具恰好測量實驗室刻意壓制的時間節省效果——Noy & Zhang 的寫作增益,以及加速反噬中的吞吐量提升(任務 +34%、史詩級工作項目 +66%)。實驗所指出的機制(努力從產出文字轉向吸收文字)要求這一小時維持不變。若時間改作他用,此設計便無法測出增能帶來的好處,不論結果正面或負面。這是Generative AI 的學習成效實驗中的第一項待解問題,仍標記為 #oq/source;職場問題也承襲了這項限制。

知識庫中唯一能說明這項差異的職場拆解,呈現的結果與直覺相反,值得記錄:受控變異:AI 透過降低分散度取得優勢顯示,自動化面試並沒有讓招募人員騰出時間,而是讓他們花更多時間——從面試到決定錄用的階段,中位數從 2.62 天增加到 7.24 天(p=0.005),因為招募人員現在得審查一場自己沒有參與的對話。從頭到尾的招聘時間則從 20 天增加到 24 天。只要人類仍負責評估階段,委派工作可能讓人有更多時間投入剩下的判斷任務,而不是更少。

4. 職場還有實驗室無法引發的第三種模式:跳過審查#

這是套用不完整最明確的原因。實驗中的自動化組,是在沒有工作量壓力的監考測驗中,讓 AI 起草作文、自己仍然閱讀、編輯並提交的學生。知識庫裡測量 AI 時代認知負荷的職場資料,描述的是另一種情況:

  • AI 腦霧——Kropp et al. 所說的監督工作超出認知負荷能力所造成的精神疲勞:回報腦霧的工作者,小錯誤多出 11%,重大錯誤多出 39%。該文章的核心論點是,「工具」框架會讓審查者承受負擔,「員工」框架則會以投入不足取代這種負擔——這是另一種失敗模式,並伴隨錯誤偵測下降 18%。
  • 加速反噬——Faros 對約 4,000 個團隊進行組織規模的遙測:每位開發者每日處理的 PR 情境增加 67.4%、工作重啟次數增加 13.8%,而 31.3% 的 PR 完全未經審查便合併。
  • 代理程式生成程式碼的安全債務——在代理程式撰寫的 PR 中,人類提交了 74 項真實外洩憑證中的 67.6%;其中 81.1% 在沒有任何機器人或人類審查者留言的情況下進入整合階段。作者認為,這反映出在代理程式看似負責正確性的工作流程中,人們降低了警覺。

我們可以稱之為怠於把關,並注意這不屬於自動化那一側。實驗中的自動化模式仍由人類接手處理輸出,這就是為什麼即使短期增益是空洞的,增益仍然存在(+0.54 SD)。怠於把關則是把人類移出迴圈,因此既沒有短期增益,也沒有學習;而且它是由工作量引發的,這正是 35 分鐘測驗固定不變的變數。若職場問題是「AI 使用會侵蝕技能嗎」,實驗室提供了一種機制(以輸出替代人類工作的空洞增益),職場遙測則指出實驗室看不見的第二種機制。兩者都符合外包思考,而非理解的論點;但實驗實際測量的只有第一種。

5. 為什麼 AEI 調查無法裁定——它的指標本身就把不同模式混在一起#

自動化與樂觀的關聯是原本應該回答這個問題的職場測量工具,但結果顯示沒有差異:大量委派工作的受訪者回報,學習速度與其他人相同;68% 表示學得更多,57% 表示 AI 讓自己的技能更有價值;而且自動化占比愈高,六項工作品質面向的樂觀程度也愈高。這些結果並不能證明技能有所累積,原因有三:

  1. 指標把兩種模式混為一談。 自動化占比是對話被分類為 Directive 或 Feedback Loop 的比例。Directive 幾乎與實驗中的自動化組完全相同(「人類委派整項任務,互動極少」)。Feedback Loop——「反覆互動,人類主要根據環境回饋」——則不明顯屬於任何一種模式。分類器本身的 Learning 模式(「人類追求理解,而非完成任務」)才是實驗中的增能組,但它在定義上被排除於自動化占比之外。因此,調查的主要結果是根據一個已含有這項差異、之後卻又將其合併的指標計算出來的。若真實情況中有一半空洞、一半扎實,兩者平均後的學習曲線正好可能呈現平坦。
  2. 自陳不是合適的測量工具,而實驗顯示自我評估在兩個方向上都不準確。 實驗中,自我評估的知識沒有顯示任何處理效果(β=0.02),但實測知識則上升 +0.27 SD——學生學得更多,卻沒有察覺。對照組學生預測自己會提升 +25.2 個百分點,實際增幅卻只有 5.1 個百分點;親自使用工具後,他們的預測修正為 +3.8 個百分點,仍高估五倍。對工具的熟悉程度不同,感受與實測技能的差異幅度和方向也不同。AEI 文章本身也承認這項限制:即使人們覺得自己正在學習,技能仍可能退化。
  3. 樣本與識別方式。 約 9,700 位自我選擇使用 Claude 的受訪者,約 30% 從事電腦/數學工作,約 23% 從事管理工作,女性占 12%;這是相關性研究,報告也明言沒有完全排除自我選擇的影響。

這也讓原本已解答一半的問題有了進一步答案:自動化與樂觀的關聯中第二項待解問題(「是否有客觀技能測量能與此結果相符?」)原本被實驗標記為部分獲得解答。本綜合分析進一步指出,樣本混合並非偶然,而是 AEI 協作模式分類器本身的特性,因此重新分析現有調查也無法區分這兩種模式;必須拆解自動化占比中的 Directive 和 Feedback Loop,並讓 Learning 以一種使用模式重新納入,而不是當成剩餘類別。

6. 真正未知的是職場中的使用組合,而不是機制——而且組合正持續變化#

實驗的第三項待解問題指出,增能或自動化的選擇會受到誘因左右。實驗本身的紀錄顯示,49% 使用增能、32% 使用自動化,而解釋概念是最常見的單一用途(57%)。職場遙測呈現相反趨勢,而且數值還在變化:

  • Anthropic 經濟指數: 自動化占比為 43–45%,而且——ATLAS質疑該數值時引用的觀察——隨時間持續上升。ATLAS 將非例行認知對話中 <10% 歸類為端到端自動化意圖;AEI 文章認為,兩者的差距主要來自定義不同(二分法對上五類分類;除端到端自動化以外的所有情況都算協作)。
  • Conversation-to-Delegation Shift: 從輸出 token 看,同樣出現了由提問轉向執行的變化——Codex 占比為 OpenAI 的 99.8%、組織使用的 63.3%、個人使用的 16.5%;超過八小時任務的占比則從 2.1% 升至 25.6%。
  • 市場定價的 AI 暴露(AI 溢價): 跨供應商資料提供佐證,不限於單一實驗室——以 tool_calls 為完成原因的代理式 token 占比,從 2024 年接近零升至 2026 年初的 52.2%。

如果這項區分適用於技能累積,職場的使用組合正朝空洞的那一側移動,而教室裡的使用組合則沒有。兩項限制讓這只能算方向性訊號,而非決定性證據:兩個遙測計畫因定義不同,數值相差四倍;AEI 分類器的準確度並未發表(使用遙測分類器驗證);而且這些測量工具都沒有測量技能——它們測量的是委派。這種變化表示這個問題的重要性可能會隨時間增加,但無法證明問題的答案。

7. 唯一的隨機職場案例呈現相反方向#

受控變異:AI 透過降低分散度取得優勢是知識庫中唯一一項隨機因果估計,探討 AI 在專家對話任務中取代人類的效果。研究中的招募人員,是知識庫裡最接近「在實驗控制下自動化工作任務的職場族群」的案例。他們的判斷力並未被掏空:

  • 他們給 AI 進行的面試打了更高分(平均分數從 1.90 升至 2.01,p<0.001,完全是因為評分從 1 分轉向 2 分——AI 拉高了底線,而非天花板)。
  • 他們降低了該訊號的權重。以標準化的面試、語言測驗與分析測驗分數預測錄取結果時,AI 組的面試分數對錄取結果的預測力顯著較弱(交互作用為 −0.047,加入控制變項後為 −0.029),而語言測驗分數的預測力則較強(+0.028/+0.022)——這種折減恰好集中在曾向調查表示「面試表現比測驗分數更重要」的招募人員身上。

當你依照自己所陳述的模型,精確地降低某項訊號的權重,代表專業判斷正重新投入未自動化的階段;論文也如此解讀:「要充分實現自動化的回報,需要人類相應調整仰賴 AI 訊號進行決策的方式。」這正是AI 的組織配套中尚未建立的那項配套,也是工作層級而非對話層級的增能結果。

有三項因素讓這個結果無法朝樂觀方向定論。研究沒有測量無輔助技能——沒有人詢問三個月沒進行面試的招募人員是否仍能勝任,而這正是套用這項結果所需的確切測量。觀察期為四個月,但四個月留任估計未能通過招募人員群集校正。招募人員對結果的預測則與實際方向相反——36% 預期經 AI 面試的求職者錄取率較低,48% 預期留任率較低,61% 預期面試品質較差——因此,即使他們正確地調整了訊號權重,既有專業判斷仍錯估了結果。

職場中的自動化與樂觀關聯,還有一項資料與上述結果相符但方向相反:同一家公司裡,預期 AI 對自己整體影響正面的招募人員只有 12%,求職者則有 47%。AEI 發現委派會帶來樂觀,測量的是委派工作的人;自身工作任務正被自動化的人,則未納入那項調查。

8. 結論#

使用模式區分是解釋職場狀況的正確假說,但知識庫無法在職場證實它。具體來說:

  • 可以套用: 方向上,六項非學生研究結果一致;區分變項(是否保留實務工作者自己的嘗試過程?)也與紀錄分類器使用的變項相符。
  • 無法套用: 沒有研究在同一設計中區分模式、沒有撤除 AI 後的無輔助測量,也沒有第一手閱讀證據——六項職場研究結果全都是透過 practitioner-opinion 論文取得的二手資料。
  • 在結構上不成立: 任務時間固定(實驗的整套機制)與單一任務的工作量(引發怠於把關,也就是職場的第三種模式)。
  • 無法從現有資料還原: AEI 的自動化占比把 Directive 與 Feedback Loop 合併,並排除 Learning,因此重新分析現有調查也無法區分兩種模式。

所以,答案既不是「差異太大,無法套用」,也不是「已經定論」。問題應從 #oq/now 移到 #oq/source,因為現在需要的是知識庫中尚不存在的職場研究,而不是對既有資料做更多綜合分析。

哪些證據會改變結論#

  • 進行一項有無輔助後測的職場研究。 在真實任務中隨機分派或追蹤 AI 使用權限,依照同一受試者的紀錄分類使用模式,再於撤除 AI 後測量表現。這是唯一缺少的研究設計;本文其餘內容都只是這項設計的替代指標。公地論文也獨立提出了相同測量工具——「無 AI 表現評估與錯誤偵測稽核」——但尚無人真正執行。
  • 拆解 AEI 的自動化占比。 分開計算 Directive 與 Feedback Loop,讓 Learning 以一種模式而非剩餘類別重新納入,再與相關調查中的技能項目比較。Anthropic 已經有分類器和相關追蹤樣本;這只需重新彙整資料,不必進行新研究。這無法解決自陳問題,但能回答合併模式後,平坦的學習曲線是否仍然存在。
  • 追蹤 AEI 個人內變化(也是自動化與樂觀的關聯本身的第一項待解問題):在採用自動化工作流程前後追蹤情緒與技能代理指標,便能在 §6 衡量趨勢變化的同一軸上,區分自我選擇與處理效果。
  • 再做一輪受控變異:AI 透過降低分散度取得優勢中的招募人員實驗組。 若招募人員適應後,面試分數的預測力有所恢復,重新配置專業判斷的解讀便成立;若在錄取率維持平穩的同時預測力進一步下降,代表招募人員正照單全收,而怠於把關模式已在隨機分派下被捕捉到。
  • 測量省下的一小時拿來做什麼。 實驗室的機制會在時間變成內生因素時失效,而知識庫中沒有任何來源測量 AI 在職場節省的時間如何重新分配。在有這類研究之前,§3 仍是套用這項結果的關鍵限制。
  • 第一手取得 Budzyń、Dell'Acqua、Wiles 或 Everett 的研究。 六項關鍵職場結果中,有四項是公地論文轉述他人的數據。直接閱讀其中任何一項,都能讓 §1 從拼湊出的模式升格為可引用的測量結果,也能檢驗本文的模式歸類是否經得起研究設計的檢視。

證據層級與權重#

  • Generative AI 的學習成效實驗 → Experimental Evidence on the Learning Impact of Generative AI(empirical,Contractor & Reyes,arXiv 2607.08849)——核心證據,也是本綜合分析中唯一識別出模式因果差異的研究:隨機分派、F 檢定平衡檢查、double-lasso 控制、ITT + TOT/2SLS、監考合規,以及由盲測的人類評分者和 LLM 評分。限制:211 位菁英大學生、35 分鐘、一週、一個模型、一個主題——而增能/自動化分類是依據紀錄事後進行,因此這項區分本身屬於異質性分析,而非隨機對照。論文對任務時間的坦誠說明,是 §3 的論據基礎。
  • 受控變異:AI 透過降低分散度取得優勢 → Voice AI in Firms: A Natural Field Experiment on Automated Job Interviews(empirical,Jabarian & Henkel,arXiv 2607.28222)——本文唯一使用的隨機職場證據:預先註冊、隨機分派 67,056 位求職者、使用行政資料結果。§7 及 §3 的延遲拆解以此為最高權重。文章指出的限制包括:AI 系統從未具名(沒有模型、供應商或版本資訊);作者在合作公司擔任無給職首席經濟學家的時間晚於資料蒐集、但早於論文撰寫;招募人員相關發現是在隨機設計中的觀察結果;而且完全沒有技能測量。
  • 自動化與樂觀的關聯 → Anthropic Economic Index report: Cadences(屬於 empirical 證據層級,但屬於非代表性樣本中的自陳調查,採相關性分析)——在 §5 中僅作為感知的證據加權,而非技能累積的證據,理由如上。其底層分類器尚未經發表的驗證(使用遙測分類器驗證),這也是 §6 趨勢討論的限制。
  • 認知公地的悲劇(practitioner-opinion,概念性論述,所有數據皆為二手資料)——§1 中六項職場研究的來源。此文作為附有論點的參考書目,而非測量結果加權:它是知識庫取得 Budzyń、Dell'Acqua、Wiles、Vicente & Matute 和 Everett 研究的途徑,且架構作者表示,核心機制是「一項結構性預測……而非觀察到的結果」。由於支持案例與反證(丹麥的零效果、Manning & Aguirre、Hyman et al.)來自同一資料來源,因此權重相同。
  • AI 腦霧 → Kropp et al.,HBR 2026/03;知識庫是透過 2026 年 5 月 HBR 後續文章研究:為什麼不該把 AI 代理程式當成員工取得這項二手資料,文章沒有 evidence: 層級——屬於分類制度建立前的來源。+11%/+39% 指的是回報腦霧的工作者與錯誤頻率之間的關係:橫斷面相關性研究,並非因果研究。§4 用它說明研究所描述的模式,不採用其數值作為因果證據。
  • **加速反噬**和代理程式生成程式碼的安全債務(分別為 empirical 層級的遙測與靜態分析)——對怠於把關模式最有力的實測支持,也是本綜合分析中最有力、且非來自公地論文的證據。兩項研究都沒有測量技能;它們測量的是審查步驟消失,因此 §4 將怠於把關視為獨立機制,而非證明使用模式區分成立的證據。
  • 代理式程式設計中的專業經驗回報 → Agentic coding and persistent returns to expertise(empirical,Anthropic 第一方遙測,約 40 萬個工作階段)——僅用於證明知識庫中的專業能力測量指的是能力存量,不是累積過程。第一方資料,根據對話紀錄推斷結果,未納入無人值守/SDK 使用情況。

整體證據權重排序:一項隨機學習實驗與一項隨機職場實驗構成主要論證;遙測計畫能證明趨勢變化,但不能證明結果;調查測量感受;架構論文提供職場模式,但在所有證據層級中最弱,§1 的說法也明確保留了這項限制。

§ end
Cited by 10
Related articles