H
Howardism
Plate IIAI Economics & Labor機器翻譯 · machine-translated過時翻譯 · stale translationENHOWARDISM

暴露分類法:觀察到的、理論上的、回報的、預期的

PublishedJuly 2, 2026FiledConceptDomainAI Economics & LaborTagsGovernanceWorkforceMeasurementEmpiricalAnthropicReading7 minSourceAI-synthesised

AI 深入某項職業的四種不同衡量方式——觀察到的暴露(使用 Claude 完成的任務)、理論上的暴露(LLM 能完成的任務)、回報的暴露(工作者表示 AI 今天能完成的工作),以及預期的暴露(他們預期 12 個月後能完成的工作)——加上它們的排序(理論 > 回報 > 觀察到的),以及 AEI 調查揭示的 GDP、經驗與自動化梯度

暴露分類法:觀察到的、理論上的、回報的、預期的插圖

資料來源#

摘要#

「AI 暴露」常被寬泛地用來指稱截然不同的事物。Anthropic Economic IndexCadences 調查(2026 年 6 月)把四種衡量方式並列——兩種來自行為,兩種來自工作者的陳述——讓它們的排序與分歧變得清晰。結論是:AI 被觀察到正在做什麼、理論上能做什麼,以及工作者相信它能做什麼,是三個不同的數字;要推理 AI 對勞動市場的影響,先把它們分開是必要條件。

證據註記。 empirical——觀察到的/理論上的暴露來自先前的 AEI 研究與標準任務型衡量;回報的/預期的暴露來自連結的調查(自我回報、非代表性樣本,以及將分組回應按組中點編碼)。請參閱 Anthropic Economic Index

四種衡量方式#

衡量方式定義來源
觀察到的暴露某項職業的任務中,已經被看到使用 Claude 完成的比例使用遙測資料(先前的 AEI 報告)
理論上的暴露LLM 理論上能完成的任務比例——上限以任務為基礎的外部衡量
回報的暴露受訪者表示其工作任務中,有多少比例是 AI 今天能完成的調查
預期的暴露他們預期 AI 在 12 個月內能處理的工作比例調查

排序與相關性。 回報的暴露與觀察到的暴露及理論上的暴露都呈正相關——人們的信念會追蹤現實。但數值會系統性地分歧:回報 > 觀察到的(調查過度涵蓋重度使用者,他們看見更多 AI 能做的事),以及理論 > 回報(理論上的暴露是可能性的上限,不是目前使用情況的衡量)。約 10 位受訪者中有 6 位選擇了比今天更高的明年區間;超過三分之一的人預期 AI 在一年內能完成其大部分或幾乎全部工作任務。

涨潮:預期增長是一致的#

調查中最引人注目的結果是:雖然目前的感受會隨著你是誰、身在何處而異,對未來進展的預期卻極其一致。 將預期暴露與觀察到的或理論上的暴露相互繪圖後,最佳擬合線大致平行——無論本來的暴露程度如何,軟體工程師與營造經理都預期自己的領域在未來一年會有約相同幅度的進展。每個人都預期潮水會以相近的幅度上漲。(注意:將分組回應按中點編碼會使斜率偏向零,因此平行線應作質性解讀。)

橫斷面梯度#

回報的/預期的暴露會沿著三個軸線系統性變化:

  • 隨國家 GDP ↓——高收入國家的回報暴露低約 10 個百分點。這與 AI 取代較大比例低收入者日常任務的情況一致,即使職業層級的指標在先進經濟體中較高。報告將此連結到 IMF complements argument:低收入工作者可能缺乏讓 AI 得以增強而非取代工作的互補技能/基礎設施;先前的 AEI 研究也發現,低收入經濟體以更自動化的方式使用 Claude。
  • 隨經驗 ↓——具 15 年以上經驗的工作者,所回報的比例比第一年工作者低約 10 個百分點。在後續追問中,資深受訪者指出,判斷力、脈絡意識、情境推理,以及關係/人際工作(建立信任、管理人員)是 AI 無法複製的事物。這是從調查角度讀出的 Returns to Expertise in Agentic Coding:資深者認為 AI 無法觸及的,正是默會且脈絡特定的專業。
  • 隨自動化比例 ↑——更常將工作委派出去的人,回報並預期更高的暴露(見 The Automation–Optimism Link);委派行為能提供能力資訊,及/或信念較強的人更常委派。

值得注意的是,對未來進展的預期基本上與 GDP 和經驗不相關——這些梯度涉及的是今天所感知的能力,而不是預期變化的速度(再次回到涨潮的比喻)。

為什麼重要#

把這四個數字混為一談,正是「AI 能完成 X% 工作」這類說法出錯的原因。觀察到的暴露是地板(目前正在發生什麼),理論上的暴露是天花板(可能發生什麼),回報的暴露是勞動力感受到的現實,預期的暴露則是他們的預測。它們之間的差距——回報高於觀察到的,以及所有人都預期一致的躍升——才是有趣的量;而且每個量都對不同槓桿(能力、互補條件、信念)有所回應。

相關連結#

  • Anthropic Economic Index — 研究計畫;觀察到的/理論上的暴露是其早期基本量,回報的/預期的暴露則是調查新增的部分
  • Returns to Expertise in Agentic Coding — 經驗梯度是本調查對專業報酬發現的回聲:默會/關係性的判斷,是人類保有的剩餘優勢
  • Organizational Complements to AI — GDP 梯度與 IMF 的互補條件論點:沒有互補技能與基礎設施,暴露 ≠ 影響
  • The Automation–Optimism Link — 回報的/預期的暴露隨自動化比例上升;這是本能力信念衡量的情緒伴隨指標
  • Conversation Artifacts — 產物是「AI 做什麼」的輸出側觀點;可補充以任務為側重的暴露衡量
  • Conversation-to-Delegation Shift — 觀察到的暴露上升背後,來自密集邊際使用的證據
  • AI Usage Cadences — 非工作時段/高薪與跨國使用節奏,預示了本頁直接衡量的 GDP 與職業梯度
  • Task Time-Horizon Scaling — 理論暴露的天花板受可靠任務長度前沿所限制
  • Experimental Learning Impact of Generative AI — 信念校準的類比:如同回報的/預期的暴露,學生對 AI 學習效果的看法方向正確,但對幅度估計失準(控制組學生高估約 5 倍),直到親身使用後才修正
  • Firm AI-Spend Intensity and Headcount Growth — 完全屬於不同單位的衡量:本頁四種衡量都是職業層級的暴露(AI 能/正在對工作做什麼);Ramp × Revelio 觀察的是企業層級的採用(哪些企業實際支付 AI 供應商、何時支付、支付多少),並將其與這些企業的勞動力結果連結——這正是論文主張暴露指數在結構上無法捕捉的企業與職業間變異(擁有相同工作者的兩家企業,其採用程度仍可能明顯不同)
  • Market-Priced AI Exposure (the AI Premium)不同軸線上的第五種衡量:市場隱含暴露,從股價與 380T tokens 的已實現 AI 消費之共同變動推得。它既不是調查(回報的/預期的),也不是使用/任務映射(觀察到的/理論上的)——它定價的是投資者對某企業 AI 贏家/輸家的看法;其技能圖譜(互動/溝通 +0.36 SD,科學最負)與所有以任務為基礎的暴露衡量正交(變異不到 2%)。它從市場角度印證了本頁的經驗梯度(關係性/互動性技能被定價為上升),但也承襲自身的開發者偏差,並未解決代表性問題

開放問題#

  • 分組中點編碼會使暴露斜率偏向零;「一致上漲的潮水」有多少是實質,有多少是編碼產物(報告以 ≥60%-of-tasks 指標檢查穩健性,但各水準仍是自我回報)?
  • 回報的暴露高於觀察到的暴露,部分原因是調查觸及重度使用者;在具代表性的樣本中,回報/觀察到的差距會呈現什麼樣貌?進一步聚焦: realized-consumption measurement (Borri-Liu-Tsyvinski) 加入了一種市場隱含工具,建立在 380T tokens 的實際付費請求上——但它偏向開發者/熟練使用者(OpenRouter 約占全球 tokens 的 2%),這是與調查重度使用者偏差不同的非代表性。教訓是:目前沒有任何 AI 暴露工具具備代表性;每種蒐集機制都會朝自身方向產生偏差,因此回報/觀察到的/市場隱含之間的差距,有一部分是各方法所觸及的對象造成的產物。具代表性的普查仍是尚待達成的目標。
  • 經驗梯度建立在工作者對 AI 無法完成之事的信念上(判斷、關係性工作)——這種信念可能是持久的比較優勢,也可能是下一個即將被突破的能力邊界。究竟是哪一種?何時會發生?

資料來源#

§ end
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

Cited by 23
Related articles