資料來源#
- “We Must Act Now”: Sixteen Nobel Laureates Join Leading Economists and AI Researchers in Call to Prepare for AI’s Economic Transformation
- AI and Job Postings: From Destruction to Creation?
- Andrew Ng: The Biggest Opportunities in AI Aren't Where You Think
- Anthropic Economic Index report: Cadences
- Canaries in the Coal Mine? Six Facts about the Recent Employment Effects of Artificial Intelligence
- GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks
- Google AI & Economy ATLAS: AI in Science (September 2026)
- Helping People Choose Careers in the Age of AI
- One Capability or Many? Testing the Economic Validity of Frontier AI Evaluation
- The Human-AI Substitution Principle: When will you be replaced by AI in your organization?
- Voice AI in Firms: A Natural Field Experiment on Automated Job Interviews
摘要#
「AI 暴露」常被籠統地用來指截然不同的事物。Anthropic Economic Index 的 Cadences 調查(2026 年 6 月)把四種衡量方式並列——兩種根據行為推導,兩種來自工作者的陳述——清楚區分它們,並展示彼此的排序與差異。結論是:觀察到 AI 正在做什麼、理論上 AI 能做什麼,以及工作者相信 AI 能做什麼,是三個不同的數字;要推論 AI 對勞動市場的影響,先區分這些數字是必要前提。
證據說明。
empirical— 觀察到的/理論上的暴露來自先前 AEI 研究及標準任務型測量;回報的/預期的暴露來自所連結的調查(自我回報、非代表性樣本、將分組回覆以組距中點編碼)。參見 Anthropic Economic Index。
四種測量方式#
| 測量方式 | 定義 | 來源 |
|---|---|---|
| 觀察到的暴露 | 某職業的任務中,已觀察到使用 Claude 執行的比例 | 使用遙測資料(AEI 先前報告) |
| 理論上的暴露 | LLM 理論上能執行的任務比例——上限 | 外部任務型測量 |
| 回報的暴露 | 受訪者表示 AI 現今能做的工作任務比例 | 調查 |
| 預期的暴露 | 受訪者預期 AI 在 12 個月內能處理的工作任務比例 | 調查 |
排序與相關性。 回報的暴露與觀察到的及理論上的暴露都呈正相關——人們的看法大致跟現實一致。但暴露程度呈現系統性差異:回報 > 觀察到(調查過度代表重度使用者;他們見過更多 AI 能做的事),而且理論 > 回報(理論值是可能性的上限,並非目前使用情況的測量)。約六成受訪者選擇明年比今天更高的區間;超過三分之一的人預期 AI 一年內能完成大部分或幾乎全部工作任務。
把實務工作者的數字放進分類法(Ng,2026 年 8 月)。 Andrew Ng 公開以算術方式駁斥就業末日論——經濟學家「把工作拆成個別任務,或許 AI 能做……許多工作的 30% 到 40%」(Andrew Ng: The Biggest Opportunities in AI Aren't Where You Think,practitioner-opinion,歸因於 Erik Brynjolfsson 和 McAfee)——這是理論暴露的數字:模型可能做得到的事,而非觀察到正在做的事。上述排序說明了它的位置。觀察到的暴露低得多——ATLAS 發現,在 AI 涉入的職業中,任務比例中位數為 21%——回報的暴露則介於兩者之間。因此,Ng 所說人類仍負責的「60%」是今日人類工作占比的下限,也是最終占比的上限;而他所說「使用 AI 的人會取代不使用 AI 的人」,指的是職業內的重新分配,四種按職業計算的測量方式都看不到這種情況(最接近的工具是 Task Crossover)。他沒有說明 30–40% 來自哪種工具;下文的七種工具比較正好說明了這為何重要。
漲潮:預期的成長一致#
調查最引人注目的結果是:儘管人們對當前能力的看法會隨身處何處、身為何人而異,對未來進展的期待卻出奇一致。 將預期暴露與觀察到的或理論上的暴露相比,最佳擬合線大致平行——軟體工程師與營造經理都預期各自領域在未來一年進展幅度相近,無論原本暴露程度如何。大家都預期浪潮會以類似幅度上漲。(注意:分組回覆以中點編碼會使斜率偏向零,因此這些平行線應作質性解讀。)
橫斷面梯度#
回報的/預期的暴露會沿著三個軸向系統性變化:
- 隨國家 GDP 上升而下降——高所得國家的回報暴露低約 10 個百分點。這與 AI 取代低所得國家較大比例日常任務的情形一致,即便先進經濟體的職業層級指標較高。報告將其連結到 IMF 的互補性論點:低所得工作者可能欠缺能讓 AI 用於增強而非取代工作的互補技能/基礎設施;而早期 AEI 研究也發現,低所得經濟體更常以自動化方式使用 Claude。
- 隨經驗增加而下降——工作年資 15 年以上者,認為 AI 可做的比例比第一年工作者低約 10 個百分點。後續訪談中,有經驗的受訪者指出 判斷力、情境覺察、情境推理,以及關係/人際工作(建立信任、管理人員)是 AI 無法複製的能力。從調查角度來看,這就是 Returns to Expertise in Agentic Coding:有經驗者相信 AI 無法觸及的,正是默會且依情境而異的專業知識。
- 隨自動化占比增加而上升——較常委派工作的人回報並預期較高暴露(參見 The Automation–Optimism Link);委派行為能反映能力,和/或相信 AI 能力較強的人更願意委派。
值得注意的是,對未來進展的預期幾乎與 GDP 和經驗無關——這些梯度關乎人們對今日能力的認知,而非預期變化的速度(再度呼應漲潮的比喻)。
為何重要#
把這四個數字混為一談,就會導致「AI 能做掉 X% 的工作」這類說法出錯。觀察到的暴露是底線(現在正在發生的事),理論暴露是上限(可能做到的事),回報暴露是勞動力感受到的現實,預期暴露則是他們的預測。它們之間的落差——回報高於觀察值、人人都預期一致幅度的躍升——才是值得關注的數量,而且每種落差都受不同因素(能力、互補條件、信念)影響。
觀察到的暴露,測量兩次#
Google ATLAS(2026 年 7 月)以另一個研究團隊的資料,使用相同的 O*NET 基礎架構,提供第二組觀察到的暴露數據。兩者的比較提醒我們,不應把這四個數字中的任何一個視為經濟體的固有屬性,而應視為測量工具的產物:
| AEI | ATLAS | |
|---|---|---|
| O*NET 任務中觀察到使用 AI 的比例 | 36%(Handa 2025)/合併計算 49%(Appel 2026) | 約 20% |
| 自動化占比 | 43–45% | 非例行認知任務 <10% |
ATLAS 將任務差異歸因於更嚴格的隱私門檻(一項任務必須有超過 25 位不同使用者才會計入),將自動化差異歸因於定義不同——ATLAS 使用五類意圖分類器,凡未達端對端執行都視為協作;AEI 則採二分法。兩者都沒有錯;它們只是對同一構念採取不同切法,這表示觀察到的暴露是測量慣例,而非事實。 ATLAS 的 Task Saturation: Broad but Shallow AI Diffusion 為這套分類法增加了真正的新角度——不是問「某職業有多少任務可能或已經受到暴露」,而是問 AI 對已經觸及的職業,滲透得有多深(涵蓋 68% 的職業,但任務比例中位數為 21%)。廣度與深度可以分開看;把兩者混為一談,就會把「68% 的職業」解讀成「68% 的工作面臨風險」。
如今至少有一個案例能夠量化整套測量的誤差範圍:參見 Usage-Telemetry Classifier Validation。
七種工具正面比較#
Steele & Cruz(arXiv 2607.15506,2026 年 7 月) 進行了上一節只做到 N=2 的實驗:把七種職業 AI 暴露工具——橫跨九年——套用到相同的 O*NET 職業上,將每種工具標準化為平均值 0/標準差 1,再詢問它們對工作的排名是否一致。結果並不一致。 N=7 時,彼此的歧異幾乎達到全面程度;論文的實務結論是,任何以單一工具為基礎的職涯建議,都建立在該工具的假設之上。
七種工具#
(論文表 1 和表 2 的每一格都已在匯入時逐一核對——參見 Sources。)
| 工具 | 暴露測量方式 | 數值的意義 | 職業分布 |
|---|---|---|---|
| Steele & Cruz 2026 | Anthropic + OpenAI 查詢 | 一份工作的任務中可行自動化的比例 | n=872,平均 23.6,SD 6.18,範圍 15.8–49.8 |
| Massenkoff & McCrory 2026 | Anthropic 查詢 × Eloundou 可行性 | Claude 實際自動化的 LLM 可行任務比例 | n=872,平均 0.08,SD 0.12,範圍 0–0.73 |
| Eloundou et al. 2024 | GPT-4 任務評分,經人工驗證 | LLM 能完全自動化的一份工作任務比例 | n=872,平均 0.32,SD 0.19,範圍 0–0.84 |
| Felten et al. 2021 | 群眾外包能力評分(2,000 位 MTurk 使用者) | 一份工作之能力適合交由 AI 處理的標準化程度 | n=759,平均 0.04,SD 1.0,範圍 −2.67–1.53 |
| Webb 2020 | AI 專利標題文字探勘 | 工作任務中出現的 AI 專利動詞-受詞配對比例 | n=719,平均 0.42,SD 0.29,範圍 0–1.49 |
| Brynjolfsson et al. 2018 | 依 23 項準則評分群眾外包的 DWA | 機器學習適用性(SML),1–5 分 | n=872,平均 3.46,SD 0.11,範圍 2.83–3.91 |
| Frey & Osborne 2017 | 70 種人工編碼職業 → 以 ML 推估至 702 種 | 整份工作可被自動化的機率 | n=689,平均 0.50,SD 0.38,範圍 0.003–0.99 |
在計算任何相關性之前,就能看出三件事。估計對象並不相同:五種工具評估一籃子任務,Felten 評估能力,而 Frey 是唯一一種(依論文原文)「將職業分類為單一整體,而非一籃任務、活動或能力」。分布形狀全然不同——Frey 在 [0,1] 區間幾乎均勻分布,Massenkoff 的數值大量堆積在零,而 Brynjolfsson 的 SML 只用了名目 1–5 分制的 27%(經濟體中的每個職業都落在 2.83 到 3.91 之間)。此外,涵蓋職業數相差約 180 種(689–872),因為各篇論文採用的 SOC 版本不同。
它們依資料來源聚類,而非依構念#
散佈圖矩陣(圖 6)沒有顯示普遍的正相關。其中兩組配對特別突出,但兩者都可由共同輸入資料解釋,而非測量結果趨同:
- Steele & Cruz ↔ Massenkoff & McCrory:ρ = 0.89——兩者都以 2025 年 Anthropic Claude 使用資料為基礎。
- Eloundou ↔ Felten——其餘工具中相關性最高,儘管分析層級(19,000 項任務 vs. 52 種能力)、評分者(GPT-4 vs. 2,000 位 MTurk 使用者)和問題都不同。兩者共同之處在於聚焦於理論上的生成式 AI 能力。
較早期的工具——Webb 的專利、Brynjolfsson 的 ML 準則、Frey 的瓶頸模型——「彼此之間或與較新測量方式都幾乎沒有對應關係」。從 Felten 2021 年起的工具,彼此一致程度比更早期工具稍高。
這項概括讓本頁上方的四分分類法顯得不太令人安心:暴露工具在共享資料來源時才會相關,而不是在它們宣稱測量相同構念時才會相關。 兩種觀察暴露工具之所以一致,是因為都讀取 Claude 紀錄;兩種理論暴露工具之所以一致,是因為都在詢問 LLM 能做什麼。跨類別比較時,一致性便瓦解。這也重新界定了 Market-Priced AI Exposure (the AI Premium) 的正交性發現(市場隱含的分布圖只能解釋每一種任務型測量中 <2% 的變異):任務型測量彼此之間也大多正交,因此正交性從來不能證明市場測量才是異類。
重點:十二個名額,十一種職業#
詢問哪些職業的暴露程度最高時,論文帶入後續分析的六種工具,提名的工作幾乎完全不同:
| 工具 | 暴露最高 #1 | #2 |
|---|---|---|
| Steele & Cruz 2026 | Database Warehouse Specialist | Business Intelligence Analyst |
| Eloundou 2024 | Telephone Operator | Telemarketer |
| Felten 2021 | Genetic Counselor | Financial Examiner |
| Webb 2020 | Wastewater Treatment Operator | Civil Engineer Technician |
| Brynjolfsson 2018 | Mechanical Drafter | Mortician |
| Frey 2017 | Telemarketer | Insurance Underwriter |
十二個名額,十一種不同職業。 唯一重複的是 telemarketer,由 Eloundou 和 Frey 共同列出;但這兩種工具在圖 6 中彼此不相關,作者也指出這只是巧合。論文將這種分歧歸因於測量理念:以生成式 AI 能力為基礎的工具(Steele、Eloundou、Felten)會凸顯技術與分析類職位;Webb 的專利探勘會凸顯工程職位;Frey 的瓶頸模型則會凸顯公式化、腳本化的工作。如果工作者問這六種工具中的任何一種:「我是不是美國暴露程度最高的工作?」六種裡有五種會回答不是。
解析警告。 此表為重建結果。docling 解析表格時,表 5 的六個模型名稱全都合併到第 1 列的同一個儲存格,第 2–6 列則空白,而兩個職業欄的順序仍然保留——這是典型的表格塌縮錯誤。上述對應關係已在匯入時從 PDF 中復原並核實;它不是解析出的表格。
暴露與薪資的梯度會隨工具版本改變方向#
四種最新工具顯示,標準化暴露與 2022 年薪資中位數之間呈正向、約略線性的關係,與職業複雜度之間也有相同關係(按重要性加權的 GWA 複雜度分數,範圍 18.6–74.5)。Felten 的斜率最陡——其方法把較高暴露歸因於語言與解說能力,因此律師與教育工作者接近排名頂端。
最老的兩種工具則不同。Frey & Osborne 2017 與薪資呈強烈負相關;Brynjolfsson 2018 與薪資的關係平坦,與複雜度則略呈負相關。兩者都有明確的原因,並非無從解釋:Frey 部分根據先前自動化浪潮推估(例行手動與文書工作位於薪資分布底部),而 Brynjolfsson 的準則明確把高風險任務評為較不適合機器學習,因此其設計本身就會懲罰複雜度。
因此,「AI 對薪資分布頂端還是底端的衝擊最大」——白領工作取代論爭的核心問題——其答案取決於工具的假設,而非底層經濟體。這是本頁主張最有力的版本:工具決定的不只是暴露的程度,也決定標題所宣稱的分布效果方向。
……同一工具不變,只改變時間範圍,方向也會翻轉#
Steele & Cruz 改變工具。Indeed Hiring Lab(Gallacher,2026 年 7 月) 則固定單一工具——Hiring Lab 自家 AI at Work Report 2025 的生成式 AI 職業暴露測量,文章也連結該報告作為暴露資料來源——只改變衡量結果的時間範圍。結果同樣出現方向翻轉:
- 2022 年 5 月 → 2026 年 5 月:職業的 AI 暴露程度越高,美國職缺刊登數下降越多。(這與紐約聯邦儲備銀行的發現一致:AI 暴露職缺的下滑在 ChatGPT 發布前就已開始;因此不應把 2022–2026 年的整段斜率都解讀為 AI 效應。)
- 2025 年 5 月 → 2026 年 5 月:關係反轉——暴露程度越高,職缺刊登數反彈越多,由軟體開發帶動。
兩種關係都被描述為具統計顯著性,也都明確指出未經控制;相關係數和 p 值只出現在文章圖表中,此處不引用。這對本頁有兩個影響。第一,取代論述中的「暴露」悄悄附帶了某種方向(「受到暴露 ⇒ 萎縮」),但資料只在選定的時間範圍內支持這個方向——某職業可以在暴露排名中居首,十八個月後也在成長排名中居首,因此暴露分數只排列職業,並未預示職業會如何發展。第二,這是以暴露程度衡量的結果,而非另一種暴露工具:它與上面的正面比較屬於同一類,都是對工具進行勞動市場驗證——以實際就業變化評分——但它的答案取決於採用哪段實際期間來評分,這也使下文開放問題所提出的「以後續就業變化評估七種工具」測試更加複雜。
理論方面也有相同的不確定性;論文先明說了,接著卻未再處理。 Banerjee & Singh 的 HAT 模型(arXiv 2607.20781,practitioner-opinion——沒有資料的形式模型)推導出一個技能門檻 μ*,將人類的「保護區」與「脆弱區」分開,並提出 P5 作為預測:「違反直覺地,在 Δ$' 持平的職業中,高技能工作者可能比中等技能工作者更脆弱。」但產生 μ* 的推論給出的結論,與其說方向明確,不如說恰恰相反:「高技能工作者究竟受到保護或更脆弱,取決於任務,若沒有特定領域的參數便無法判定。」門檻會隨基準成本、組織深度、AI 能力,以及風險差異而變動;論文並指出,深度對門檻的影響本身也取決於參數。因此,形式模型與七工具實證正面比較從相反方向走到同一結論:目前沒有任何事物能確定技能與脆弱度之間的關係方向,無論哪個方向,若有人斬釘截鐵地宣稱答案,說的都是自己的假設。模型補充了工具無法提供的一個理由,解釋為何關係可能朝任一方向發展:人類補償與技能呈凸性關係,而 AI 成本對能力變化近乎平坦,因此誰勝出取決於兩條曲線交會的位置,而非哪個代理程式更擅長這份工作。
第七種工具:把遙測資料重建成投影估值#
前六種較舊工具都投影 AI 可能做到的事情(根據評分者、專利或準則),Steele & Cruz 則以 2025 年人們實際傳給模型的內容來建構測量——在這套分類法中,首次把使用遙測資料轉成前瞻性的暴露估值,而不是觀察暴露計數。參見 Telemetry vs. Survey Measurement,了解這個工具家族的論點。
- Claude 部分——來自第三版 AEI 的全球 1,909,132 筆查詢(Appel et al.,2025 年 8 月 4–11 日;50.5% Free/Pro、49.5% API),每筆都對應至 17,659 項 O*NET 任務之一及五種使用模式之一。依查詢量將任務分成二十分位組,每組套用人工設定的階梯函數,以指定可行自動化上限:第 20 組 → 80%、第 19 組 → 70%、第 18 組 → 60%、第 17 組 → 50%,而85% 沒有 Claude 查詢的任務 → 5%,不是 0(其論點是,生成式 AI 幾乎能為「任何任務」提供有用的綜整,包括修剪樹木)。
- 降低增強分數——位於增強查詢減自動化查詢差值最高 2% 的 223 項任務(全在前兩個二十分位組,大多是教學、諮商、學術寫作)從 70–80% 下調至 40%,假設使用者刻意保留人工參與的工作,本質上更難完全交出。
- ChatGPT 部分——OpenAI 的 2025 年職場使用資料(Chatterji et al.,2025 年 5–7 月)只公開到 41 項 Generalized Work Activities,而非個別任務,因此採用一套刻意偏低的十分位組→暴露比例表(最高十分位組 → 30%,下限 5%),以懲罰較粗略的彙整方式,接著依各 GWA 對該職業的重要性加權。OpenAI 未回報的四項 GWA,則以相似項目推估。
- 合併——將兩種職業分數簡單平均。
兩部分的表現截然不同。Claude 單獨計算的暴露落在 5%–62%(平均 14.5、SD 10.8),呈現明顯左側峰值與強烈正偏態;ChatGPT 單獨計算則落在 27%–40%(平均 32.7、SD 2.2),呈鐘形分布。相同構念、相同年度、兩家前沿實驗室:一種工具把職業分散在 57 個百分點的範圍內,另一種只有 13 個百分點。論文以平均兩者來折衷。
關鍵步驟是階梯函數。 二十分位組→暴露比例、十分位組→暴露比例都是作者明確提出並辯護的假設,而非估計值。這項測量沿用遙測資料對任務的排序,但其程度取自人工設定的對照表;更換對照表就會改變整欄數值。應把它解讀為「依使用情況排序、採用假設上限的暴露」,而不是可行性的測量。這種建構方式也反轉了人們對使用資料的常見質疑——沒有查詢紀錄的任務占 85%,仍設定最低 5% 暴露,正是因為沒有使用紀錄不能證明任務不可行。
來源內部矛盾,以及留下的注意事項。 §4.3 稱合併指標的範圍為「15.8 到 29.8」,但該句引用的表 2 顯示最大值為 49.8。 有三項獨立理由顯示應以表格為準:合併分數是 Claude 部分(最高 62%)和 ChatGPT 部分(最高 40%)的平均值,因此上限應接近 51,不可能是 29.8;相同算術也能精確重現下限((5+27)/2 = 16 ≈ 15.8);而且該數值在匯入時已對照 PDF 核實,因此這是論文自相矛盾,而非解析錯誤(很可能是將 4 誤植為 2)。重點不在那個數字。 重點在於,引用這篇論文的文字版摘要統計前,必須核對表格;這個錯誤就這樣刊上 arXiv。這個頁面的所有數字都取自表 1–4,或來自與表格一致的文字敘述。
將工具取平均,以及由此得出的結果#
論文以多元化而非裁決來回應這些分歧:將各模型的標準化分數取平均。過程中排除兩種工具,都是主觀判斷,也都明確揭露:
- 所有後續分析都排除 Massenkoff & McCrory,因為它與 Steele & Cruz 的相關係數 ρ=0.89,若同時納入就會讓 2025 年 Anthropic 使用資料獲得雙倍權重。圖 7–10 和上方暴露程度最高的表格只保留六種工具。
- 標題平均值排除 Frey & Osborne,理由是「年代最久、最異常」。因此留下五種工具——但論文表示,保留全部六種「整體上得到的暴露建議相當類似」,並呈現了穩健性檢查。
即使如此,有件事值得直說:排除意見最不一致的工具,正是讓平均值看起來穩定的做法。報告中呈現的趨同,有一部分取決於保留了哪些工具。此外,論文完全未處理一個缺口:涵蓋職業數介於 689–872,文中從未說明跨模型平均如何處理某些工具未涵蓋的職業——一項 Frey、Webb 和 Felten 都未涵蓋的工作,其「五模型平均」其實是三模型平均,文中卻未提及。
這個平均值產生的職涯指引(論文的實際目的,並附互動工具):
- 職業暴露的跨模型平均值越高,薪資中位數只會略微增加;最高薪職業(醫師、執行長)的暴露程度接近中位數,而非任一極端。低於中位數的薪資集中在狹窄的 28,000–58,000 美元區間,高於中位數的薪資則分布廣泛。
- 薪資高於中位數、暴露低於中位數的「穩定」象限,集中於醫療照護實務(最顯著的單一領域)、O*NET Job Zone 3(副學士學位與技術職:水電工、木工、牙科衛生師、抽血技術員),以及 RIASEC 的實用型、社會型和研究型類別。
- 薪資與暴露都高於中位數的職業涵蓋管理、金融、運算、工程、法律與教育——「近幾十年來被視為相對可靠的發展途徑」。
- 跨模型暴露程度在學士學位層級達到最高,而非更高學歷。
社會型工作,以及兩種較舊工具共同誤判的一項假設#
以查詢資料建立的工具產生一項連作者都稱為違反直覺的結果:社會型工作(教學、指導、諮詢)在所有 RIASEC 類別中暴露程度最高,因為教案規劃和概念解說是 Claude 最常收到的查詢之一。這直接挑戰 Frey & Osborne 2017 和 Brynjolfsson 2018 工具中的假設——人際工作本身就是人類優勢,因此構成自動化瓶頸。
關鍵在於區分增強與自動化,而非全盤否定。諮詢、建議和教學是少數幾種增強查詢多於自動化查詢的 GWA,這也正是論文自家工具將這些任務降至 40% 的原因。較舊工具認為這些工作難以完全交接,這點是對的;但它們據此推論 AI 完全無法介入,這點則錯了。它們的瓶頸直覺在其他工作中依然成立:指導他人、照顧他人、談判、建立關係、培養團隊及協調工作,很少會交由任一模型處理。
其中一個殘餘瓶頸如今已直接接受測試。 本頁每一種工具都是推斷暴露程度——根據查詢數量、專利、評分者或準則。Jabarian & Henkel(arXiv 2607.28222) 則將 67,056 名求職者隨機分派給 AI 語音代理程式或人類招募人員進行面試,並測量公司的結果。面試正是 Frey & Osborne 與 Brynjolfsson 歸為自動化瓶頸的那種重人際互動、對話和判斷的任務,也是單靠使用資料無法裁定的任務——任務沒有查詢紀錄,可能是因為不可行,也可能只是還沒有人打造相應介面。AI 組的錄用通知增加 12%,到職人數和任職滿一個月的留任率則都增加約 18%,而且生產力沒有下降;所有聘用決策仍由人類招募人員做出。
有三項限制表示這並未推翻瓶頸概念。自動化的是資訊蒐集,而非判斷——依設計,評估仍由人類負責,因此這項實驗拆解的是「社會型」職業中的一項工作,而非取代整個職業。論文自己的邊界條件也保留了舊工具直覺可能成立之處:成果集中於「工作量大、流動率高,且任務重複、結果能迅速觀察的環境」,而「默會知識、關係推論或高度專業技能篩選,可能更適合由人類進行篩選」。此外,人類組有四分之一的面試被判定為不適合,AI 沒有執行這種淘汰流程,因此部分效果可能來自減少人為裁量,而非資訊品質提升。即便如此,方向仍對本頁論點有所影響:資料庫中唯一採隨機分派、測量結果的人際任務,結果不支持瓶頸假設,而且衡量的是公司營收指標,而非查詢數。
增強會帶來較高薪酬#
將 872 種職業依 Claude 查詢中增強相較於自動化的比例分成十分位組,再繪製各組職業的平均薪資:在第九十分位組中,將 Claude 大量用作助手的工作,薪資比大量將它當作代理人委派工作的職業每年高出約 7,000 美元(第十分位組的差距縮小)。薪資隨 Claude 使用量十分位組逐步上升。
作者刻意淡化了結論,兩項限制也確實存在:2025 年 9 月的資料無法區分工作用途與個人用途,因此任務只是被分派給會用到它們的職業;薪資資料來自 2022 年,早於任何由 AI 驅動的薪酬變化。第三項限制是作者指出的時間點:資料發布於 Claude Code 上線之後(2025 年 5 月),但早於 2026 年初的自主能力改善。整體方向與 Returns to Expertise in Agentic Coding 和 Market-Priced AI Exposure (the AI Premium) 一致——越難交接的工作,薪酬越高;而論文結尾的保留說法才是誠實的結論:這種模式能否持續,「取決於各領域採用的使用規範」。
六種工具,一項實際結果——本頁一直呼籲、如今部分完成的驗證#
下方的開放問題要求進行一項尚無人完成的測試:依據後續就業變化評估工具,而非相互比較。Brynjolfsson、Chandar & Chen(2026 年 8 月修訂) 比文獻庫中其他研究都更接近這個目標。他們使用同一份 ADP 薪資紀錄面板——數百萬名美國工作者,每月更新至 2026 年 6 月——以六種職業暴露測量分析資料,其中三種列在本頁七種工具之中:
- Eloundou et al. (2024) GPT-4 β(主要結果)
- Brynjolfsson et al. (2018) 機器學習適用性——上方的工具 #6,也是只使用其名目量表 27% 的工具
- Felten et al. (2021) AI Occupational Exposure,以及 Felten et al. (2023) 的語言模型和影像生成版本
- Tomlinson et al. (2025) AI applicability,根據 Bing Copilot 對話推導
- 另外,還有 Anthropic Economic Index 的使用/自動化/增強比例
它們的一致程度遠超本頁正面比較所預期。「不同測量方式的結果在質性上相似:對 22–25 歲工作者而言,暴露程度最高的五分位組就業人數相較 2022 年 11 月下降 10% 至 13%,暴露程度最低的五分位組則成長。」在同一實際結果上,只差三個百分點;然而這些工具在暴露程度最高的十二個名額中,提名了十一種不同職業。
這確實令人意外,解釋則在於上方那些分歧的構成方式。Canaries 將暴露程度分成五分位組,只檢視兩端,而且限定在單一年齡層和單一固定時間範圍。五分位組分法剛好捨棄了工具彼此爭議的資訊——尾端內部的排序,以及哪種職業排名第一——同時保留它們共同編碼的概括資訊:文書及可明確編碼的知識工作,暴露程度高於手工與體力工作。因此,工具對排名意見不一,對層級卻一致;分析使用哪一種資訊,決定了工具選擇是否重要。指出某職業暴露程度的職涯建議工具使用的是排名,因此 Steele & Cruz 的警告仍然成立。把經濟體分成五等分的勞動市場研究使用的是層級,因此工具替換後仍可能成立。
這只是部分驗證,尚未真正完成測試,原因有二。研究從未將工具彼此比較——沒有排名準確度統計,也沒有「哪種工具最能預測實際變化」,只有六組分開分析且被描述為質性相似的結果。其次,時間範圍固定在 2022 年 11 月至 2026 年 6 月,而上方 Indeed 的方向翻轉恰好顯示時間範圍是關鍵;目前仍未進行預先指定多個時間範圍的評分。
機制軸向,以及終於測量出的經驗梯度#
同一篇論文還增加一個七種工具都未涵蓋的軸向:AI 觸及某職業的比例多大之外,還要看知識的類型——參見 Codified vs Tacit Knowledge Exposure。這個軸向之所以值得列在本頁,是因為它首次以測量呈現上方提到的經驗梯度。調查發現,工作年資 15 年以上者認為 AI 可涉入的工作比例比第一年工作者低約 10 個百分點,並指出判斷力、情境覺察和關係工作是剩餘部分;這是擁有默會知識的人對默會知識所持的看法。Canaries 將明確知識/默會知識指數套用到薪資資料,發現相應的結果:明確知識占比較高職業中的年輕工作者處境轉差,默會知識占比較高職業中的資深工作者成長較快——AEI 使用資料拆分得到的互補性係數只在 41–49 歲(+0.024)和 50 歲以上(+0.015)轉為正值且達顯著,而自動化係數則從 22–25 歲的 −0.098 單調縮小至 50 歲以上的 −0.006。
坦誠說明限制,反而支持本頁的論點:在控制大學教育比例後,明確知識指數的一半不再成立,但默會知識的一半仍成立。因此,測量結果更接近「經驗帶來回報」,而非「AI 取代明確知識」;而且這項工具以 LLM 評分職位描述——又一種測量慣例,堆入既有的一系列慣例之中。
菁英共識,建立在無法就方向達成一致的工具之上#
在2026 年 7 月 13 日——比 Steele & Cruz 發表上述正面比較早三天——超過 200 位經濟學家和 AI 研究者,其中 16 位諾貝爾獎得主,簽署了《We Must Act Now: A Statement on AI's Transformation of the Economy》,警告經濟轉型的規模將超過工業革命,時間卻短得多。這是一項 practitioner-opinion,沒有任何測量;知識庫將它保留為菁英意見的日期標記,而非本頁任何論點的證據。
放在本頁旁邊看,這項聲明恰好能凸顯分析解析度的落差,因此格外有用。就在經濟領域資深人士簽署 AI 經濟轉型聯合聲明之際,七種用來衡量這種轉型的工具無法就哪些職業暴露程度最高達成一致(十二個暴露最高名額,十一種不同工作);無法就暴露程度與薪資究竟正相關或負相關達成一致(四種最新工具為正相關,Frey 2017 為負相關,Brynjolfsson 2018 為平坦至負相關);而且,固定單一工具後,也無法讓暴露與結果之間的關係方向在兩個重疊時間範圍內維持一致。
這種重疊並非巧合。Brynjolfsson 籌辦了這封聯名信,也是工具 #6 的作者;該工具的 SML 準則產生本頁兩個異常薪資梯度之一,並編碼了人際互動瓶頸假設,而 Controlled Variance: AI's Edge as Reduced Dispersion 已測試並發現該假設站不住腳。這不代表聯名信有問題,而是呈現了現況。對方向和急迫性的共識,可以與對規模和影響分布的全面分歧並存;分歧存在於簽署者名單之內,而非簽署者與外部批評者之間。
聯名信最謹慎的地方也承認了這點,而謹慎之處才是可以引用的內容:Spence 說,經濟許多領域的衝擊「在幅度和時間點上都存在高度不確定性」;Cunningham 則說「我們正身處迷霧中前行,極難預測接下來會發生什麼」。本頁呈現的正是量測之後的迷霧。方法論上的解讀是:援引專家共識無法裁定本頁討論的任何問題,因為爭議的正是專家們自己的工具——簽署人數和測量解析度彼此正交。
相關連結#
- AI Adoption in Scientific Work — 同一個職業同時以遙測資料與自陳資料衡量,也是本頁每種測量工具背後框架問題最鮮明的表述:對科學家而言,沒有可用來加權調查的母體抽樣框
- GDPval Benchmark — 本頁四種工具之外,也是 Steele & Cruz 七種工具之外的一種工具,因為它衡量的是相對於現任從業者的交付品質,而非任何形式的曝險:涵蓋 44 個職業,任務由平均任職 14 年的專業人士撰寫(至少 4 年),並以盲測成對勝率評分。儘管如此,它的選取規則仍是曝險測量上的設計選擇,而且別具特色——先依 GDP 貢獻挑選產業(Q2-2024 增加值各自超過 5% 的九個產業),再從每個產業挑出薪資最高的五個職業,並篩選出經 GPT-4o 分類器判定加權 O*NET 數位任務占比超過 0.60的職業;分類器則依 Acemoglu & Autor (2011) 的任務內容框架驗證(數位占比會隨非例行認知內容增加,並隨例行與體力內容減少)。這是把理論曝險用作納入篩選條件,而非估計值,因此 GDPval 的職業清單成了本頁各種工具可供評分的第五項產物。本頁所有工具估計的都是 AI 會觸及某職業的多少工作;GDPval 問的則是產物是否勝過專業人士——因此其職業排名(櫃檯與租賃事務員、採購代理、IT 系統經理、軟體開發人員接近平手)可與下方「十一個職業出現在十二個名額」的分歧進行可檢驗的比較
- Controlled Variance: AI's Edge as Reduced Dispersion — 本頁所有工具的以結果衡量對照:它不推論關係型任務的曝險程度,而是將 67,056 名應徵者隨機分派至 AI 主導的求職面試,再從公司紀錄讀取錄取通知、到職與留任情況。這是反駁 Frey & Osborne 2017 與 Brynjolfsson 2018 人際瓶頸假設的直接證據,但範圍受限於只有資訊蒐集工作自動化
- The Solo-Authorship Rebound — 根據結果而非任務評分建立的曝險排序,且採用不同的分析單位:26 個科學領域依 ChatGPT 出現後其單獨作者趨勢的變化幅度排序,作者將其解讀為共同作者執行工作的可替代性(工程每年 +2.5 個百分點、商業 +1.9,至物理 −0.0、人文藝術 −0.5)。它也從另一個領域重申本頁的問題——Matsui 承認,職業工具(Eloundou 2024、Felten 2021)「無法乾淨地對應到 OpenAlex 領域」,因此即使行為曝險衡量與任務評分工具都存在,也無法整合
- Codified vs Tacit Knowledge Exposure — 第五個面向,也是唯一關乎機制而非幅度的面向:AI 會取代哪一類知識。兩個曝險分數相同的職業,年齡梯度可能完全相反,而本頁的每種工具都看不出這點。這也是六種工具終於能以一項已實現結果進行檢驗的地方;上文的經驗梯度不再只是看法,而成了薪資資料序列
- The Tragedy of the Cognitive Commons — 另一個軸線上的曝險:關鍵不是 AI 能完成某職業多少比例的任務,而是它接手的任務是否正是新手藉以學習的工作。其五項脆弱性因素預測了這一點最重要的所在
- Task Crossover — 對四種衡量工具背後假設的挑戰:曝險是依照固定的 O*NET 任務清單逐職業計算,但 43.5% 的職業專屬 AI 使用其實是其他職業的工作,因此工作所「擁有」的任務重新分配的速度,比分類對應更新還快
- Anthropic Economic Index — 這項研究計畫;觀察到的/理論上的曝險是較早期的基本概念,回報的/預期的曝險則是調查新增的內容
- Task Saturation: Broad but Shallow AI Diffusion — 與本頁四種曝險衡量正交的深度衡量:它問的不是 AI 在整體經濟中觸及多少任務,而是 AI 已觸及的職業中,有多少任務受到涵蓋(中位數 21%);此外,另一家實驗室測得的觀察曝險只有 AEI 數值的一半
- Usage-Telemetry Classifier Validation — 每個曝險數值背後的分類器誤差範圍,ATLAS 首次量化:在 O*NET 任務層級的準確率僅 22.6%,而人類核准率為 85.8%
- Returns to Expertise in Agentic Coding — 經驗梯度是這份調查對專業回報發現的呼應:隱性/關係型判斷是人類仍保有的剩餘優勢
- Organizational Complements to AI — GDP 梯度與 IMF 的互補因素論點:缺少互補技能與基礎設施時,曝險 ≠ 影響。這篇也介紹 HAT 替代模型,是本頁工具分歧在理論上的對照:本頁每種工具衡量 AI 可能對職業做什麼,而 HAT 建模的是組織決策是否取而代之——結果其自身的技能門檻
μ*也和這些工具一樣,無法判定正負方向 - The Automation–Optimism Link — 回報/預期曝險隨自動化占比上升;這是能力信念衡量的情緒面對照
- Conversation Artifacts — 對「AI 做了什麼」的產出面觀點,可補足任務面曝險衡量
- Conversation-to-Delegation Shift — 觀察曝險上升背後的密集邊際使用證據
- AI Usage Cadences — 非工作時段/高薪與跨國使用節奏,預示本頁直接衡量的 GDP 與職業梯度
- Task Time-Horizon Scaling — 理論曝險的上限受可靠任務長度前沿所限
- Experimental Learning Impact of Generative AI — 信念校準的類比:和回報/預期曝險一樣,學生對 AI 學習效果的感受方向正確,但幅度估計不準(控制組學生高估約 5 倍),直到親身使用後才有所修正
- Firm AI-Spend Intensity and Headcount Growth — 這篇也介紹上文所述、符號會隨觀察期間翻轉的職缺刊登工具,以及它與 Ramp 樣本中資歷組成的矛盾。此外,它衡量的是完全不同的分析單位:本頁四種工具都是職業層級的曝險(AI 對一份工作可能/實際能做什麼);Ramp × Revelio 則觀察公司層級的採用情況(哪些公司何時實際付費使用 AI 廠商、花了多少),並連結這些公司的勞動力結果——論文指出,這種公司與職業間的變異是曝險指數在結構上無法捕捉的(員工相同的兩家公司,採用情況可能相差甚大)。Steele & Cruz 補充了相關限制:這些指數彼此之間也無法區分
- Market-Priced AI Exposure (the AI Premium) — 第五種、位於不同軸線的衡量:市場隱含曝險,從股價與 380T 個已實際發生的 AI 使用 token 之間的共同變動推論而來。它既非調查(回報/預期),也非使用/任務對應(觀察/理論),而是為投資人對公司 AI 贏家/輸家的看法定價;其技能圖譜(互動/溝通 +0.36 SD,科學領域最負向)與所有任務型曝險衡量都正交(變異不到 2%)。它從市場角度佐證本頁的經驗梯度(關係/互動技能的定價走高),但也承襲了自身偏向開發者的問題,未能解決代表性問題。Steele & Cruz 的直接比較重新詮釋了這種正交性:任務型衡量彼此之間也幾乎沒有一致性,因此與它們不相關,並不能作為市場衡量的缺點
- AI and Market Power — 新增的是彙總軸線,而非新構念,也是本頁所說曝險指數在結構上無法產生的衡量:OECD 將 Felten-Raj-Seamans 職業 GenAI 分數依就業人數加權,彙總至公司層級,運用葡萄牙雇主與員工連結資料,從職業層級工具產生公司層級變異。結果有兩組方向相反的梯度——生產力、加價幅度與高等教育占比呈單調關係,規模與市場占比則呈倒 U 型。本頁自身的反身性警語在這裡表現得最明確:依認知型非例行任務加權的分數,必然會找出高技能公司,因此教育梯度有一部分是工具在映照自身;規模/市場占比的形狀則不是
- Telemetry vs. Survey Measurement — 七種工具分群背後的家族論點:Steele & Cruz 的第七種模型首次把使用遙測資料往前推,用來產生預測(依二十分位排序的任務 × 假設自動化上限),而非將其作為觀察曝險計數回報;兩種以遙測資料構建的工具彼此相關係數為 ρ=0.89,與所有任務型工具的相關性則很低——預測一致性的因素是測量家族,而非構念
- Cognitive Capability Profiling for Task Suitability — 一種第八種工具,其基本資料首次既非任務描述也非使用紀錄。Prunty et al. (Cambridge CFI, arXiv 2608.25623,
empirical) 根據 19,535 個帶有規準標註的基準測試項目,為模型評定八種認知面向;再請 410 名工作者為每項活動分配 100 點,據此為工作評定相同面向,並以兩者匹配程度推導曝險。最接近的對照是 Felten 2021,而差異正是重點:Felten 請 2,000 名 MTurk 工作者預測 AI 是否適合執行 O*NET 的 52 種能力,那是群眾對技術的信念;這裡衡量的是從項目結果推得、特定系統的能力,不是對任何事物的預測。依照本頁自身對資料來源的概括——工具若共享輸入資料便會彼此相關,而非因為它們聲稱衡量相同構念——以基準測試作答矩陣為工具的衡量應與七種工具都不相關,然而尚無人做過這項比較,儘管特徵檔案與重要性矩陣都已發表。有兩項限制使它未列入正式清單:它蒐集的是任務重要性而非需求,因此分數只能比較,從未校準;而且完全未以任何已實現結果驗證
待解決的問題#
- 將區間編碼為中點會使曝險斜率偏向零;「全面上升的浪潮」有多少是真實現象,又有多少只是編碼產物?(報告以任務占比 ≥60% 的指標檢查穩健性,但數值本身仍來自自陳?)
- 回報曝險高於觀察曝險,部分原因是調查觸及大量使用者;在具代表性的樣本中,回報/觀察差距會是什麼樣子?進一步釐清:realized-consumption measurement (Borri-Liu-Tsyvinski) 新增一種市場隱含工具,依據 380T 個實際付費請求建立——但它偏向開發者/熟練使用者(OpenRouter 約占全球 token 的 2%),與調查偏向大量使用者的問題不同。教訓是:目前沒有任何 AI 曝險工具具備代表性;每種資料蒐集方式都有自身的偏差,因此回報/觀察/市場隱含曝險間的差距,部分是各種方法觸及哪些人所造成的產物。具代表性的普查仍是尚待達成的目標。Steele & Cruz 再次進一步釐清了母體問題:它同時比較七種工具——2,000 名 MTurk 受訪者(Felten)、由 GPT-4 評分(Eloundou)、提交 AI 專利的人(Webb)、依評分規準工作的 Crowdflower 工作者(Brynjolfsson)、由兩位研究者手動編碼的 70 種職業(Frey),以及 2025 年的 Claude/ChatGPT 使用者(Massenkoff;Steele & Cruz)。每種工具都偏向它所觸及的對象,而直接比較顯示其後果不是重新縮放就能修正的水準差異:工具產生不同的職業排名,曝險最高的職業清單幾乎毫無重疊,曝險與薪資梯度的符號也相反。第三次釐清,聚焦分母本身(2026-09-22):Google AI & Economy ATLAS: AI in Science (September 2026) 對同一個職業——科學家——同時執行遙測與自陳調查,並在附錄 3 中提出更棘手的版本:「英國或美國都沒有可靠的科學家母體抽樣框」,因此其 637 人樣本未加權,也未提供誤差範圍;作者並指出,樣本偏向對 AI 抱持熱忱的受訪者,是採用率與每週省下 6.9 小時可能被高估的原因之一。即使對出版、補助、職缺與專業組織資料都相當完善的職業,也找不到可供加權的母體框。因此,「具代表性的普查仍是尚待達成的目標」對這個目標太過樂觀:許多職業的代表性缺口不只是尚未測量,而是目前根本無法測量;遙測資料也好不到哪裡去,因為其中的科學家樣本是由分類器猜測使用者身分。
- 跨工具平均能減少誤差,還是只會混合互不相容的偏差?Steele & Cruz 的跨模型平均是一種多元化論點,而非經驗證的做法——這組工具沒有任何一種曾以實際勞動市場結果評分;而平均值表面上的穩定性,部分來自排除分歧最大的兩種工具(Massenkoff 因重複性而排除,Frey 因異常而排除)。可證偽的做法:用之後的職業層級就業與薪資變化,為七種工具及其平均值評分。複雜因素(2026-08-04):Indeed 的職缺資料顯示,單一工具的曝險與結果關係會在不同時間區間間改變符號(2022–2026 為負,2025–2026 為正),因此任何此類驗證都同時在評估時間區間與工具;評分期間必須事先指定,而不能事後挑選。部分解答(2026-09-22):Canaries in the Coal Mine? Six Facts about the Recent Employment Effects of Artificial Intelligence(
empirical,ADP 薪資微觀資料截至 2026 年 6 月)將這些工具中的六種——Eloundou 2024、Brynjolfsson 2018、Felten 2021 及其兩個 2023 變體、Tomlinson 2025——套用在同一項實際就業變化上,發現 22–25 歲、曝險最高五分位的就業率都下降10–13%。因此「平均值是否混合了互不相容的偏差」的答案,取決於分析如何使用資料:若分成五分位並觀察兩端,各工具幾乎可以互換;若逐職業排序,則無法互換。這並非提議中的檢驗——沒有任何工具互相評分,也未計算準確度統計;觀察期間為 2022 年 11 月至 2026 年 6 月,事後固定,而上文提到的複雜因素指出,這本身就是一項選擇。請見相關章節。已檢視,基本不適用(2026-09-22):Zhu(empirical)評估的是基準測試而非曝險工具的構念效度;唯一可延伸到這裡的一句話,是對分母的警告,而非答案——這些工具所假設的能力測試組合彼此近乎共線(單一因素占共同變異的 74.5%),而其主要軸線很大程度上是發布日期趨勢,因此「AI 能力」作為工具輸入會持續變動,且變動大多來自日曆時間。該論文將範圍限定於內部效度,也未以任何工具評估實際結果,因此上述可證偽檢驗並未受到觸及。 - 經驗梯度依賴工作者對 AI 無法做到什麼(判斷、關係型工作)的信念——這種信念可能反映持久的比較優勢,也可能只是下一個即將消失的能力差距。究竟是哪一種?會在何時發生?部分解答(2026-09-22),僅涉及前半部分:Canaries in the Coal Mine? Six Facts about the Recent Employment Effects of Artificial Intelligence 首次以結果衡量調查只以信念方式詢問的梯度。將明確知識/隱性知識指數套用到 ADP 薪資資料上(Codified vs Tacit Knowledge Exposure),截至 2026 年 6 月,在隱性知識占比高的職業中,資深工作者的就業成長更快;而依 Anthropic Economic Index 使用情況分類的互補效果係數,只有 41–49 歲(+0.024)與 50 歲以上(+0.015)為正且顯著;自動化係數則從 22–25 歲的 −0.098 單調縮小至 50 歲以上的 −0.006。這個信念目前看來是正確的:截至 2026 年年中,資深工作者受到互補,年輕工作者則遭到取代;控制教育程度後,隱性知識梯度仍然存在,但明確知識梯度已消失。「會在何時」這部分仍未觸及,而且正是整個問題的核心——四年的薪資資料無法區分這是持久的比較優勢,還是某種尚未消失的能力;論文自己的說法(「我們不對未來影響作出預測」)也選擇不試圖回答。仍標記為
#oq/wait;接下來應觀察的訊號是,資深工作者的隱性知識溢酬首次縮小而非擴大
資料來源#
- GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks — Patwardhan et al.(19 位作者,OpenAI),arXiv 2510.04374 v1,2025-10-05,29 頁(
empirical)。此處引用的是篩選方法而非結果:§2.1 與 Table 1(Q2-2024 GDP 占比超過 5% 的九個產業;每個產業薪資最高、以數位工作為主的五種職業)、§2.1 步驟 2 與 A.7(GPT-4o O*NET 數位任務分類器的 0.60 加權門檻、職業篩選數量從 831 → 761,以及缺失資料處理方式),以及 A.7.1(依 Acemoglu & Autor 2011 的五項任務內容分數進行驗證)。完整分析與 COI 請見 GDPval Benchmark - Anthropic Economic Index report: Cadences — Anthropic Economic Index report: Cadences(June 26, 2026),Chapter 3「Perceptions」:§AI and work tasks(Figures 3.2–3.4)
- Voice AI in Firms: A Natural Field Experiment on Automated Job Interviews — Brian Jabarian & Luca Henkel,Voice AI in Firms(arXiv 2607.28222,2026-07-30;
empirical,預先註冊的 RCT)。§3.1(錄取/到職/留任效果)、§3.2(生產力無顯著效果)、§4.1(25% 對 7% 的篩選淘汰差距)、§8(AI 篩選有幫助的適用條件)。此處引用為人際瓶頸假設的結果測量檢驗;解析警告與完整分析請見 Controlled Variance: AI's Edge as Reduced Dispersion。 - The Human-AI Substitution Principle: When will you be replaced by AI in your organization? — Banerjee & Singh,arXiv 2607.20781(2026-07-22;
practitioner-opinion,形式模型,沒有實證資料):§4.3.2 Theorem 9 + Corollary 3(μ*保護/脆弱性門檻,以及明確拒絕在缺少領域專屬參數時判定技能關係的做法)、§5.6 Table 3 prediction P5 與 §5.6.5(「反直覺地,高技能工作者可能更脆弱」的主張)、§3.4 Assumption 1(i)Δ$' ≤ Δ$。完整分析請見 Organizational Complements to AI - AI and Job Postings: From Destruction to Creation? — Guillermo Gallacher,AI and Job Postings: From Destruction to Creation?(Indeed Hiring Lab,2026-07-08;
empirical,職缺資料)。§「Are other occupations exposed to AI experiencing a similar rebound?」——2022 年 5 月 → 2026 年 5 月期間曝險與職缺刊登呈負相關,2025 年 5 月 → 2026 年 5 月期間則呈正相關;曝險衡量來源為 Hiring Lab 自家的 AI at Work Report 2025,並引用紐約聯準會的發現:AI 曝險職缺減少早於 ChatGPT。**COI:**Indeed 的研究部門分析 Indeed 自家的求職網站資料,並以部落格文章發布。**僅見於圖表,因此未在本知識庫任何位置引用:**兩張散佈圖的相關係數與 p 值(正文宣稱有統計顯著性,但兩者皆未提供),以及國際圖表中六個國家與各國占比(正文只將德國與法國列為例外)。完整證據說明請見 Firm AI-Spend Intensity and Headcount Growth。 - “We Must Act Now”: Sixteen Nobel Laureates Join Leading Economists and AI Researchers in Call to Prepare for AI’s Economic Transformation — Matty Smith,Stanford Digital Economy Lab 新聞稿,2026-07-13(
practitioner-opinion,558 字,沒有測量):200 多位連署者/16 位諾貝爾獎得主的人數、四位主辦者,以及 Spence 與 Cunningham 對不確定性的引述。本文只採用彙總人數——聲明全文與即時連署名單位於wemustactnow.ai,這是另一個尚未匯入的來源,且網站名單後來已大幅超過本文所報人數。此頁引用它作為精英觀點的特定日期紀錄,從不作為曝險證據 - Helping People Choose Careers in the Age of AI — Jennifer L. Steele & Isabella Cruz,Helping People Choose Careers in the Age of AI(arXiv 2607.15506,2026-07-16;American University / CU Boulder;
empirical)。§3 模型說明與 Table 1(七種工具);Table 2(原始分布);§4 與 Tables 3–4(依查詢建構);§4.4 與 Fig. 6(一致性);§5.1–5.2 與 Figs 7–8(薪資與複雜度梯度);Table 5(曝險最高的職業);§5.3 與 Fig. 10(RIASEC);§5.5 與 Figs 13–16(薪資 × 曝險象限);§5.6 與 Fig. 17(增強型與自動化型薪資)。**解析警告。**匯入時逐格驗證 Tables 1–4,解析乾淨,並直接引用。Table 5 發生欄位摺疊——六個模型名稱全併入第 1 列,第 2–6 列空白,職業欄維持正常;上方重現的對應關係取自 PDF,並非解析後的表格。Appendix Table A1 發生欄位摺疊且列位移(第 3 欄係數向下滑了一列),本頁未引用。來源內部矛盾:§4.3 正文所述範圍「15.8 到 29.8」與 Table 2 中相同衡量的最大值 49.8 矛盾;表格的算術正確,且經 PDF 驗證——本文的正文摘要統計應對照表格核查。 - Andrew Ng: The Biggest Opportunities in AI Aren't Where You Think — Andrew Ng 受訪於 Marina Mogilko,Silicon Valley Girl(2026-08-28,
practitioner-opinion):將 30–40% 任務數字歸於 Brynjolfsson 與 McAfee,但未提供論文來源;此處僅用來為分類法補上實務人士提出的數字 - Canaries in the Coal Mine? Six Facts about the Recent Employment Effects of Artificial Intelligence — Brynjolfsson、Chandar & Chen,Canaries in the Coal Mine?,Stanford Digital Economy Lab,2026 年 8 月修訂,140 頁(
empirical)。此處引用 §1.2 與 Online Appendix E(六種曝險衡量套用於同一薪資樣本,以及 Fig. E.1–E.5 的 10–13% 差距)、§2.5 與 Table 3(AEI 自動化/增強拆分的年齡差異),以及 §2.5 + Online Appendix J(明確知識/隱性知識指數)。工具限制請見 Stanford Digital Economy Lab;機制軸線的完整分析請見 Codified vs Tacit Knowledge Exposure。解析備註:table-collapse會在重複的面板表頭儲存格觸發(無害的跨列儲存格問題,已依pdftotext -layout核對);Table 2 確實發生列位移,知識庫內未引用該表 - Google AI & Economy ATLAS: AI in Science (September 2026) — AI in Science: Early Insights(Google、Google DeepMind、MIT FutureTech,2026 年 9 月,42 頁;
empirical,有廠商 COI)。此處只引用 Appendix 3 與 §6.1:缺少科學家母體抽樣框、未加權的非機率樣本,以及作者提出的選擇偏誤警語。完整分析請見 AI Adoption in Scientific Work - One Capability or Many? Testing the Economic Validity of Frontier AI Evaluation — Louis Yiven Zhu(Oxford Internet Institute,單一作者,未經同儕審查的預印本),One Capability or Many? Testing the Economic Validity of Frontier AI Evaluation,arXiv 2608.29420,2026-08-29,25 頁,
empirical。此處僅在平均值的待解問題中引用,且只涉及分母警語:§5.1(十二個基準測試中保留的單一因素占共同變異 74.5%)與 §5.2(該軸線與模型發布日期的 R-squared = 0.505)。論文評估的是基準測試,而非曝險工具,並將範圍限於內部效度——未涉及任何實際勞動市場結果。完整分析請見 Economic Benchmark Construct Validity
Cited by 30
- Anthropic Economic Index×5
The AEI publishes its task-level data, and by mid-2026 outside economists were building independent…
- Market-Priced AI Exposure (the AI Premium)×5
Its methodological significance for this vault: it is a third measurement paradigm for AI exposure.…
- Task Crossover×4
The most consequential claim, and it applies to nearly every number in Exposure Taxonomy. Observed,…
- Codified vs Tacit Knowledge Exposure×3
Every exposure instrument in Exposure Taxonomy answers how much of an occupation AI reaches. This…
- Firm AI-Spend Intensity and Headcount Growth×3
Exposure Taxonomy — the axis this paper adds: the taxonomy's four measures are all occupation-level…
- Open Questions Backlog×3
Exposure Taxonomy ×2 (oldest 89d) — Binned midpoint coding biases the exposure slopes toward zero;…
- Organizational Complements to AI×3
Weigh it accordingly. The 30–40% is a theoretical-exposure number (the share of tasks a model could…
- Stanford Digital Economy Lab×3
Exposure Taxonomy — the instruments the lab borrows for its exposure axis, and the elite-consensus…
- Telemetry vs. Survey Measurement×3
Two consequences for this page. First, the telemetry/survey split is not just a latency difference…
- AI Adoption in Scientific Work×2
The population is narrower than "PhD researchers": 76% STEM, the remainder medical and health…
- AI and Market Power×2
Because no official statistics capture GenAI use yet, the paper proxies potential GenAI use with a…
- Cognitive Capability Profiling for Task Suitability×2
Exposure Taxonomy — the eighth instrument, on a construct axis none of the seven use, and the first…
- Erik Brynjolfsson×2
Exposure Taxonomy — author of instrument #6 (SML 2018), one of the two whose exposure–salary…
- GDPval Benchmark×2
Two design choices that are easy to miss. The tasks were sourced by occupation wage mass, not by AI…
- Returns to Expertise in Agentic Coding×2
Exposure Taxonomy — the AEI Cadences survey confirms this from the worker's mouth: 15+-year workers…
- The Solo-Authorship Rebound×2
It is a field-level exposure ordering built from behavior, which is what Exposure Taxonomy finds…
- AI Usage Cadences
Exposure Taxonomy — cross-country and off-hours patterns foreshadow the GDP/occupation gradients…
- Andrew Ng
The job-apocalypse arithmetic. Citing Erik Brynjolfsson and Andrew McAfee's task decomposition:…
- The Automation–Optimism Link
Exposure Taxonomy — reported and anticipated exposure also rise with automation share; this page is…
- Controlled Variance: AI's Edge as Reduced Dispersion
Exposure Taxonomy — a direct experimental test of the interpersonal-bottleneck assumption baked…
- Conversation Artifacts
Exposure Taxonomy — artifacts are the output side of what "AI can do a task" means; complements the…
- Conversation-to-Delegation Shift
Exposure Taxonomy — the survey's belief-side measures, complementing this behavior-side shift
- Economic Benchmark Construct Validity
Exposure Taxonomy — the taxonomy of instruments whose denominator this audits. Every exposure…
- Experimental Learning Impact of Generative AI
Exposure Taxonomy — the belief half: like reported/anticipated exposure, students' perceptions of…
- Google AI & Economy ATLAS
Exposure Taxonomy — ATLAS supplies observed exposure from a second lab; its task-saturation measure…
- AI Economics & Labor
Exposure Taxonomy — Four distinct ways to measure AI's reach into an occupation — observed exposure…
- Task Saturation: Broad but Shallow AI Diffusion
Exposure Taxonomy — task saturation is a stricter observed exposure measure from a second lab; the…
- Task Time-Horizon Scaling
Exposure Taxonomy — theoretical exposure (what an LLM could do) is bounded above by this…
- The Tragedy of the Cognitive Commons
Exposure Taxonomy — the five vulnerability factors are an exposure measure on a different axis: not…
- Usage-Telemetry Classifier Validation
Exposure Taxonomy — every exposure measure is a classifier output; this quantifies the error bar…
Related articles
- Returns to Expertise in Agentic Coding
Anthropic's 400K-session study: domain expertise (not coding skill) is what amplifies an agent — experts get 2× the act…
- Organizational Complements to AI
The general-purpose-technology argument: AI productivity gains depend on complementary workflow, skill, and org-design…
- Task Saturation: Broad but Shallow AI Diffusion
Google ATLAS's marquee work finding — AI reaches 68% of detailed occupations (88.4% of US employment) but only 21% of t…
- Conversation-to-Delegation Shift
OpenAI's Codex usage study (June 2026): the move from conversational AI ('asking') to agentic AI ('delegated production…
- The Tragedy of the Cognitive Commons
Lovett (HRD Review, July 2026): professional expertise is a profession-level commons whose regeneration mechanism — ent…
