H
Howardism
Plate IIAI Economics & Labor機器翻譯 · machine-translated過時翻譯 · stale translationENHOWARDISM

市場定價的 AI 曝險(AI 溢價)

Borri-Liu-Tsyvinski:以 380T 個已實現 OpenRouter 使用 token 建構市場隱含的 AI 曝險——包括 AI Factor、滾動公司層級 AI Betas,以及集中於前沿/付費使用的每週 64 個基點多空溢價;隱含技能地圖與以任務為基礎的曝險衡量正交,而工具呼叫 token 升至 52%,則顯示代理式經濟正在成形。

Article metadata
Publication details
Published:July 16, 2026
Filed:Concept
Domain:AI Economics & Labor
Tags:GovernanceWorkforceMeasurementEconomicsAsset PricingEmpirical
Reading:18 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

市場定價的 AI 曝險(AI 溢價)插圖

資料來源#

摘要#

Borri, Liu & Tsyvinski(arXiv 2606.30583) 使用 380 兆個已實現 AI 使用 token——2024 年 1 月至 2026 年 4 月期間,透過授權 OpenRouter 樣本面板路由、涵蓋 400 多種 LLM 的每一筆付費推論請求,約占全球每月 token 用量的 2%——為股市中的 AI 曝險定價。研究流程是:建立 AI Factor(全球 AI 使用成長的高頻指數)、估算各公司的 AI Beta(公司報酬與該因子的共同變動程度),再衡量 AI Premium(市場為這種敏感度支付多少溢價)。核心發現是:高 AI beta 公司往後的報酬較高——按價值加權的多空五分位策略每週獲利 64.1 個基點——而且溢價集中在 AI 使用的密集、面向前沿部分。映射到勞動力後,市場隱含的曝險對互動/溝通/實作技能呈正向,對分析/科學/營運控制技能呈負向,與「AI 自動化動手工作、保留知識工作」這種直覺說法正好相反。

對這個知識庫而言,方法上的意義在於:這是衡量 AI 曝險的第三種測量典範。AEI 分類法以調查(自陳/預期)與使用遙測(實際觀察)衡量曝險;以任務為基礎的衡量方式(Acemoglu-Restrepo、Eloundou GPT-4、Eisfeldt-Schubert-Zhang)則根據LLM 理論上能做什麼來衡量;這篇研究則從市場隱含風險衡量——也就是股價揭示投資人如何看待公司的 AI 贏家與輸家。它著眼未來且反映在價格中,而非能力分數。

證據註記。 empirical——使用已實現的付費請求(不是自陳,也不是分類器推斷),以數百萬匿名帳戶構成使用者-模型-日層級面板,並採用標準資產定價工具(Fama-French 五因子加動能調整、Fama-MacBeth、區塊自助法、事件研究)。但樣本並不具代表性,作者也明言如此:OpenRouter「可能過度代表精通技術的使用者與開發者」,而開放權重/角色扮演/程式設計流量相對於該聚合平台的利基市場而言比例偏高。因此,這項溢價反映的是市場對這個偏向開發者的已實現使用切片的定價,觀察期間則是擴散初期、快速變動的階段——應解讀為「目前的 AI 曝險價格」,而非長期估計。代表性限制詳見下文。

測量創新:跨供應商的已實現使用量#

這份底層資料與知識庫內其他使用遙測來源的差異如下:

  • 已實際發生,而非自陳。 每筆觀察都是付費請求,附有自己的 token 數量與美元成本——沒有調查、沒有自陳,也沒有用逐字稿分類器推斷意圖。
  • 跨供應商,而非單一實驗室。 樣本面板涵蓋 OpenAI、Anthropic、Google、Meta、DeepSeek、Qwen、Hermes 及 400 多種模型;平均每個帳戶使用 5 種以上不同模型,十分之七使用 至少 2 家供應商。使用量「不太可能反映任何單一供應商的產品週期」。作者明確將此與 AEI 對照;AEI「只對單一供應商約一百萬段 Claude 對話分類」——這是刻意在廣度與代表性之間取捨(詳見限制)。
  • 使用者-模型-日的資料粒度讓作者能依照攸關定價的面向拆分使用量:閉源與開放權重、付費/核心與新手、資深與隨興、長提示與短提示、內容類別,以及代理式(呼叫工具)與一般使用。

AI Factor 是三個序列標準化週度對數成長率的第一主成分——總 token 數、支出金額,以及不重複的活躍使用者數(PC1 負荷量為 0.665/0.559/0.496,共同變異數占 56.5%)。採用成長率而非水準值,是因為報酬會回應採用過程中的意外成分,而非機械式上升趨勢。每週 token 數從第一週的 114 億,升至最後一週的 15.6 兆(累計 380.8T)。

AI Premium:AI 曝險有市場定價#

公司 AI Beta 是以週度超額報酬對數值為應變數、AI Factor 為解釋變數並控制市場因素的滾動 13 週迴歸;每週重新估計,不使用未來資訊。公司每週依 AI Beta 排成五分位。

  • 投資組合排序:按價值加權的高減低利差為每週 64.1 個基點(t=2.84);Fama-French 五因子調整後為 56.3 個基點(t=2.43),再納入動能後為 55.9 個基點。等權重利差較小但仍為正(35.0/30.9 個基點),所以並非只是少數大型股帶動。
  • Fama-MacBeth 橫斷面迴歸證實,控制規模、價值、獲利能力、投資、動能、反轉、槓桿與應計項目後,AI 風險仍有正的價格(要求最高的規格中,價值加權 β_AI 係數為 18.25,t=3.58)。
  • 這個方向符合轉型風險管道(Pastor-Veronesi 2009):技術革命會重新分配公司/產業/資本世代/勞工之間的租值;當這種重新分配具系統性時,風險趨避的投資人會要求補償,才願意持有曝險最高的公司。這項溢價是對風險的定價,不是白撿的好處。

**公司層級曝險並非科技產業虛擬變數。**S&P 500 中曝險最正面的公司包括 AppLovin(排名第一)、NVIDIA、Lumentum、Expedia,以及能源公司 NRG Energy;曝險最負面的公司則包括 Moderna(排名末位)、Estée Lauder,以及值得注意的 AMD 和 ON Semiconductor。有些半導體公司呈現負向負荷量,因此這確實是在衡量與已實現使用量的共同變動,而非「是不是晶片股」分類器。

溢價集中之處:密集使用與前沿應用#

八種拆分因子的排序結果都指向同一結論——有定價的 AI 使用部分,正是更成熟複雜的部分:

面向高曝險一側低曝險一側
模型類別閉源 53.4開放權重 32.3
使用者資歷付費/核心 66.8新手 21.9
使用者經驗資深 59.3非資深 29.3
提示複雜度長 54.1短 33.0

(每週基點,按價值加權的高減低。)隨興使用與開放權重使用沒有被定價。「重要的是密集使用」這個模式,是資產定價對專業知識報酬與委派轉變的呼應——有資訊價值的訊號是使用深度,而非採用廣度。

地理差異——在接近前沿的市場有定價,遠離前沿則沒有。已開發市場的利差為每週 17.9 個基點(t=2.77);新興市場僅 5.0 個基點(t=0.94,不顯著)。中國 A 股即使採用根據中國大陸 OpenRouter 使用量建構的中國專屬 AI 因子,利差仍為負值且不顯著。作者以 Acemoglu-Aghion-Zilibotti 的「與前沿的距離」解讀此結果:只有在上市公司與投資人接近尖端 AI 開發和部署的地方,AI 風險才具系統性,因而獲得定價。這也呼應互補要素論點:只有在互補的 AI 經濟已存在之處,曝險才有定價。

不只是科技股上漲或 AI 熱潮#

這項溢價經得起顯而易見的質疑:「你們只是把 AI 股票漲勢重新包裝而已。」在市場控制項中分別加入三種交易基準、重新估計 AI Beta 後,利差仍在:控制高科技產業報酬後為 49.5 個基點,控制半導體投資組合後為 45.4 個基點,控制 AI/機器人 ETF 籃子後為 63.4 個基點。以 Fama-French 30 產業去平均後為 60.3 個基點,控制 Google Trends「Artificial intelligence」關注度後為 69.6 個基點。這項溢價為已實現使用量的曝險定價,而非科技產業成員身分或 AI 主題情緒。

針對 19 次前沿模型發布(Anthropic、DeepSeek、Google、Meta、OpenAI)的事件研究顯示,高 beta 公司在觀察窗口內的累積報酬比低 beta 公司高約 3%(五天內高 1.9%,t=4.17;風險調整後為 1.1%),事前可見報酬漂移,發布約五天後則趨於平穩;相較之下,非前沿模型發布僅約 1.5%。但完全排除前沿模型發布週後,每週利差仍有 0.395%(t=1.96):發布前後的溢價較強,但它會在整個樣本期間逐步累積,而非只出現在新聞日期——這說明它是有定價的風險,不只是連續的正面意外。

市場隱含的技能地圖:互動技能受益,分析技能受損#

將公司層級 AI Betas 投射至職業(依 BLS 就業人數加權)與技能(依 O*NET 評級),得到第一張市場定價的 AI 曝險地圖——可解讀為「假設 AI 成功,市場預期哪些技能受益最多、哪些受損最多」。差異十分鮮明;作者指出,這個結果在 Autor-Levy-Murnane、Acemoglu-Autor 和 Deming 分類法下都很穩健:

  • **曝險為正(預期受益/互補):**非常規的互動內容(+0.15,t=2.87)、社交技能(+0.16,t=3.44),以及——負荷量最高的一項——互動與溝通(+0.36,t=4.21)。此外還有安裝/維修、程式設計、說服、教學,以及非常規的體力工作(+0.25)。互動與溝通內容高出一個標準差的職業,其市場隱含 AI 曝險也高出 0.36 個標準差。
  • **曝險為負(預期受損/被取代):**非常規的分析/數學內容(−0.15,t=−3.41)、資訊運用(−0.29,t=−2.43)、演繹/歸納推理(−0.27)、例行性體力工作(−0.41),以及營運控制技能。在詳細技能排名中,科學是曝險最負面的單一技能(每週報酬反應 −0.021),遠低於營運監控、品質控制,以及操作與控制。

反直覺的結論是:市場對互動、說服、實作、重視協調的工作給予正向 AI 曝險定價,對分析與科學工作則給予負向定價——正好和「AI 會先自動化體力勞動、最後才影響認知工作」這種直覺假設相反。作者將曝險為正的技能(互動、說服、教學、安裝/維修)連結到 Jones & Tonetti 的「弱連結」——即使多數其他工作已自動化,仍會限制生產流程的慢速自動化任務。這與調查/使用研究結果一致:資深工作者指出,判斷力與人際關係工作是 AI 難以取代的部分;在這裡,它呈現為市場押注,而非自我陳述。

關鍵的是,這張地圖與先前的 AI 曝險衡量彼此正交:它與 Felten AIOE、Eloundou GPT-4、Webb 專利,以及 Eisfeldt-Schubert-Zhang 衡量值的相關性絕對值都低於 0.08,既有衡量值也沒有任何一項能解釋超過市場隱含變異的 2%(GPT-4 衡量值呈微弱正相關,而生成式 AI 出現前的 Webb 專利衡量值則顯著負相關)。市場隱含曝險衡量的是自動化可能性分數所沒有捕捉到的資訊。

代理式經濟的早期證據#

將完成原因為 tool_calls 的請求定義為代理式請求後,代理式請求的 token 占比從 2024 年接近零,上升至最後一個完整週的 52.2%(峰值 59.3%)——這是跨供應商、名副其實的急速上升曲線,並從任何單一實驗室之外,印證了從詢問轉向執行的轉變。工具呼叫與快取讀取的占比各自達到 token 數的約 40–50%;推理 token 則上升較慢。代理式使用的美元占比落後於 token 占比,因為實際的代理式 token 單價正在下降——提示快取能提供前綴 token 而不必重新計算,供應商也會將代理式請求路由至較便宜的底層模型(符合企業管理「AI token 預算暴增」的情形)。代理式因子的橫斷面定價點估計為正(每週約 0.3–0.5%),但精確度不足(樣本期間短);作者稱之為「代理式溢價為正的早期證據」。

代表性限制#

作者明確提出、引用此資料時應一併保留的關鍵限制:OpenRouter 是利基型聚合平台,使用者偏向開發者、開放權重實驗者,以及角色扮演/程式設計流量——它約占全球 token 數的 2%,而且「可能過度代表精通技術的使用者與開發者」。因此,「380T 個已實現使用 token」不是 AI 使用情況的代表性普查,而是一個規模龐大但偏向開發者的切片。這會帶來兩個影響:(1)溢價反映市場對該切片的定價,觀察期間是擴散初期(「目前的價格」,而非長期價格);(2)作為一種測量典範,依已實現使用量衡量的曝險,面臨的不具代表性問題,與AEI 調查的重度使用者偏差或單一供應商遙測不同——兩者都有偏差,只是方向不同。目前沒有任何 AI 曝險工具具代表性;各種工具都受到其資料蒐集方式影響而產生偏差。這讓測量問題更加明確,卻尚未解決問題。

相關連結#

  • Task Saturation: Broad but Shallow AI Diffusion — 本文技能地圖在使用面向的對照研究:ATLAS 發現,體力工作(占使用量 5%,但占任務 28%)與人際工作(9%,相較於 22%)都明顯代表不足,而非例行性認知分析工作占互動的 65%——與 AI Factor 定價時呈現相同的人際與分析工作落差,只是此處根據對話紀錄,而非股市報酬

  • The Household Production Boundary — 資產定價工具在結構上看不見的價值:86.5% 的對話式 AI 使用落在生產邊界的無酬一側,市場沒有營收項目可將其資本化

  • Exposure Taxonomy: Observed, Theoretical, Reported, Anticipated — 主要的方法論相關研究:這是和 AEI 的觀察/理論/自陳/預期四種衡量方式採不同面向的第五種市場隱含衡量方式——將已實現使用量與股價風險定價結合,著眼未來且反映在價格中,而非估算能力。它沒有填補「代表性樣本」的缺口,而是重新界定缺口(每種工具都有不同偏差)。該頁現在也納入 Steele & Cruz 的七種工具正面比較,讓本文的正交性結果有了新的脈絡:以任務為基礎的衡量方式彼此也很少一致,因此低於 2% 的變異數發現反映的是整個領域的分歧,而非市場衡量方式的缺陷

  • Telemetry vs. Survey Measurement — 已實現付費請求是最純粹的遙測(行為,而非感受),先擴展至跨供應商廣度,再轉化為市場定價訊號;這是「衡量真實系統,而非代理指標」主題中從金融面切入的一篇

  • Conversation-to-Delegation Shift — 代理式 token 急升曲線(0→52%)是跨供應商的獨立證據,印證 Codex 內部的委派轉變;此處的「密集使用,而非廣泛採用」定價,也呼應該頁的「看輸出 token,而非使用者人數」

  • Returns to Expertise in Agentic Coding — 溢價集中在資深/付費/核心使用者與長提示,而技能地圖則偏好互動/人際工作;兩者都是資產定價對「重要的是理解深度,而非採用廣度」以及專家指出人際判斷力是剩餘價值的呼應

  • AI Investment Story, Not Efficiency Story — 市場定價方面的互補觀點:AI Premium 指出股市確實正向地為 AI 曝險定價(視為轉型風險/成長選擇權押注),符合「AI 正處於投資階段」的說法——溢價代表投資人因持有重新分配風險而要求補償,並非已實現效率提升的證據

  • Organizational Complements to AI — 已開發與新興市場(以及中國缺席)之間的結果反映距離前沿的差異:只有在互補的 AI 經濟已存在之處,AI 風險才具系統性並有市場定價

  • AI Usage Cadences — 使用遙測測量系列中的另一項研究;OpenRouter 的已實現樣本面板是觀察擴散的第二種高頻工具(本文以週為單位,另一篇則以小時為單位)

  • Anthropic Economic Index — 這篇論文明確拿來對照的單一供應商使用遙測計畫(廣度與代表性之間的取捨)

  • AI and Market Power — 與本文有定價的預期相對應的會計面研究:法國與葡萄牙的行政資料顯示,2011–2022 年間使用 AI 的公司沒有加價率優勢,市場占有率排名也沒有上升;與此同時,股市每週為 AI 曝險支付 64.1 個基點。兩者並不矛盾——資產價格將預期未來租值資本化,而加價率衡量的是已實現價格高於邊際成本的幅度,兩者涵蓋的母體幾乎沒有重疊。兩項研究真正顯著的一致處在於與前沿的距離:AI 溢價在已開發市場有定價,在新興市場則沒有;OECD 發現加價率溢價只存在於 ICT。兩種工具都指出,目前可衡量的 AI 租值集中在 AI 本身就是產品的地方

待解決的問題#

  • **這項溢價是持久的風險價格,還是擴散初期的假象?**作者指出樣本期間短、變化快速,並稱之為「目前的 AI 曝險價格」。隨著 AI 擴散成熟,轉型風險溢價會持續、縮小,還是反轉?
  • **開發者偏差對結果影響有多大?**OpenRouter 的資料切片不具代表性;如果有具代表性的已實現使用量面板,市場會為相同公司與技能定價嗎?還是前沿/密集使用的集中現象,有一部分只是使用 OpenRouter 者的抽樣偏差?
  • 為什麼市場隱含技能地圖與每一種以任務為基礎的衡量方式都正交(變異數低於 2%)?市場隱含曝險是否捕捉到真正不同的資訊(前瞻性租值、互補/替代的價值,而非技術上的自動化可能性),還是它的雜訊比較大?勞動影響預測該信任哪一種?部分已有答案:Steele & Cruz 對七種工具進行正面比較(詳見Exposure Taxonomy: Observed, Theoretical, Reported, Anticipated),移除了原先令人以為這是項控訴的框架——以任務為基礎的衡量方式彼此之間也大多正交。只有兩組配對呈現高度相關,而且都共用同一資料來源(兩種 Anthropic 使用量工具之間的相關係數 ρ=0.89;接著是 GPT-4 評分與 MTurk 評分的理論能力工具)。Webb 的專利衡量方式、Brynjolfsson 的 ML 評分準則,以及 Frey 的瓶頸模型彼此「幾乎沒有對應關係,與後來的衡量方式也幾乎沒有對應關係」;曝險-薪資梯度則在較早與較新的工具之間反轉。因此,與以任務為基礎的衡量方式不相關,並非雜訊的證據——根本沒有一個一致的群組可讓它與之不相關。問題後半仍未解答,而且現在更難回答:兩個陣營中都沒有任何工具以已實現的勞動市場結果進行評分,所以「預測該信任哪種工具」目前沒有實證答案。2026-09-22 補充的同一問題之能力面向脈絡:Zhu(empirical,單一作者、未經同儕審查的預印本)針對曝險衡量工具隱含假設的基準測試,進行首次建構效度稽核;稽核範圍是雜湊固定、使用單一 harness 的排行榜快照,涵蓋 421 種模型設定下的十二項基準,結果呈現曝險衡量圖景的鏡像:非對角線 Spearman rho 平均值為 0.79,所有配對皆為正相關;單一保留因子占共同變異數的 74.5%;十二項基準中有十項屬於同一相關群集;而這個單一軸與模型發布日期的 R-squared = 0.505。因此,能力衡量幾乎是一維的,而曝險衡量彼此正交。本頁呈現的正交性不是來自能力前沿本身確實具有多維特性;它是在能力映射至任務、職業與價格的某個環節中產生的,解釋就該從那裡尋找。這項推論有兩個界限:這些是基準分數,而非曝險工具;而且論文明確限定自身研究範圍為內部效度,採用、營收及任何已實現經濟結果都不在研究範圍內,因此它沒有補上本問題後半所需的工具對結果驗證。
  • **代理式溢價目前只是「早期證據」(精確度不足)。**在更長的樣本期間下,代理式溢價為正的結果能否持續?即使 token 數量暴增,每個代理式 token 的價格下降(快取加上路由至便宜模型)會侵蝕美元面訊號嗎?
  • **「科學最負面/互動最正面」的結果能否在樣本外成立?**這項發現違反 AI 最後才會自動化認知工作的直覺;市場是判斷正確,還是在為短暫的市場敘事定價?

資料來源#

  • One Capability or Many? Testing the Economic Validity of Frontier AI Evaluation — Louis Yiven Zhu(Oxford Internet Institute,單一作者,未經同儕審查的預印本),arXiv 2608.29420,2026-08-29,empirical。本文僅在第三個未解問題的補註中引用:§3(單一 harness 的十二項基準網格中,非對角線 Spearman rho 平均值 = 0.79)、§5.1(單一保留因子占共同變異數的 74.5%)、§5.2(發布日期的 R-squared = 0.505)、附錄 K(十二項基準中有十項歸為同一群集),以及 §3 明確說明的研究範圍限制。本文的資產定價與技能地圖結果都未因此改變。完整討論見 Economic Benchmark Construct Validity。
  • Helping People Choose Careers in the Age of AI — Steele & Cruz,arXiv 2607.15506(2026-07-16),empirical。本文僅引用 §4.4 與圖 6(七種曝險工具之間的對應關係),用來補充說明本文的正交性結果。表格解析警告與來源內部矛盾,均記錄在 Exposure Taxonomy: Observed, Theoretical, Reported, Anticipated。
  • AI Premium — Nicola Borri、Yukun Liu 與 Aleh Tsyvinski,AI Premium(arXiv 2606.30583,2026-06-29;empirical)。§1 緒論(四個部分與文獻);§2 資料(OpenRouter 面板、AI Factor 建構);§3 AI Premium(投資組合排序表 2–3、Fama-MacBeth 表 4、穩健性表 5、國際比較表 6、顯著成分拆分表 7、事件研究表 8 與圖 2、公司層級圖 3);§4 職業/任務/技能(表 9–10、技能地圖圖 4);§5 代理式 AI 使用量的崛起(圖 5–7、表 11)
§ end
Cited by 17
Related articles