資料來源#
- 5 takeaways from the State of Software Delivery Q2 Pulse report
- Adoption Telemetry: Measuring Enterprise AI Adoption from Production Signals
- AI accelerates output, not innovation
- AI and Job Postings: From Destruction to Creation?
- AI Engineering Report 2026: The Acceleration Whiplash
- AI-Augmented Human Resource Management? Insights from German companies
- AI-to-AI Code Reviews of GitHub Pull Requests
- From Agent Behaviour to Agent-Friendly Documentation
- Helping People Choose Careers in the Age of AI
- Normative boundaries of AI in scientific work: Evidence from PhD researchers
- Ramp's latest data on China vs. the American AI Labs
- September 2026 Ramp AI Index: Cracks in the AI thesis, part 2
- State of AI in the SOC 2026: 8 Key Takeaways
- The State of AI Impact in Engineering: Q2 2026
- The state of AI in 2026: On the road to ROI
- Voice AI in Firms: A Natural Field Experiment on Automated Job Interviews
摘要#
Faros AI 的方法論主張,也是其 2026 年報告中最具影響力爭議的基礎:在 AI 快速轉型期間,認知落後於現實,因此以問卷為基礎的工程研究,系統性地漏掉了系統遙測近乎即時捕捉到的下游損害。Faros 的研究結果來自工程系統(任務追蹤器、IDE、靜態分析、CI/CD、版本控制、事件管理),而不是開發者的感受,並據此直接反駁 Google 的 DORA 2025 結論。
vendor-claim來源——Faros 自家的平台本身就是遙測工具,因此「遙測勝過問卷」也是替該平台推銷的論點。方法論上的觀點本身仍然成立,但這個結論恰好有利於供應商的產品。完整證據說明請見 Acceleration Whiplash。
為什麼認知落後於現實#
Faros 提出的機制是:在個人層級,開發者確實更有生產力——任務完成量增加、程式碼流動更快、工具感覺很強大——因此**問卷捕捉到真實而正面的感受。**問卷無法捕捉的是下游發生的事:「審查佇列悄悄堆積、正式環境中的事件不斷增加、錯誤一路傳到客戶手上。」等到這些後果反映在人們的感受上時,「幾個月已經過去,訊號也早已過時。」來自實際工作系統的遙測不會落後。其主張是:工程主管在做出影響重大的員額、工具與流程決策時,「需要盡可能接近即時的資料……而不是事後詢問人們對工作的感受。」
DORA 的矛盾#
這是已標記的來源間矛盾。DORA 的 2025 State of AI-Assisted Software Development 得出結論:AI 會放大既有優勢與弱點,而且**穩健的工程基礎能抵禦 AI 帶來的負面影響。**Faros 聲稱,其遙測「不支持這是保護因素」:高績效組織和其他組織一樣,都經歷同樣的下游惡化(請見 Acceleration Whiplash 中成熟度與否無關的發現)。
從方法與誘因來衡量這項衝突:
- DORA 2025——以問卷為基礎;規模大、持續時間長,而且大致不受供應商影響(Google/DevOps Research)。優點:涵蓋面廣且持續追蹤。缺點(依 Faros 所言):快速轉型期間的認知延遲。
- Faros 2026——以遙測為基礎;公司內縱向比較(低採用率與高採用率季度),Spearman ρ,p<0.05。優點:近乎即時地測量行為,而非感受。缺點:
vendor-claim——Faros 銷售這個平台,而「成熟的做法救不了你,你需要可見性和情境引擎」正是能擴大其市場的結論。
兩者都不能算是明確勝出。坦白來說:Faros 對問卷測量的批評有道理(認知落後確實存在),但其成熟度完全沒有保護作用的實質主張,應該連同供應商的誘因一起看待——這是最有利於銷售測量工具的結論。值得持續追蹤後續 DORA 版本和任何非供應商的遙測研究。
家族效應:測量工具與其資料來源一致,而不是與其構念一致#
這個頁面的二分法確實是一條真實分界線,而非只是修辭手法;最有力的證據來自工程指標之外。Steele & Cruz (arXiv 2607.15506) 將七種職業 AI 暴露度測量工具套用於相同的 O*NET 職業,並兩兩計算相關性。七種工具都聲稱測量同一件事。能預測兩種工具是否一致的因素,是它們根據哪一種資料來源建構:
- 兩種以 2025 年 Anthropic Claude 使用情況建構的工具,相關係數為 ρ = 0.89。
- 兩種根據理論上的生成式 AI 能力(GPT-4 任務評分;2,000 份 MTurk 能力評分)建構的工具,是其次一致的一組——儘管兩者的分析層級、評分者和提問內容都不同。
- 跨家族的對應關係大幅崩解;專利探勘、ML 評分規準和瓶頸型工具「彼此之間,以及與後來的測量結果之間,幾乎沒有對應關係」。
這對本頁有兩項影響。第一,遙測與問卷的差異不只是延遲(現在的行為與稍後的感受)——它們將答案空間劃分成不同區塊。不同家族的工具不會產生相同排名;而在 Steele & Cruz 的研究中,它們對暴露度與薪資梯度甚至得出相反的方向。第二,這篇論文是知識庫中第一個把遙測向前推展成預測,而不是回報觀察計數的案例:用查詢量的二十分位數為任務排序,再以手動設定的假定自動化上限決定其程度。這是一種混合方式——排序依據遙測、數值大小依賴假設——它保留了排名的可信度,卻沒有讓可信度延伸到數字上。完整對照請見 Exposure Taxonomy: Observed, Theoretical, Reported, Anticipated。
第三種工具:隨機化,以及遙測與問卷都做不到的一件事#
本頁的二分法少了一個第三項。遙測與問卷都屬於觀察性測量——一種記錄已發生的行為,另一種記錄人們的感受。兩者都無法說明其他情況下會發生什麼,而這正是本頁每項主張最終都在探問的問題。隨機實驗可以回答這個問題;Jabarian & Henkel (arXiv 2607.28222) 是知識庫中最乾淨的例子:67,056 名求職者隨機分配給 AI 語音面試官或真人招募人員,事前註冊,並追蹤行政就業結果。
這篇研究在此特別有用,因為它針對同一事件使用三種測量工具,而三者得出的方向各不相同:
| 測量工具 | 對 AI 執行面試的觀察 |
|---|---|
| 行政紀錄(錄取通知、到職、留任) | 由 AI 面試的求職者收到的錄取通知多 12%、較常到職,且留任率也較高(皆 p<0.001) |
| 求職者問卷(面試後 CX 問卷) | AI 面試被評為明顯較不自然(p=0.014),使綜合感知品質指標偏向真人面試(p=0.076) |
| 專家預測(揭露結果前的招募人員問卷) | 61% 的招募人員預期 AI 主導的面試品質會較低;36% 預期錄取率較低;48% 預期留任率較低 |
預測就是錯了——131 名資深從業者在結果揭曉前接受問卷調查,卻預測了相反的方向。求職者問卷並沒有錯;它測量的是一項真實而不同的事情(自然程度),而這與結果並不一致。行政紀錄是我們知道兩者差異的唯一原因。
這對本頁有兩項影響。第一,本頁建立在「感受與系統」之分上,但這只是更大問題中的一個特例:不論延遲多短,觀察性測量都只是在主張相關性。這也解釋了為什麼 CMU 對 250 萬個 PR 的遙測研究 能從相同追蹤資料得出相反結論。隨機化是比兩者更高一階的工具,而不是處在同一層級的第三種風味。第二,這一階的實際成本不低:研究需要企業合作、IRB、事前註冊,以及三個月的實際招募流程,才能回答一個勞動市場中某項任務的一個問題。遙測和問卷成本低、涵蓋面廣;真正能辨識效果的工具成本高、範圍窄,這正是知識庫有數百項前者、卻只有一項後者的原因。
問卷方法的具體例子:只有提問才能看見的事,以及它的代價#
以上內容都在論述問卷的不足。Kalff & Simbeck 對德國人資部門所做的 N=410 研究(arXiv 2607.13839,empirical)是這場對照中最直白的問卷案例——對單一業務職能進行自陳式採用普查,作者也將「以自陳問卷資料作為量化測量的依據」列為自身限制之一。它在此有用的理由,與本頁其他部分相反:它包含知識庫中最清楚的遙測無法看見的事例,以及最清楚的提問代價。
只有問卷才能測量的事。在 410 名有效受訪者中,183 人表示他們會非正式地使用 AI 工具,並以個人裝置操作,不受雇主政策或公司提供系統的限制——當中也包含官方政策限制或禁止使用生成式 AI 的公司。論文本身劃出了這條界線:「需要複雜公司專屬資料的 AI 解決方案無法非正式使用,因為只有透過正式導入才能存取。」因此,企業遙測看到的,正好只有經過 IT 部門的那一半採用情況,並且按其設計,對規模大約相當的另一個管道視而不見。這是 CircleCI 觀測孔徑問題的極端案例——工具的涵蓋範圍取決於供應商產品觸及之處,而影子採用不會接觸企業營運的任何系統。在這個問題上,兩者的先後次序顛倒了:問卷不是落後的工具,而是唯一的工具。
而提問的代價,也以一種異常清楚的形式呈現。同一篇論文記錄了自身的構念崩解。小組討論「經常演變成對 AI 意義的辯論」;參與者的觀感「深受媒體熱門生成式 AI 應用影響」,因此「有些參與者不認為支撐傳統人資分析的機器學習系統——例如用來測量離職風險或辨識人力趨勢的系統——算是『真正的 AI』。」這不只是一般的測量雜訊,因為它具有方向性,而且正好指向論文自己的標題式結論:論文認為預測分析只扮演次要角色,而受訪者最不可能算作 AI 的工具,恰好就是那些預測型 ML 工具。以授權或支出為基礎的測量工具(Ramp 的付款追蹤)沒有這種問題——它計算的是已部署的東西,而不是人們稱作 AI 的東西。
更糟的是,這種模糊不只是模糊,而是受到利害關係人從兩個方向爭奪:供應商「利用 AI 品牌形象引發關注,並支持商業論述」,同時「人資工具中的 AI 成分可能被淡化,以避免共同決策機構審查」。當標籤對回答問題的人來說是一種策略工具,再怎麼措辭都無法還原該構念——這是第三種失效模式,與認知延遲(本頁最初的論點)和家族效應(測量工具與資料來源一致)各不相同。認知延遲表示受訪者回報的是過時事實;家族效應表示測量工具對穩定構念的意見不一;這種情況則表示,在測量期間,受訪者本身正在改變構念。
支付軌道:平台紀錄家族新增第二個成員,也是問卷與行為首次一致的案例#
下文的「關聯」條目將 Indeed 的職缺刊登列為第四種測量工具家族——平台在促成交易時產生的副產品紀錄,既非遙測、問卷,也非隨機化。Ramp 每月發布的 AI Index(empirical)是該家族的第二個成員。將兩者並列,能更清楚看出這個家族的特點:**誰營運交易軌道,誰就能免費、近乎即時地計算所有經過該軌道的事物,而且只涵蓋在其上進行交易的族群。**Indeed 促成職缺刊登,因此可以計算勞動需求;Ramp 促成企業付款,因此可以計算企業付費使用哪些 AI。兩者都由平台營運者自己的研究部門發布,因此和本頁的 Faros 條目一樣,將供應商誘因與測量工具結合在同一方手中。
在這裡,觀測孔徑會產生可驗證的影響。Ramp 的 2026 年 6 月供應商市占資料顯示,OpenAI 佔企業的 39.5%,Anthropic 佔 42.4%,而Google 佔 6.4%、Microsoft 佔 1.7%;42 個月的完整資料序列中,Google 一直維持在 4.6–6.4% 的區間,同期整體 AI 採用率則從 7.5% 升至 55.0%。最可能的解讀不是 Microsoft 和 Google 失去企業市場,而是企業協議、協商發票和雲端承諾支出的提領,不會像按使用者席次或 API 訂閱那樣經過企業信用卡軌道。這是支付版的 CircleCI 觀測孔徑問題:測量工具涵蓋的是符合其交易軌道的購買行為;若供應商的銷售方式繞過這條軌道,不論其實際市占多少,都會在結構上被低估。
**而本頁之前還沒有的例子是:問卷與行為測量工具彼此一致。**上文的家族效應預測測量工具會追隨其資料來源,而非其構念;本頁大多數案例都是彼此意見不一。但在這裡,來自不同家族、涵蓋不同族群的兩種工具,在同一個六個月期間,對相同的次序變化得出一致結果:ICONIQ 的 2026 年第二季主管問卷 涵蓋約 305 家打造 AI 軟體的公司,顯示 Anthropic 的受訪者占比從 51% 升至 81%,並超越 OpenAI(77% 降至 71%);Ramp 的付款紀錄則顯示,Anthropic 在 2026 年 5 月超越 OpenAI(截至 6 月為 42.4% 對 39.5%),同期 OpenAI 也從 2025 年 11 月的高點下跌約 1.9 個百分點。自陳與付款紀錄、產品建構者族群與整體信用卡持有人,方向相同,時間也大致一致。跨家族趨同單獨來看是薄弱證據,在此卻是有力證據,恰恰因為本頁的預設預期是兩者不會一致——這也是知識庫中最清楚的案例,顯示測量工具問題透過「一致」獲得解決,而不是由人來裁定。
這種趨同延續到下一版,而交易軌道也顯示第二種觀測孔徑(2026 年 9 月)。Ramp 9 月 9 日的信函 顯示,2026 年 8 月 Anthropic 佔企業的 43.8%,高於 OpenAI 的 39.8%——支付軌道的領先幅度由 2.9 個百分點擴大到 4.0 個百分點,整體付費採用率則達 56.1%——因此兩種測量工具家族一致觀察到的次序變化,在付款紀錄方面也不是單月現象。這個版本還揭露了該工具的一項特性,值得在此提及,因為這是時間上的孔徑,而非涵蓋範圍上的孔徑:Ramp 的金額與筆數序列在初次發布後數月內會向上修正(信函將前 1% 員工人均支出從約 $7.4K 改述為約 $8.0K;6 月人均支出中位數在 7 月版為 $10.59,在此版則為 $10.94),而供應商二元市占序列幾乎沒有變動。交易軌道會在交易結算時記錄,因此支出序列中最新的資料點最不完整,從中讀取任何月對月變化都會產生向下偏差——這是付款資料對行政統計修訂問題的對應現象,而問卷沒有這種問題。Ramp 的測量工具來源請見 Ramp;計算過程請見 Firm AI-Spend Intensity and Headcount Growth。
「對照組已不再可行」——這項主張應拆開檢視,而非照單全收(2026-08)#
DX 對 2026 年第二季 AI 影響的報告(vendor-claim,500 多個客戶組織)一開篇就提出了知識庫中任何來源對自身測量工具最尖銳的方法論斷言,而矛頭正指向本頁的主題:
「我們一開始追蹤 AI 對工程團隊的影響時,首要目標是將 AI 使用族群和歷史基準進行比較……隨著全產業 AI 採用率超過 90%,再將 AI 使用者與未使用者的對照組相較,已不再是可行的測量策略。」
**這項主張對其中一種對照設計成立,對另一種則不成立,而通常沒有人將兩者區分開來。**飽和到超過 90% 的是組織層級和開發者層級的採用——一個人或公司是否使用 AI。尚未飽和的是產出物層級的組成:由 AI 實際撰寫的個別變更、PR 或完成項目占比。
- 公司間(或開發者間)的採用者與非採用者對照確實逐漸失去可行性,DX 對此說得沒錯。採用率超過 90% 後,非採用者組別就只剩下因某些原因拒絕採用的一小群人;每過一季,這些原因都會造成更嚴重的混淆。DX 自身的面板,以及 Faros 採用深度橫切面分析,也都採用這種設計。這也是兩者都無法區分「AI 程式碼品質較差」和「採用最積極的組織在其他方面也不同」的原因。
- 公司內、同一程式碼庫內的來源對照依然可行,而且 DX 宣布它已失效時,這種對照仍在進行中。Tran 等人(Google) 在同一個 monorepo、相同期間內比較 AI 撰寫與人類撰寫的變更,依變更大小分層,共有 352 萬筆提交。在該族群中,採用實際上是全面性的——所有人都有相關工具——但對照組依然存在,因為 AI 撰寫的程式碼在提交內容中占比從 28.99% 到 68.62%,因此即使到了研究期間末期,仍有大約十分之三的變更由人類撰寫。只要比較單位不再是個人,全面採用與可用的對照組就能毫不矛盾地並存。
因此,更準確也更有用的說法是:**對照組往下一個層級移動了,而不是消失了。**人口層級的對照組已不復存在;每筆變更的對照組依然存在。
**這項主張也具有結構性自利的一面,正如本頁的 Faros 條目所記錄。**DX 銷售開發者生產力測量服務,而其測量工具是跨客戶組織、結合問卷與 SDLC 遙測的面板——它只能採用公司間的對照方式。它宣稱不可行的設計,正是它無法執行的設計;它提出的補救方法(以歷史基準對照面板內的縱向趨勢),就是它的產品。這並不代表其觀察錯誤;坦白來說,DX 正確指出了真實存在的測量危機,卻把原因歸錯了。
原因在於測量工具,而不是採用率。每筆變更的對照組需要撰寫時來源資訊——也就是在撰寫程式碼當下,記錄是誰寫下它。這項決定必須在產出物出現之前,由掌握編輯器的人做出;這也是 Google 能建立兩個組別,而公司以外的人做不到的原因。外部可用的替代方案,是使用由代理程式撰寫所定義的語料庫(AIDev);依此定義只能得到一個組別,無法配對比較人類撰寫內容。這正是 Dipongkor 等人與 Jhanglani 等人 以及 Sakib 等人 只能測量單一水準而非變化量的原因,也說明了為什麼 DECODE 只能觀察被接受的完成項目。四項研究都缺少同一個對照組,原因與採用率毫無關係。事後 AI 程式碼偵測器看起來是顯而易見的替代方式,但 Tran 等人完全不予採用(「在不同模型與設定下泛化能力不佳」)。
閱讀知識庫時,應據此採用以下判斷準則:當來源提到無法建立對照組時,應確認它是缺少非採用者(日益無可避免),還是缺少來源資訊(可以補救的測量缺口,多數發布 AI 影響數據的機構尚未投入資源填補)。
同一種測量工具,以自身資料回歸自身資料(2026-09-22)。DX 的後續文章 AI accelerates output, not innovation(Grace Fu,2026-09-09,vendor-claim,500 多名客戶;是否使用同一個第二季面板並未說明)具體呈現了結合問卷與遙測的面板能發現什麼、不能發現什麼。其標題中的結果和主要預測因子都來自受訪者自我回報——節省時間(2025 年第三季每週 3.0 小時升至 2026 年第二季每週 6.1 小時),以及「AI 產出」綜合指標;該指標中的 AI 撰寫程式碼占比,在第二季報告中採用自陳資料(哪些組成項目來自遙測,依然沒有說明)。這兩者的配對解釋了 63% 的變異。另一項不同的自陳結果,也就是創新比率(工程投入用於新功能而非維護工作的占比),在完整的 15 項指標模型中能解釋 13%;AI 產出的標準化 β 為 0.16,資訊搜尋摩擦的 β 為 −0.19,是係數最大的兩項。這是知識庫的解讀,而不是 DX 的解讀:當預測因子和結果由同一位受訪者以相同框架回答時,63% 的配適程度正是合理預期會看到的結果——也就是共同方法變異;13% 則更接近構念實際共有的部分。DX 提出實質結論(AI 加速產出,不會加速創新),並建議各客戶用自己的資料重跑迴歸;方法論上的結論是,缺少來源資訊組別,也沒有用遙測測量創新比率的這套面板,無法區分「投入時數並未轉化成新功能」與「問卷看不見時數用在哪裡」。Acceleration Whiplash 將這些係數的兩種解讀並列比較。
供應商委託的問卷,第二個案例:由誰發問不會改變分級(2026-09-02)#
Prophet Security 的 State of AI in the SOC 2026 是知識庫中繼 DX 的 State of AI Impact 之後,第二份由供應商發布的 AI 成效問卷;它是值得分析的案例,因為它在知識庫能檢查的每個方法面向上都比 DX 做得更好,最後卻仍落在相同級別。
它比 DX 多了以下內容:
- 公布樣本數 n——250 名 IT 與網路安全專業人士,以及公布問卷長度(31 題)。
- 具名的第三方問卷執行者:研究公司 ViB 負責篩選受訪者並執行問卷;其閘門頁面稱這項工作是「vendor-neutral, 3rd party research… independently conducted by ViB」。
- **報告中每個數字都附有分母範圍。**文章區分「受訪者中」、「AI 使用者中」、「觀察到這些情況者中」以及「嘗試建置的團隊中」——DX 缺少這種精確區分,才會使所有數據都無法解讀。
它仍缺少以下內容:
- 沒有執行日期、題目文字、人口統計資料,也沒有逐題樣本數。研究方法與人口統計資料只列為須填表取得的報告內容,取得前必須先填寫潛在客戶開發表單。
- **結論就是產品。**Prophet 銷售代理式 AI SOC 平台,而問卷中最值得引用的兩項發現——46% 的內部建置方案被捨棄或取代,以及常見問題將「嵌入某一供應商主控台的助理」與「專為此目的打造的代理式平台」相提並論——都把面向買家的推銷內容包裝成數據。
- 所有結果數字都是對自身團隊績效的自陳,而本頁的整體論旨指出,在快速轉型期間,這類測量工具容易得出過度樂觀的結果。
因此,這兩個案例共同建立的規則是:**分級取決於結論是否就是產品,以及方法能否查驗——而不是由誰執行問卷。**中立的問卷執行者能改善抽樣與篩選,但無法讓賣方摘要中的百分比變得可重現;此處的「中立於供應商」也是供應商對自己委託研究所做的描述。
**更尖銳的問題是,問卷方法在此代替了什麼。**在程式碼領域,本頁至少可以並列問卷和遙測——Faros 對照 DORA,DX 自陳的程式碼占比對照 Google 逐位元組的來源資訊。在安全營運領域,完全沒有遙測組別;這種缺失並非技術問題。SOC 會記錄這份問卷要求人們回憶的兩個數值:一次調查耗費的時間,以及無人開啟的警示占比。兩者都能從 SIEM 和票務系統計算得出。因此,知識庫中 Autonomous Defense 的所有人口基準,都仰賴唯一一種看不見自己所詢問事物的測量工具家族——「72% 的 AI 使用者表示,調查時間至少減少 25%」是一項主觀時間感受,談的是一段連受訪者自己的工具都會加上時間戳記的時間。這是本頁觀測孔徑論點最清楚的反向案例:不是測量工具的涵蓋範圍有限,而是可測量的數值根本沒有人做過儀器化記錄。
規模最大的自陳測量工具:十年序列改變了自身問題(McKinsey,2026 年 8 月)#
The state of AI in 2026(McKinsey / QuantumBlack,2026-08-25,按分級屬於 empirical,完全依據自陳資料)是這批資料集中規模最大的問卷工具——97 個國家共 1,719 名參與者,以 GDP 加權,每個組織一名受訪者,於 2026 年 5 月 4 日至 6 月 8 日執行——也是第十屆年度報告,其系列經常被引用作為採用基準。它有三項特質,使它不只是另一筆問卷資料,而是值得研究的案例。
1. 它評估了自己的預測,結果未能達標。2025 年版本指出,32% 的受訪者預期未來一年會裁減與 AI 相關的人力;2026 年版本則指出,有 14% 的受訪者回報裁減確實發生,66% 表示人數幾乎沒有變化或完全未變(Exhibit 16)。這是同一套測量工具、同一個面板,相隔一年所測得的預期過高 2.3 倍。這是問卷最罕見的特點——能在同一工具內校準其前瞻性回答——而結果的方向只有部分符合本頁對構念崩解的預期:此處過度樂觀的是預期,而非回溯性報告。
**2. 它的標題趨勢線有一部分是由定義決定。**Exhibit 1 的採用率系列從 2017 年的 21% 升至 2026 年的 89%;其註腳承認問題曾四度改變:2017 年詢問 AI 是否「用於業務核心部分或大規模使用」;2018 至 2019 年詢問是否將至少一項 AI 能力融入流程或產品;2020 年起詢問是否至少在一項職能中採用 AI;2025 至 2026 年則詢問是否至少在一項職能中定期使用 AI。下方待解問題所述的錨定問題,在此直接出現在商業媒體最常引用的採用率系列中——只是未經量化,因為沒有任何一年同時回報兩種定義。Exhibit 6 還揭露了第二項中斷:先前版本詢問各使用案例的成本影響,再彙總結果;2026 年則直接詢問業務職能層級,因此職能層級的成本數字無法與早期版本比較。
3. 它測量的是歸因,而非事件。「AI 對我們的 EBIT 有正面貢獻」(37%)要求受訪者做出公司層級的因果判斷;「AI 提升了我的生產力」(80%)則是主觀感受測量,正是快速轉型期間可能與系統結果分歧的類型。高績效者占 6% 的構念,根據歸因結果定義,再用來解釋該結果。受訪者也經常不知道答案:人力項目中,表示不知道的比例為 8% 至 13%;大型企業中,針對軟體編碼代理程式階段的問題則達 11%——而這個面板中,1,490 名確認職務的受訪者裡有 654 名 C 級主管,只有 195 名個人貢獻者。
這些都不會降低其分級:執行方式、樣本與加權資訊都有揭露,已勝過本頁多數資料。它精確呈現了這種工具的定位——整個資料集中涵蓋範圍最廣,卻以觀感為測量對象,而十年趨勢線的斜率也包含了重新定義本身。
記錄包含的是變化模型,而非活動計數(2026-09-22)#
Adoption Telemetry(Damon A. Young,PolyWise Partners;arXiv 2608.23617,2026 年 8 月 22 日,23 頁)從第三個角度挑戰本頁的二分法。先判定其分級:practitioner-opinion,單一作者,任職於會銷售這種測量工具的顧問公司,而且文中沒有任何數據來自真實部署——整套評估都採用作者生成的合成族群。閱讀它應著眼於其論點,而非把數字當成現實世界的實況。
其論點是,遙測與問卷不是測量單一構念的兩種工具,而是各自有四種傳統,分別測量與該構念相鄰的事物。可觀測性工具測量系統(追蹤記錄、延遲、成本、輸出品質——人類則擔任評分者或訊號來源)。企業使用量儀表板測量活動,例子十分明確:Microsoft 將 Copilot 活躍使用者定義為「在前 28 天內,至少在一個支援的應用程式中執行過一項自主操作的人」,因此「每週試用 AI 助理兩次的員工,和工作已被 AI 重塑的員工,在使用量儀表板上無從區別:兩者都是活躍使用者。」門檻設定的專業知識來自產品分析,也就是供應商的立場。變革管理掌握測量構念——分階段的行為改變模型,以及 ADKAR 的認知/意願/知識/能力/強化——並且「透過提問測量」:Prosci 2026 AI Adoption Diagnostic 是由專家居中評估的工具,涵蓋五個面向,並以一份 1,100 多名專業人士參與的問卷為基礎。提出的第三種做法,是將變革模型的里程碑表示為部署既有事件串流中的可計算述詞,從而推斷採用狀態,而非仰賴回報——使用量儀表板回答使用量有多大,evals 回答是否有效,問卷回答人們感覺如何,但沒有一種能回答這個族群改變工作方式的過程停在哪裡。
**定義敏感度的數據,來自二手資料,但仍值得用來說明觀測孔徑問題。**起始數字來自 ActivTrak Productivity Lab 的新聞資料,僅作為引述引用,未經原始發布內容查核:季度追蹤 120,620 名員工,涵蓋 1,009 個組織,發現 82% 的 AI 使用者每季持續使用,但只有約 2% 的人使用程度能穩定融入工作流程;另一份發布資料(4.43 億工作時數,163,638 名員工)則發現 57% 的 AI 使用者使用 AI 工具的時間不到工作時數的 1%。此處的關鍵是其分布形狀:同一份遙測資料,只因採用深度門檻不同,就能得出 82% 或 2% 的採用率——資料固定不變,結果卻相差約 40 倍。這正是下方錨定問題想用問卷的分卷提問法測量的構念定義效應,卻出現在一種行為測量工具中:遙測測量組也承襲了定義問題,並未避開它。
本頁先前尚未涵蓋的兩項論點。第一,將觀測孔徑問題重新表述為治理問題,而非涵蓋範圍問題:平台供應商在結構上無法提供的是中立性——其測量工具「診斷自家產品,採用自家定義的構念、可自行修訂,範圍也限於自家生態系」,因此能支援替代方案決策、並且不偏向任何產品組合的測量工具,「沒有任何平台供應商有誘因打造,也沒有任何一家打造過」。Microsoft 的跨組織基準比較正好顯示這條界線:依據 Microsoft 自己的文件,基準資料只涵蓋「Copilot 活躍使用者的比例」,歷史資料至多只有 6 個月——這種比較只存在於涵蓋面上。第二,遙測測量組本身面臨的 Goodhart 風險;以上供應商問卷案例都沒有相對應的情況:「知道採用情況受到測量的族群,可以表演採用行為:頻繁呼叫工具但不依賴工具、長時間使用但未整合至工作流程。」
**它對問卷測量組的意義。**它可以作為本頁已描述的 AEI 基礎設施的補充:這種工具「測量行為,而不是經驗」,其盲點則具有問卷式特徵(一筆零活動紀錄無法區分從未聽說過這項工具和知道它但選擇不使用;長時間使用也無法區分深度整合和操作困難)。§8.6 將其具體化為一項研究問題:感知測量工具是否會系統性地早於遙測指出採用停滯、會提前多久,以及兩者是否會以特定模式產生分歧。Pilot-to-Production Gap 討論階段模型和僅以合成資料驗證的結果;Usage-Telemetry Classifier Validation 則介紹無分類器的測量設計。
相關連結#
-
AI Adoption in Scientific Work — 第十個觀察窗口:這份調查探問的是 認可程度,而非行為、影響或感受。 Angelini & Lyrvall 對 3,785 名博士生進行潛在類別分析,詢問每位受訪者對 AI 執行五項指定研究任務的接受程度,並依據整體回答模式,而非任何單一答案,歸納出四種輪廓——這項工具衡量的是個人接受度的 形狀,而非高低。它有兩項特質,因此值得列入此處。它是罕見的態度測量中納入行為指標的案例:AI 使用頻率是共變數,因此態度與行為的關聯是透過估計得出,而非預先假定;結果顯示,重度使用者並非對所有事情都抱持熱情(每日/每週使用者在拒絕型輪廓上的係數為 −1.911,在寬容型輪廓上則為不顯著的 +0.434)。它的標題也帶出了本頁的構念問題:論文將這些輪廓稱為規範界線,但題目問的是接受程度;§5.4 也承認,接受程度同樣可能反映熟悉度、取得途徑或對可靠性的看法。這又是一次分卷調查問題——研究發現使用了工具未能單獨辨識的構念來命名,而這份調查也沒有任何版本能單獨詢問正當性。所在頁面也收錄了相應的遙測資料,兩者卻不一致:Gemini 在科學領域的互動中,有 42.5% 是定量分析,而這正是博士生最不願委派的任務
-
Procedural Value in AI Decisions — 第八個觀察窗口:隨機化的陳述偏好設計。 聯合分析既不是遙測(沒有觀察任何事物),也不是態度層面的調查(屬性經過隨機化,因此 AMCE 在 情境案例內 具有因果性);它能做到其他兩者都做不到的一件事——讓程序與績效正交變化。任何部署都無法產生這種變化,因為雇主從不隨機安排由誰決策,以及系統出錯的頻率。Wang、Sturgis & de Kadt 用這種方法估算決策權對選擇機率的影響為 +0.272,而錯誤拒絕率降低 20 個百分點的影響為 +0.285。代價是外部效度較低,而同一篇論文也衡量了兩者的差距:申請意願高於對系統正當性的信任(3.24 對 2.85,p<0.001,d_z=0.42),有 7.8% 的人不信任系統卻仍打算申請——這直接估出當受訪者沒有其他選項時,行為代理指標與規範判斷之間的差距
-
The Enablement–Regulation Axis — 第九個觀察窗口:菁英論述文本語料。 不是遙測(沒有記錄行為)、不是調查(沒有人受訪)、不是聯合分析(沒有任何隨機化)——它近乎完整地收錄了某個具有重大影響力的群體在公開紀錄中的發言,並具備其他觀察窗口都沒有的特性:發言者在制度上有義務留下紀錄,因此沒有不回覆問題,也沒有回憶偏誤。Chueri & Törnberg 分析了 33 個國會的 1,514,950 篇實質演說(2023 年至 2026 年 4 月),並從中辨識論述框架的組成。它換來的是政策供給面的完整度與時效性;付出的代價是構念效度——演說衡量的是立場,不是偏好或行為,更不是政策落實(「國會演說無法直接衡量已制定的政策」)。本頁的定義敏感度機制在此呈現為檢索詞典,而非門檻:多語言關鍵字清單從 150 萬篇演說中篩出 19,411 篇候選文本,但從未估算召回率;因此,哪些演說算是「AI 與工作」演說,是由整條流程一次劃定、之後從未變動的界線——正是本頁不斷呼籲、卻未再執行的分卷調查設計
-
The Enterprise AI Adoption Gradient — 第七個觀察窗口:供應商的行政帳冊。 OpenAI 的企業研究一開始便提出本頁的論點——調查自陳「通常不夠詳細,且可能受到回憶不完整或回報偏誤影響」——接著便展示這種取捨的兩面。帳戶紀錄能精確呈現買方內部的使用深度(每個組織每週的訊息數、WAU 與輸出 token,可連結至 Compustat),精確程度是任何調查都達不到的;但它們在結構上無法看見未採用、競爭供應商、未經核准的使用,以及任何結果——這與本頁記錄的 Ramp 支付管道有相同盲點,只是產品範圍更窄
-
Closed-Loop AI Review — 定義問題出現在挖掘出的產物,而非調查題目。 本頁指出,衡量出的比率會隨著定義事物的門檻而變動;該文中,僅一項選擇就讓「代理程式撰寫的 PR」數量相差 1,733,535——是否把
codex/這類分支名稱前綴視為代理程式撰寫的證據。Selvanayagam & Ghaleb 認為不算(佔他們全部作者端隔離項目的 96.9%,而作者端隔離占比為 38.0%);這是研究中影響最大的單一方法選擇,也是其 8.8% AI 審查率標題數字的分母。值得注意的是兩端的不對稱:審查者端的隔離率只有 0.01%,因為供應商會使用受控的機器人登入帳戶;因此,挖掘出的比率可能同時具有近乎完整的分子,以及嚴重不完整的分母 -
Agent Documentation Behavior — 追蹤遙測被用到誠實的極限,以及罕見地刪除一個維度、而非估計它的研究案例。 Gao & Chen 最初的編碼方案納入了 目的——代理程式為何開啟檔案——後來他們將它刪除:工具呼叫記錄無法還原目的,讀取檔案可能出於許多意圖,硬要指定一種「將無法被證偽」。他們改為報告觸發原因、互動類型與結果,並明確說明觀察範圍(僅限儲存庫內的檔案操作;不含瀏覽器讀取、模型權重或原始碼中的文件字串;執行階段注入的情境檔案在重新讀取前不可見,因此所有絕對比率都是下限)。這是整個語料中最清楚表明本頁主張界線的說法——記錄能回答 發生了什麼,而它們無法回答的意圖問題,正是人們轉而採用調查的原因
-
Pilot-to-Production Gap — 本頁的測量工具無法定位的診斷。 該頁收錄同一來源提出的五階段停滯分類法,以及僅涵蓋合成資料的界線;差異在於,階段模型主張的是企業部署失敗,因此放在該頁,而「正式環境記錄是否能承載變革管理構念」主張的是測量工具,因此放在此處。兩者從兩端呈現文獻缺口:試點失敗文件診斷組織成因,卻未衡量它們;此來源則提出衡量方法,卻沒有實際部署作為依據
-
Autonomous Defense — 本頁二分法在此領域收斂成單一分支。資安營運有日誌可直接衡量調查時間與未調查警示的占比,而語料中唯一一項針對兩者進行的整體族群調查,是由 ViB 執行、受供應商委託的自陳式調查(n=250)——因此 SOC 的基準數字承載了調查分支的樂觀偏誤,卻沒有遙測資料可供核對
-
Community Smells Under AI Adoption — 測量工具之間的張力出現在同一項工具內部:同一份調查的自由文字回答指出 AI 正在取代隊友,但其結構模型卻估計同儕互動正在增加。作者提出的三部分調和方式——個人變化與跨受訪者關聯、效果集中且有條件,以及直接路徑不顯著表示存在中介而非毫無影響——是解讀此處自陳資料時可重複運用的框架
-
The Open-Weight Frontier Gap — 支付管道工具在最常被用來回答的問題上存在極限:Ramp 的 AI 支出者中有 5.8% 使用模型服務商,是知識庫衡量開放模型/中國模型採用情形的主要量化依據,但它只能看見付費使用模型服務商的企業——下載開放權重並在自家 GPU 執行不會產生交易,因此按設計就無法被看見;這與未經核准的 AI 使用令上方企業遙測產生的盲點相同
-
Organizational Complements to AI — 本來源的實質歸屬所在,也是其測量工具重要的原因:組織層級以下的採用情形(410 家組織中有 183 家在沒有任何推行計畫的情況下使用 AI)是組織互補因素的問題,企業層級遙測無法觸及,因此互補因素文獻所用的使用占比與支出追蹤工具,在結構上無法看見擴散最快的一半
-
Controlled Variance: AI's Edge as Reduced Dispersion — 上述第三種測量工具:知識庫中唯一一項 AI 在專家對話任務中取代人類的隨機因果估計,以及唯一一個行政紀錄、申請者調查和專家預測對同一項介入得出不同結論的設計
-
Exposure Taxonomy: Observed, Theoretical, Reported, Anticipated — 七種測量工具的比較所在;上述家族效應是對此比較的測量方法學解讀,而其中以遙測資料建立的第七種工具,正是本頁二分法之前未曾納入的混合案例
-
Usage-Telemetry Classifier Validation — 本論點的遙測一側所付出的代價:系統日誌在時效性與規模上勝過自陳,但由其推導出的經濟主張,都要經過一個 LLM 分類器;在 O*NET 任務層級上的實際準確率(22.6%),直到 Google ATLAS 發表後才公開
-
AI Native Product Cadence — 遙測一側的極限:OpenAI 的 Akshay Nathan 指出,在代理程式介入後,典型工程代理指標(提交數、LOC、PR、token)與目標達成情況開始脫鉤;因此,對相同訊號加強儀表化,只會測量活動而非進展——遙測的時效性勝過調查,但前提是記錄的數值仍能反映結果
-
Acceleration Whiplash — 成熟度與結果無關的發現,建立在這種以遙測優於調查的方法上
-
Production-Sourced Evaluation — 同一種「從真實系統而非代理指標測量」的思路,套用在模型評估上;遙測與調查之別是它在工程指標上的對應案例
-
Evals as Product Spec — Cat Wu 的評估編碼了規格;遙測則編碼了實際上線的內容——兩者都偏好真實情況的訊號,而非自陳
-
Verification as the New Bottleneck — Fiona Fung 提醒要把 PR 週期時間拆成漏斗各階段,而非只看整體數字;這與「謹慎測量,否則訊號會誤導」是同一種紀律。該頁也有測量窗口案例:CircleCI 2026 年第二季 Pulse(
vendor-claim,超過 2,000 萬個工作流程)屬於與 Faros 類似的行為而非感受遙測,但資料來自單一平台上的單一訊號——它只能看到 CI 工作流程執行,除此之外一概不知。這個觀察窗口界定了它能提出的主張:它能以調查無法達到的精確度,計算驗證週期(其 Merge Efficiency Ratio),卻無法觀察正式環境事故、面向客戶的錯誤,或審查佇列。因此,它樂觀的主分支成功率(70.8%→76.7%)與 Faros 悲觀的每個 PR 事故數(+242.7%)幾乎不構成衝突——各家供應商報告的,都是自家產品所能測量的 SDLC 半邊。對本頁論點的推論是:遙測的時效性勝過調查,但涵蓋範圍取決於供應商產品碰觸到哪些部分;供應商的標題指標,往往就是其測量工具看得見、而其產品也能改善的那項指標 -
Compounding Data Moat — 擁有遙測資料流本身就是一道護城河;該報告展示了這項資料資產能帶來什麼
-
Agentic Coding Work-Composition Shift —
empirical近親案例:Anthropic 以 Clio 為基礎的 40 萬個工作階段遙測,以相同方式讀取行為而非感受,但它是研究成果(經驗證的分類器、控制項),而非以vendor-claim作為引流的報告——其工作階段層級的樂觀情況與 Faros 組織層級的悲觀看法,正是本頁命名的感受與系統之別 -
Conversation-to-Delegation Shift — 第三項主要的使用遙測研究(OpenAI/Codex,
empirical),並擴展了本頁的論點:隨著使用轉向委派,即使是互動次數指標(活躍使用者、聊天數)也會過時——應追蹤複雜度、執行時間、併發性、重複使用與輸出 -
Anthropic Economic Index — 這項計畫化解了本頁的二分法:它將每個人的使用遙測與調查回答連結起來(《Cadences》報告約有 9,700 位完成連結的受訪者),將遙測與調查視為互補,而非競爭關係
-
AI Usage Cadences — AEI 的逐小時連續遙測,是本頁「細緻測量真實系統」原則在時間解析度上的延伸
-
Review as the Control Point — 本頁開放問題要求的非供應商遙測,也是對其方法論論點的深化:CMU 重新抓取了超過 250 萬筆 GitHub PR(測量行為,而非感受),卻發現同樣的軌跡會因為合理的分析選擇而支持相反的結論——因此,遙測雖在時效性上勝過調查,但若沒有因果模型,表層遙測仍無法判定原因(Pearl:「資料是非常愚笨的」)。遙測的優勢確實存在,但有其界限
-
Market-Priced AI Exposure (the AI Premium) — 最純粹的實際使用遙測(每筆觀察都是一筆付費請求,測量行為而非感受),擴展至跨供應商的廣度(超過 400 個模型,約占全球 token 的 2%),再透過股價共變轉化為市場定價訊號;這是此脈絡中從金融面切入的一篇——但也提醒我們,遙測本身的收集機制會帶來偏誤(OpenRouter 的使用者偏向開發者),因此實際觀察到的資料不等於具代表性
-
AI Investment Story, Not Efficiency Story — 本頁的二分法延伸至新創經濟:以每位員工營收而言,Emergence 實際測得的股權帳面收入(AI 公司低於非 AI 同業)與 AWS 的創辦人自陳調查(AI 原生公司高於基準)互相矛盾——這是調查與財務遙測測量工具的分歧,形狀與 Faros 對 DORA 的感受與系統案例相同;處理方式也一樣(以實際收入紀錄為準,標示差異而非取平均)
-
Firm AI-Spend Intensity and Headcount Growth — 也是本頁未納入的第四種測量工具家族所在:平台行政紀錄,見於 Indeed Hiring Lab 的職缺刊登序列。不是遙測(沒有記錄任何人的使用情形)、不是調查(沒有人受訪)、不是隨機化(沒有指派任何條件)——它是平台促成交易所產生的副產品紀錄,因此同時具備行為而非感受的特質,並能近乎即時地反映需求面;使用遙測只能看見供給面。它承襲的觀察窗口問題比 CircleCI 更尖銳:工具就是單一求職網站,因此其資料範圍只涵蓋在該網站刊登職缺的人;「美國職缺刊登數下降 7%」首先是對 Indeed 平台的描述,其次才是對整體經濟的描述。它也把供應商誘因與測量工具集中在同一方,與本頁談到 Faros 的情況相同——Indeed 的研究部門發布自家求職網站的復甦故事——但其實質限制與 Faros 不同:這些數字是行政資料,很難爭辯,真正無法由此設計支持的是因果解讀(「Claude Code 上線後,職缺刊登數便回升」)。此外,同一種行為而非感受的思路,也用於AI 採用與其勞動力影響:Ramp 根據實際 AI 供應商的付款軌跡讀取採用情形(而非詢問「你有沒有使用 AI?」;同一時期調查的回答介於 18% 至 78%),再將其與 Revelio 的勞動力紀錄連結——這是論文明確用來對照「混亂不一的調查與暴露度測量」的揭露採用指標
-
AI Product Economics Maturation — 調查軸線被推向最柔軟的形式:ICONIQ 的高階主管調查在自陳之外又加入未來預測(2026P/2027P 的利潤率與 RPE),所以其樂觀趨勢是對未來的感受,比遙測還隔了兩層。當其預測的利潤率擴張(2027 年達 59%)遇上 Emergence 實際測得的成長毛利率壓縮,本頁的處方依然適用——以實際收入紀錄為準,標示差異而非取平均,並將預測標記為預測等級
-
Outsource Your Thinking, Not Your Understanding — 本頁論點的反例:理解債務是遙測會漏掉的損害,因為交付的產物沒有問題(Shopify 表示 AI 輔助產物的回退率已回到 AI 出現前的基準),改變的是人
-
Standardize the Infrastructure, Not the Tools — 讓全組織 AI 遙測成為可能的工具(單一閘道、單一計量器),以及每團隊的使用分析在建立後會如何被使用這個開放問題
-
Efficiency Debt of AI-Generated Code — 帶有控制組的第一方遙測,正是本頁整個 Faros 論點一直欠缺的形式。Google 以位元組層級的作者來源追蹤自家 monorepo,並在相同時間窗口與規模區間內比較 AI 撰寫與人類撰寫的程式碼——因此不同於 Faros 的低採用率與高採用率橫斷面研究,它能區分「AI 程式碼比較差」與「採用最多的組織在其他方面有所不同」。對本頁有兩項啟示。觀察窗口原則依然成立,而且比平常更明確:測量工具看得見單一公司的流程內部所有情況,卻看不見外部任何事物;也就是對一個僅有一家公司的群體,完全涵蓋。供應商誘因的方向也與此處其他所有案例相反——測量程式碼的組織,也是打造撰寫程式碼工具的組織;整體結果令人安心(回退率低於同等水準),並將剩餘缺點歸因於「歷史預設的系統設定」。兩個遙測來源、兩種方向相反的利益衝突、相反的結果,只有其中一個有控制組
-
AI and Market Power — 第五種測量工具家族,也是唯一真正有理由主張具代表性的一種:由統計機關依據共同的 Eurostat 指引執行、具強制性的全國統計調查(法國 TIC、葡萄牙 IUTICE),並連結至行政資產負債表。它是調查,因此承襲本頁所列的自陳限制;但它是抽樣、加權、強制參與的調查,而非自我選擇的受訪者面板,並為知識庫中的採用率範圍提供低端錨點:2025 年有 20.2% 的 OECD 企業使用 AI;相較之下,Census BTOS 為 18%,Ramp 支付管道中符合資格的企業約有 55%,高階主管調查則為 69% 至 78%。觀察窗口論點在此獲得最清楚的示例——五種工具、一種現象、相差四倍,而最具代表性的工具讀數最低
-
Psychological Costs of AI Adoption — 第七種測量工具家族,也是唯一研究內容沒有其他家族可衡量的一種:半結構式訪談加上受訪者確認(N = 21,來自單一公司,另有 12 名參與者根據自身經驗審閱一份 15 頁的研究結果報告)。它能支持的主張是:評估——從業人員為何做出遙測所記錄的行為。這是知識庫中唯一能區分「逐行閱讀差異,因為差異有風險」與「逐行閱讀差異,因為我必須負責」的測量工具;這是 PR 層級指標無法觸及的審查負荷因果主張,也是唯一觀察到人們承受壓力的工具(「我沒有。我只是繼續做下去」)。它無法支持的主張則是規模、趨勢或族群推論。研究中軟體工程師的 10/10 數字,計算的是逐字稿中至少出現一項符合代碼的參與者人數;這是如實標示為「描述性……探索性而非定論」的編碼程序產物。樣本是透過雇主的 AI 計畫主管聯繫到的 21 名志願者,來自單一公司、單一時間點。受訪者確認確實比未經驗證的調查更能提升可靠性,但不代表具備外部效度。與 Community Smells Under AI Adoption 的自由文字回答一起閱讀時,也能看到本頁的家族效應在更下一層重現:兩種自陳工具對從業人員的感受彼此一致,卻對其對團隊的含意彼此矛盾
-
Post-Acceptance Edit Behavior — 第六種測量工具家族,也是唯一觀察到隨後遭到銷毀的產物的一種:提交前的編輯器遙測。DECODE 每當開發者停頓一秒,就儲存一次工作檔案,因此能看見 AI 程式碼在接受 23 分鐘後遭到刪除——這些程式碼不會出現在任何儲存庫、PR、調查回答或 monorepo 歷史中,因此本頁其他測量工具都看不見。這是觀察窗口論點的鏡像:提交之前的各層不是對同一族群看得比較少,而是包含了更高層在結構上無法記錄的事件。其弱點以更鮮明的方式重現熟悉的問題——觀察窗口是單一款選擇加入的 VS Code 擴充套件,使用者是自行選擇安裝模型比較工具的人;不像強制統計調查或公司的完整 monorepo 歷史
推導#
- Is Human Review of AI-Authored Code Still a Real Control, or Already Rubber-Stamping? — 解決了類別錯誤問題,並將測量工具加權規則(「依工具能看見的事物為其加權」)延伸至整個監督研究群
- What the Instrument Can Resolve: Two Headline Numbers and Their Missing Denominators — 界定本頁第三層能支持的範圍。隨機化只能辨識指派條件之間的對比,無法得知更多:Controlled Variance: AI's Edge as Reduced Dispersion 中超出 ITT 的所有內容——包括哪種管道、哪個階段、原因為何——都是以觀察性、LLM 分類器中介的證據為基礎,具有與此處遙測研究相同、未量化的誤差範圍;而論文的機制變數(一種十分類的訪談類型分類器)沒有公布準確率或 κ,且設定的門檻是處理條件會改變的數值。隨機實驗不會讓其中的測量工具升級。
開放問題#
-
是否有足夠大型、且非供應商的遙測資料集,能獨立於 Faros 的商業框架,判定成熟度是否具有保護作用?部分回答:CMU 的 arXiv 2607.07980 正好提供了這類資料——一項非供應商、涵蓋超過 250 萬筆 PR 的 GitHub 遙測研究;研究 (a) 發現代理程式未經審查的比率正逐漸接近人類基準,而非差距擴大;(b) 主張效果方向取決於團隊實務,較接近 DORA。問題在於,該研究自身的標題結論是遙測的方向不穩定,因此它能對 Faros 的說法形成制衡,卻無法明確解決成熟度問題——誠實的結論是:「僅憑表層遙測,無論來自供應商與否,都無法判定這件事。」這項結論的實例見於 The Under-Review Divergence: Faros's Widening Crisis vs. CMU's Convergence:當指標、族群、時間軸與作者單位一致後,兩項遙測研究對未審查情況的相反標題結論便消失了——資料集從未意見相左,只有呈現方式不同。
-
調查中對「AI」的定義若有所錨定,答案是否會改變,而且方向是否符合預期?Kalff & Simbeck 記錄到受訪者將預測式 ML 排除在這個類別之外,卻把 ChatGPT 納入其中;這會讓採用率自陳值偏低,恰好低估標題發現所談的工具類別。可用兩種方式檢驗:分卷調查中,一組不用類別名稱,而以技術本身描述(「評估員工離職風險的軟體」);或以同一批公司的供應商授權/支出紀錄,驗證企業層級的自陳採用情形——將 Ramp 工具 作為效標,而非替代指標。相關證據(2026-08-12),但尚未解答:DX 報告稱,500 多個組織中自陳的 AI 生成程式碼占比,在 2026 年第一至第二季間為 34% 至 52%;同一重疊期間內,Google 的撰寫時來源追蹤 得出的數字則為 28.99% 至 68.62%。兩者的族群不同(一個跨產業客戶面板,對上一個 C++ monorepo)、構念不同(程式碼占比對採用情形),沒有配對公司;DX 的題目措辭位於知識庫未收錄的受限 PDF 中——因此無法定論。儘管如此,這是語料中首次並列比較自陳程式碼占比與來源追蹤測得數值的案例,而方向正符合 Kalff & Simbeck 的構念混淆機制預測:自陳值低於以位元組計數的測量工具,而非高於它。本條目要求的效標驗證,就是以同一批公司進行相同比較。同一機制的第二個實例,已有紀錄但未量化(2026-09-22):The state of AI in 2026: On the road to ROI 發布了商業媒體最常引用的 AI 採用序列——從 2017 年的 21% 增至 2026 年的 89%——並在註腳承認,這段期間內題目重新定義了四次(2017 年為「企業營運核心部分或已大規模採用」;2018 至 2019 年為在流程或產品中嵌入至少一項 AI 能力;2020 年起為至少在一項職能中採用 AI;2025 至 2026 年為至少在一項職能中定期使用)。每次修訂都放寬了門檻,因此序列的增幅有多少來自行為改變、有多少來自定義改變,目前不得而知。同一版也揭露第二項變動:往年在使用案例層級詢問 AI 的成本影響,再彙總結果;2026 年則直接在業務職能層級提問。這正是本條目所述機制在實際資料中的最大規模案例——但它仍未解答問題,因為沒有任何一年同時採用兩套定義進行調查,因此分卷調查設計本可測出的效果大小,正是目前仍未測量的內容。它帶來的啟示是,這個問題並非假設:廣泛流傳的十年趨勢線,已經包含了這個問題。同一機制出現在遙測一側,而本條目原以為遙測不受影響(2026-09-22):Adoption Telemetry: Measuring Enterprise AI Adoption from Production Signals 報告一份行為資料集(ActivTrak,120,620 名工作者)在持續使用的定義下讀出 82% 採用率,在工作流程嵌入度的定義下則讀出 約 2%——同一份日誌,相差約 40 倍,差異完全來自定義。這是二手資料且屬於
practitioner-opinion,因此不是本條目要求的效標驗證;但它表示,隱含的補救方式(以遙測驗證自陳)必須先固定遙測門檻,否則會繼承兩個定義自由度,而非一個。
已解決問題#
- 調查與遙測測量的是不同事物(感受到的生產力與系統結果);所謂「矛盾」是否部分源自類別錯誤——兩者在各自層次都成立,而非一方有誤?已回答:Is Human Review of AI-Authored Code Still a Real Control, or Already Rubber-Stamping? — 就測量的兩個面向而言,答案是肯定的:調查反映感受到的生產力(在個人層面確實存在——任務完成量的確增加),而遙測反映尚未傳遞至感受層面的系統結果;在快速轉變期間,兩個層面合理地有所落差,而 AEI 的遙測與調查連結設計已將兩者視為互補。但並非完全如此:成熟度保護主張是針對單一層面(系統結果)的一項主張,其實質內容仍有爭議——Faros 的「沒有保護作用」與其供應商誘因一致;CMU 的調節因素理論則認為方向由團隊決定(較接近 DORA),但未測量成熟度效果。化解類別錯誤能釐清框架;真正的歧見仍未解決(已在上述非供應商資料集問題中追蹤)。
資料來源#
-
From Agent Behaviour to Agent-Friendly Documentation — Gao & Chen(Peking University),arXiv 2608.20195,2026-08-20,
empirical。此處僅引用該文支持 §3.3 不將互動目的編碼的決定、§3.5 的觀察範圍段落、§7.1 的建構效度下限論證,以及 §3.6 對巢狀觀察採用的群集自助法處理。這是方法論引用,並非測量引用——該論文沒有調查組別,也未報告任何生產力數值。完整討論見 Agent Documentation Behavior -
AI Engineering Report 2026: The Acceleration Whiplash —「對 DORA 2025 年研究的直接反駁」;研究方法;報告目的
-
DORA,2025 State of AI-Assisted Software Development(Faros 引用):https://dora.dev/research/2025/dora-report/
-
5 takeaways from the State of Software Delivery Q2 Pulse report — Jacob Schmitt,CircleCI 部落格(2026-07-08),
vendor-claim:單一平台遙測資料的觀測範圍,以及 Software Delivery Data Explorer 的基準測試框架 -
Voice AI in Firms: A Natural Field Experiment on Automated Job Interviews — Jabarian & Henkel,arXiv 2607.28222(2026-07-30),
empirical,預先註冊的實地實驗。§3.1(行政結果)、§3 導言(招募人員的預測:錄取邀約減少 36%/留任率降低 48%/面試品質降低 61%)、§5.2(應徵者調查對自然度的結果,以及綜合品質指數)。完整討論與解析警示見 Controlled Variance: AI's Edge as Reduced Dispersion。 -
Helping People Choose Careers in the Age of AI — Steele & Cruz,arXiv 2607.15506(2026-07-16),
empirical。§4(以查詢為基礎的建構方式)以及 §4.4 與 Fig. 6(七種工具之間的對應關係)。匯入時確認 Table 1 和 Table 2 完好;Table 5 和附錄 Table A1 的解析有誤,此處未引用。論文自身的摘要統計存在來源內部矛盾——詳見 Exposure Taxonomy: Observed, Theoretical, Reported, Anticipated 的 Sources 註記。 -
AI and Job Postings: From Destruction to Creation? — Guillermo Gallacher,AI and Job Postings: From Destruction to Creation?(Indeed Hiring Lab,2026-07-08;
empirical)。此處引用的是其測量工具,而非研究內容:平台自身的行政交易紀錄(職缺刊登),由該平台分析並發布,採用產品推出前後的未受控比較設計。研究內容與完整證據註記見 Firm AI-Spend Intensity and Headcount Growth;來源中僅見圖表的數值(各國占比、散佈圖相關統計)在本知識庫中皆未引用。 -
Ramp's latest data on China vs. the American AI Labs — Ara Kharazian,Ramp's latest data on China vs. the American AI Labs(Ramp AI Index,2026-07-08;
empirical)。此處引用的是測量工具,而非研究內容:支付平台自身的行政紀錄,由該平台首席經濟學家發布為每月市場指數。利益衝突與抽樣:Ramp 測量的是使用其企業卡/帳單支付服務的客戶——這是積極使用商業支出服務、且偏向創投圈的樣本,並非美國企業的隨機樣本;Ramp 也有商業利益,希望掌握具權威性的 AI 採用資料集。用於觀測範圍論證的 Google/Microsoft 系列,取自原始檔中復原的 Datawrapper 圖表資料集(該信未指明兩家廠商名稱);研究內容與完整證據註記見 Firm AI-Spend Intensity and Headcount Growth,開放權重需求解讀見 The Open-Weight Frontier Gap -
AI accelerates output, not innovation — Grace Fu,AI accelerates output, not innovation(DX 電子報,2026-09-09;
vendor-claim)。此處引用的是測量工具,而非研究發現:自陳節省時間(每週 3.0 → 6.1 小時)與 AI 產出綜合指標的擬合度為 R² 0.63;根據調查得出的創新比率與 15 項工作流程指標的擬合度為 R² 0.13;β 為 0.16(AI 產出)與 −0.19(資訊搜尋),兩者皆 p < 0.01。原始資料為轉述摘要;保留數字,但未直接引用文字 -
The State of AI Impact in Engineering: Q2 2026 — Justin Reock,The State of AI Impact in Engineering: Q2 2026(DX,Engineering Enablement 電子報,2026-07-22)。彙編時將證據等級從匯入時的
empirical更正為vendor-claim——詳見 Sources 中的 Source Notes 條目;簡言之,這是開發者生產力廠商為開發潛在客戶而發布的摘要,調查對象是自行選取、來自該廠商 500 多家客戶組織的樣本,混合自陳資料與 SDLC 遙測資料,而方法說明藏在本知識庫未持有的付費牆後 PDF 中。此處引用該文支持前述測量工具論點(開頭的對照組段落),以及自陳程式碼占比從 34% 升至 52% 的數字。這是網頁文章,沒有 docling 解析,因此不適用表格塌縮或表格位移的處理規則;網頁圖表皆為圖片,本知識庫引用的所有數字都出現在電子報本身的文字中。研究內容見 Acceleration Whiplash 與 AI as Primary Author -
AI-Augmented Human Resource Management? Insights from German companies — Kalff & Simbeck,arXiv 2607.13839(2026-07-15 / v2 07-20;
empirical,混合方法,N=410 位德國人資經理)。此處引用的是測量工具,而非研究內容:§3(調查設計與自陳限制)、§4.1(410 人中有 183 人非正式使用的發現,以及公司專用 AI「不能非正式使用」的界線)、§4.2(概念混淆——「未將機器學習系統……視為『真正的 AI』」——以及廠商和面對共同決策要求的企業雙向策略性使用 AI 標籤)、§5(明示的限制)。此文件在匯入時需進行字形層級修復——docling 將所有數字及 DOI/URL 標籤輸出為字形名稱(/two_os、/D_SC),之後以確定性的 1:1 替換還原,並再次對照 PDF 確認;因此,文中引用的每個數字都可追溯到該修復流程。Table 1 列位移,此處未引用;Table 2 已確認無誤。完整討論與互補因素解讀見 Organizational Complements to AI。 -
State of AI in the SOC 2026: 8 Key Takeaways — Ajmal Kohgadai(Prophet Security 產品行銷總監),State of AI in the SOC 2026: 8 Key Takeaways,2026-08-03(頁面 JSON-LD 標示 08-04)。證據等級為
vendor-claim,匯入時即已確認;儘管有明確樣本數且由第三方執行調查,仍未升級,原因依循上述 DX 先例,詳見 Sources。此處引用的是測量工具比較:n=250、31 個問題,由 ViB 篩選並執行調查,文章逐圖表標出樣本基數,方法和人口統計資料則藏在潛在客戶開發表單後,且賣方的產品正是調查結論所指向的產品。這是網頁文章,沒有 docling 解析,所有數字皆寫在文字中,而非圖表圖片。研究內容見 Autonomous Defense -
The state of AI in 2026: On the road to ROI — Dan Tinkoff、Lieven Van der Veken 與 Michael Chui,以及 Tara Balakrishnan,The state of AI in 2026: On the road to ROI(McKinsey / QuantumBlack,2026-08-25,
empirical,自陳資料;線上調查,97 個國家的 1,719 位受訪者,於 2026 年 5 月 4 日至 6 月 8 日進行,依 GDP 加權)。此處引用的是測量工具,而非研究內容:§「About the research」(樣本、調查期間、GDP 加權)、Exhibit 1 的定義變更註腳、Exhibit 6 的使用案例至職能提問變更、Exhibit 16 的預期/實現配對、Exhibit 5 的職級樣本基數(654 位 C-level/424 位主管或資深經理/217 位中階經理/195 位個別貢獻者),以及 Exhibits 3 和 16 中「不知道」的占比。這是網頁文章;18 個 exhibits 都是點陣化 SVG 圖表,匯入時逐一轉錄;Exhibit 11 沒有印出的標籤(依格線讀取,屬近似值,此處未引用)。**利益衝突:**McKinsey 銷售 AI 轉型顧問服務。 -
September 2026 Ramp AI Index: Cracks in the AI thesis, part 2 — Ara Kharazian,September 2026 Ramp AI Index: Cracks in the AI thesis, part 2(Ramp,2026-09-09;
empirical)。此處再次引用其測量工具,而非研究內容:延續跨廠商系列趨同的 8 月廠商占比,以及該期刊物自行揭露上修先前發布數字的情況,這就是前文所述印出後修訂特性的證據。利益衝突與抽樣限制同 7 月條目;測量工具頁面見 Ramp -
Adoption Telemetry: Measuring Enterprise AI Adoption from Production Signals — Damon A. Young(PolyWise Partners,唯一作者),Adoption Telemetry: Measuring Enterprise AI Adoption from Production Signals,arXiv 2608.23617(2026-08-22),23 頁,
practitioner-opinion。此處僅引用該文支持測量工具論點:§2.1–2.5(四種傳統與其中的缺口)、§3(定義及其四項特性)、§6.5(Goodhart;行為而非體驗)、§7(中立性)、§8.2(Microsoft 基準測試上限)、§8.6(感知作為領先指標)。**利益衝突:**這是一篇顧問公司提出測量工具的論文,而該公司的作者將會部署此工具,並以邀請設計夥伴作結。文中所有數值皆為合成或轉引資料——ActivTrak 數據來自參考文獻中的 PR Newswire 新聞稿,未對照底層報告查證;彙編時逐格對照pdftotext -layout,Table 1 完全一致。階段模型與驗證界線見 Pilot-to-Production Gap。 -
AI-to-AI Code Reviews of GitHub Pull Requests — Selvanayagam & Ghaleb(ÉTS Montréal / Trent),arXiv 2608.21311,2026-08-21,15 頁,ESEM 2026 Emerging Results track,
empirical。此處僅引用該文的 §3.2–3.3——S1/S2 特徵層級、排除分支名稱證據的決定,以及由此產生的隔離不對稱(4,563,819 個候選作者端 PR 中有 1,733,535 個,佔 38.0%;兩條審查串流各為 0.01%)——作為本頁定義門檻機制在產物探勘上的實例。彙編時已將全部五個表格逐一對照pdftotext -layout。完整討論見 Closed-Loop AI Review -
Normative boundaries of AI in scientific work: Evidence from PhD researchers — Angelini & Lyrvall(獨立研究者 / Inria),Normative boundaries of AI in scientific work: Evidence from PhD researchers,arXiv 2608.25678,2026-08-26,15 頁,
empirical。此處僅引用其測量工具:§3(五項舒適度問題、自行選取的 Nature Graduate Survey 2025 受訪者框架,共 3,785 人)、§4.1(AI 使用頻率作為態度類別的共變數),以及 §5.4(舒適度不等於正當性)。研究內容、四種輪廓與遙測矛盾見 AI Adoption in Scientific Work
Cited by 49
- Acceleration Whiplash×8
Three things this does and does not do for the hypothesis above. It confirms the shape — the input…
- Agentic Coding Work-Composition Shift×3
Telemetry Vs Survey Measurement — both studies measure behavior not feeling; this is the empirical…
- AI Product Economics Maturation×3
The margin story is projected, not banked. Notably this runs more optimistic than the measured…
- Autonomous Defense×3
Self-reported agreement is the only agreement measurement in the corpus, and only 32% of AI users…
- Faros AI×3
AI Engineering Report 2026: The Acceleration Whiplash — the paradox "sharpened into a crisis." See…
- Firm AI-Spend Intensity and Headcount Growth×3
Telemetry Vs Survey Measurement — a third measurement instrument: revealed AI-vendor spend linked…
- Outsource Your Thinking, Not Your Understanding×3
Telemetry Vs Survey Measurement — the reverse case to that page's thesis: here the instrumented…
- Ramp×3
Cited as a benchmark by a third party (2026-09-22). ICONIQ's 2026 State of Scaling uses the Ramp AI…
- The Under-Review Divergence: Faros's Widening Crisis vs. CMU's Convergence×3
The kicker is that Faros prescribes the very behavior CMU observes emerging organically. Faros's…
- AI Adoption in Scientific Work×2
The contradiction with the telemetry half of this page, which does not resolve cleanly. ATLAS's…
- AI and Market Power×2
On the diffusion level, and the instrument aperture. OECD ICT usage statistics put AI adoption at…
- AI Investment Story, Not Efficiency Story×2
Telemetry Vs Survey Measurement — the instrument-split lens for the AWS-vs-Emergence RPE conflict:…
- AI Native Product Cadence×2
Telemetry Vs Survey Measurement — the instrument problem behind "motion vs. progress": the readouts…
- AI Usage Cadences×2
Telemetry Vs Survey Measurement — same "measure the real system, at higher fidelity" instinct,…
- Anthropic Economic Index×2
Telemetry Vs Survey Measurement — the AEI is the case that resolves the dichotomy by linking usage…
- Community Smells Under AI Adoption×2
Telemetry Vs Survey Measurement — a rare instance of the instrument tension appearing inside a…
- Conversation-to-Delegation Shift×2
This is the same "measure what the system actually did, not the proxy" instinct as Telemetry Vs…
- The Enterprise AI Adoption Gradient×2
The wiki now carries five instrument families pointed at "how much AI are firms using," and they…
- Exposure Taxonomy: Observed, Theoretical, Reported, Anticipated×2
Where the older six are projections of what AI could do (per raters, patents, or rubrics), Steele &…
- Is Human Review of AI-Authored Code Still a Real Control, or Already Rubber-Stamping?×2
Telemetry Vs Survey Measurement — is the Faros–DORA "contradiction" partly a category error, both…
- Open Questions Backlog×2
Telemetry Vs Survey Measurement: Is there a non-vendor telemetry dataset large enough to adjudicate…
- The Open-Weight Frontier Gap×2
Telemetry Vs Survey Measurement — why the 5.8% is a floor-and-ceiling problem rather than a number:…
- Organizational Complements to AI×2
Telemetry Vs Survey Measurement — the instrument caveat that travels with the German HR evidence…
- Pilot-to-Production Gap×2
Telemetry Vs Survey Measurement — where the instrument argument lives. That page carries the same…
- Review as the Control Point×2
Telemetry Vs Survey Measurement — sharpens the methodology debate: this is the non-vendor telemetry…
- Usage-Telemetry Classifier Validation×2
Telemetry Vs Survey Measurement — telemetry beats self-report on latency and scale, but this page…
- What the Instrument Can Resolve: Two Headline Numbers and Their Missing Denominators×2
Telemetry Vs Survey Measurement — the instrument-weighting rule this page sharpens: randomization…
- Agent Documentation Behavior
Telemetry Vs Survey Measurement — trace telemetry taken to its honest limit: the authors refuse to…
- Agent-Generated Test Quality
Telemetry Vs Survey Measurement — where the missing human baseline both of these cuts report stops…
- AI as Primary Author
The ordering is the finding. For the overlapping period the self-reported figure is the lowest of…
- Carta
Telemetry Vs Survey Measurement — Carta is the vault's canonical receipts instrument in that split:…
- Closed-Loop AI Review
Telemetry Vs Survey Measurement — the mined-artifact version of that page's definition problem.…
- Compounding Data Moat
Telemetry Vs Survey Measurement — Faros Ai's cross-org SDLC telemetry is a compounding data asset;…
- When Knowledge Layers Disagree: Context Files vs Memory, and Conflicting Sources at Compile Time
Attach provenance and evidence tier to every claim; weigh by method and incentive, never average.…
- Controlled Variance: AI's Edge as Reduced Dispersion
Telemetry Vs Survey Measurement — the third instrument, and the only one that identifies causation.…
- Efficiency Debt of AI-Generated Code
Telemetry Vs Survey Measurement — a new instrument shape: first-party engineering telemetry with a…
- The Enablement–Regulation Axis
Telemetry Vs Survey Measurement — a ninth aperture: the elite-discourse text corpus. Not telemetry…
- Evals as Product Spec
Telemetry Vs Survey Measurement — Faros Ai's "measure what actually shipped, not how people feel"…
- Google AI & Economy ATLAS
Telemetry Vs Survey Measurement — ATLAS is a telemetry instrument that repeatedly checks itself…
- ICONIQ
Telemetry Vs Survey Measurement — ICONIQ is unusual in publishing on both sides of that split…
- Market-Priced AI Exposure (the AI Premium)
Telemetry Vs Survey Measurement — realized paid requests are the purest telemetry (behavior, not…
- AI Coding Practice
Telemetry Vs Survey Measurement — Perception lags reality: survey-based research (DORA) misses…
- Post-Acceptance Edit Behavior
Telemetry Vs Survey Measurement — a third instrument shape for that page's taxonomy: pre-commit…
- Procedural Value in AI Decisions
Telemetry Vs Survey Measurement — a fourth instrument for that page's ledger: a randomized…
- Production-Sourced Evaluation
Telemetry Vs Survey Measurement — Faros Ai's telemetry-over-survey stance is the…
- Psychological Costs of AI Adoption
Telemetry Vs Survey Measurement — a third instrument class with a distinct visibility profile.…
- Security Debt of Agent-Generated Code
Telemetry Vs Survey Measurement — why the matched human baseline this page keeps asking for is…
- Standardize the Infrastructure, Not the Tools
What does per-team AI usage analytics get used for once it exists — cost containment, capacity…
- Verification as the New Bottleneck
Discount appropriately. Both quantities are perception measures by DX's own definitions, from a…
Related articles
- Open Questions Backlog
Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…
- Verification as the New Bottleneck
Fiona Fung: coding is no longer the bottleneck — verification, review, maintenance are; shift-left; TDD loses its tax;…
- Acceleration Whiplash
Faros 2026: AI floods a human-paced SDLC with output it can't absorb — throughput up (tasks +34%, epics +66%), quality…
- Organizational Complements to AI
The general-purpose-technology argument: AI productivity gains depend on complementary workflow, skill, and org-design…
- Returns to Expertise in Agentic Coding
Anthropic's 400K-session study: domain expertise (not coding skill) is what amplifies an agent — experts get 2× the act…
