資料來源#
- Google's AI & Economy ATLAS v1.0: Mapping Gemini Usage in the Economy
- Voice AI in Firms: A Natural Field Experiment on Automated Job Interviews
問題#
-
關於 Controlled Variance: AI's Edge as Reduced Dispersion:+12% 的效果中,有多少來自資訊蒐集的變異受控,又有多少來自移除面試官中止面試的裁量權?人類招募人員有 25% 的機率在面試途中篩除應徵者,AI 則為 7%,這會在評估階段前機械性地壓低人類組的邀約率。可證偽的檢驗:在兩組都完成面試的子樣本中重新估計處置效果,或對篩除決策使用工具變數。論文報告了這兩個數字,卻從未拆解它們。
-
關於 Usage-Telemetry Classifier Validation:對三位數職業分類,人類評分者彼此有 42–48% 的歧異。是否有原則性的方法能確立分類器可達到的上限,讓準確率能相對於上限呈現,而不是相對於 100%?
這其實是同一個問題。兩個醒目數字都是以研究者主張、而非實際測量的分母來呈現的比率:+12% 的分母是所有隨機分派的應徵者,不知不覺把兩個階段合在一起(進入評估,以及在評估中勝出);22.6% 的分母是100%,這等於假設有一位評分者能達到這個水準。Q1 問的是修正分母後會如何;Q2 問的是如何測量分母。
簡答#
Q1——中止通道幾乎可以確定不是效果來源,而問題提出的修正方式才會讓它看起來像是來源。 兩組因提早終止而流失的面試比例幾乎相同(人類 43% vs AI 45%);不同的是組成——人類組的流失是招募人員依適配度發起的篩除,AI 組的流失則是由應徵者或機器發起,並非如此。只修正人類的篩除,效果會反轉為 −10%;只修正 AI 自身 12% 的技術失敗加拒絕通道,效果會升至 +27%;兩者對稱修正則得到 +16%,也就是效果依然存在且更大。論文數字足以界定通道範圍,卻無法拆解它,因為所需的兩項數據——以隨機分派為分母的各組可評估紀錄比率,以及提早終止面試者的邀約率——都未曾公布,而且篩除變數本身是未經驗證的 LLM 標籤。
Q2——可以,維基已記錄這個估計量:在相同項目、相同流程上計算留一標註者一致度。 ATLAS 已經蒐集了能算出此數值的標註資料(三位評分者,N ≈ 110–120),卻改用 1983/1992 年調查文獻中的上限。以這個借來的上限重新正規化後,職業標題層級的 42.5% 變成人類上限的 73–82%,而大類別層級的 71.6% 變成 85–94%。在 O*NET 任務粒度上,根本無法估計上限——ATLAS 自己就證明了這一點——因此它重新詮釋了合併類別這項緩解措施:合併人類也無法區分的類別,並非降低雜訊,而是提高上限。
第一部分——由論文自身算術界定的中止通道#
論文報告了什麼#
所有數字均取自論文內文(§3.1 與 §4.1)——見下方解析說明。
| 數量 | 人類 | AI |
|---|---|---|
| 隨機分派的應徵者 | 13,557 | 40,103 |
| 邀約 | 1,179 = 8.70% | 3,904 = 9.73% |
| 篩除(占面試比例) | 25% | 7% |
| 完整面試 | 39% | 42% |
| 失去互動 | 9% | 12% |
| 應徵者無法聯繫 | 9% | 14% |
| AI 技術性中止 | — | 7% |
| 應徵者拒絕 AI | — | 5% |
| 提早終止類型合計 | 43% | 45% |
| 剩餘類別(期待不符、其他、非英語) | 18% | 13% |
最後兩列是開放問題未預料到的發現,而且只是對 Controlled Variance: AI's Edge as Reduced Dispersion 已列數字做簡單加總。兩組在正常完成前流失的面試比例幾乎相同。 AI 組少了 18 個百分點的篩除,幾乎正好被失去互動(+3)、無法聯繫(+5)、技術失敗(+7)和拒絕(+5)的增幅抵銷。因此,介入措施並未減少中止面試的總量,而是改變了由誰決定中止,以及根據什麼資訊:人類組的終止由招募人員發起,並以明確說出的不合格原因為條件;AI 組則由應徵者發起或因機械因素發生,不取決於適配度。
這與「AI 蒐集到更好的資訊」或「我們移除了面試官提早放棄的選項」都大不相同;而這才是報告數字實際支持的說法。
三種單邊修正#
假設提早終止的面試不會產生邀約,並以仍在進行的面試比例重新計算邀約率。有三種可行的修正;它們的結果差異極大,而採用哪一種正是整個問題的關鍵。
| 修正方式 | 人類 | AI | 效果 |
|---|---|---|---|
| 不修正(已發布的 ITT) | 8.70% | 9.73% | +1.03pp,+12% |
| 只移除人類篩除(問題提出的方式) | 8.70/0.75 = 11.60% | 9.73/0.93 = 10.47% | −1.13pp,−10% |
| 只移除 AI 技術失敗+拒絕 | 8.70% | 9.73/0.88 = 11.06% | +2.37pp,+27% |
| 兩組都移除所有提早終止類型 | 8.70/0.57 = 15.26% | 9.73/0.55 = 17.70% | +2.44pp,+16% |
由此可得三點。
問題提出的重新估計方式並不對稱,而這種不對稱正是效果符號反轉的原因。 以「人類招募人員沒有篩除這位應徵者」為條件,卻把 AI 組中 12% 當掉或遭拒絕的面試留在分母裡,等於修正了一組的中止,卻沒有修正另一組。若對 AI 組自身的失敗通道採取同樣做法,效果會增加一倍以上。兩個數字都不是估計值;它們是單邊敏感度分析的兩端。
對稱修正才站得住腳,而且會讓效果上升。 將兩組都限定為正常完成面試——這是目前最接近「兩組都完成面試的子樣本」的做法——得到 +16%,高於已發布的 +12%。原因就是前述組成差異:人類組的中止排除了因未達要求而被挑出的應徵者,他們在反事實情況下獲得邀約的機率很低,因此從分母移除他們會大幅提高人類組的比率,卻很少增加原本可能得到邀約的人;AI 組的中止則排除了聯繫不上、沒興趣,或剛好遇上軟體問題的應徵者,他們在反事實情況下獲得邀約的機率接近平均值,因此在 ITT 中,AI 組確實為這些人付出了代價。論文非正式地承認了這點——+12% 是扣除組內 12% 失敗率後的結果(Controlled Variance: AI's Edge as Reduced Dispersion)——卻從未把它帶入算術計算。
這些條件全都取決於一個處置後變數,因此都不是任何因果效果的估計。它們只能界定這個通道可能造成多大影響,無法辨識其實際效果。問題提出的第二種方法——對篩除決策使用工具變數——仍是唯一能做到這一點的設計。
損益兩平界限#
已發布數字所容許計算的最簡潔單一數字。令 r 表示那些因差異性篩除而被排除的應徵者,若面試完成,他們原本會獲得邀約的比率。篩除比例相差 18 個百分點,因此中止通道對人類組缺口的貢獻為 0.18 × r 個百分點。令它等於實測的 1.03 個百分點:
r* = 1.03 / 18 = 5.8%——相當於人類組自身基準邀約率 8.70% 的 66%。
因此,只有在以下條件成立時,中止通道才會解釋全部處置效果:人類招募人員篩除、但 AI 不會篩除的應徵者,獲得邀約的機率約為一般應徵者的三分之二。通道所占效果比例為 r / 5.8%:若 r = 1%,占 17%;若 r = 3%,占 52%;若 r = 8.7%,占 152%。
r 有可能高到這個程度嗎?論文自身的分類手冊指出不太可能。三種篩除類型都是以不符合不可妥協的條件來定義——舉例包括地點、薪資期望、簽證狀態、與學校計畫衝突,以及不符合再次聘用資格(附錄 E.1 與 J.3 的分類器提示)。不符合公司不可妥協要求的應徵者,依定義而言,反事實邀約機率接近零,因此 r 遠低於 5.8%,通道所占比例也遠低於 100%。讓問題仍未解決的反方理由是:Late Screen-Out 指面試「幾乎進行到結束」,主題數 ≥ 8 後才未通過最後一項標準。這描述的是在大部分對話中看來都符合聘用條件的應徵者。論文只報告合併後的 25%/7%,從未公布提早/中途/延後篩除的拆分,所以延後篩除——也就是高 r 的部分——占篩除總數多少,仍未公開。
兩項未公布的數據#
拆解分析恰好需要論文未提供的兩項資料;對已報告內容做再多算術,也無法取代其中任何一項:
- 以隨機分派的應徵者為分母計算各組可評估紀錄比率。 25%/7% 是以面試逐字稿為分母計算——兩組合計 34,109 份,明確屬於「所有已進行面試的一個子集」;而這兩組中有 53,660 位隨機分派的應徵者。以上所有修正都假設逐字稿樣本具代表性,且兩組將隨機分派應徵者轉為已進行面試的比率相同。第二個假設在已知方向上值得懷疑:AI 代理程式全天候可用,並把從表達興趣到面試的中位時間由 0.51 天降至 0.32 天(Controlled Variance: AI's Edge as Reduced Dispersion),因此 AI 組很可能讓更多分派到該組的人接受面試。這個差異完全落在 ITT 分母之內,在已發布的表格中看不出來。
- 按組別與終止類型區分的提早終止面試邀約率。 公司掌握這項資料——邀約屬於行政紀錄——而這正是決定
r的關鍵。
更深層的問題:拆解分析所用的變數,是未經驗證的 LLM 標籤#
這是 Q1 與 Q2 交會之處,也是答案只能部分成立、而非只是尚未完成的原因。
25%/7% 的篩除拆分不是行政欄位,而是 LLM 分類器的輸出:原始逐字稿先由 gemini-2.0-flash 預處理,以標記說話者並移除 PII,再由結合角色框架、chain-of-thought 和情境內範例的提示,分類為十種互斥的面試類型(附錄 E.1,提示見 J.3)。論文沒有報告任何準確率數字、人類一致度統計、κ 值或錯誤分析。這正是 Usage-Telemetry Classifier Validation 要檢視的工具;它對論文機制分析的半邊論證至關重要,但對讀者只做了概括性的驗證——這與該文已指出的 AEI 和 OpenAI 分類器公開資訊不對稱相同。
兩項特定缺陷使這些標籤的問題不只是未經驗證而已:
分類手冊要求出現一句 AI 在結構上可能永遠不會說的話。 所有三種篩除類型都帶有以下規則:「招募人員說明因不合格而結束通話的原因」,並以*「若通話結束時招募人員沒有結語,[Screen-Out] 不適用」*加以強化。論文從未說明 AI 語音代理程式是否獲得了因不合格而終止面試的權限或指示——只說它「經提示遵循相同的結構化面試指引」。如果沒有,那麼 7% 衡量的並非代理程式選擇不執行中止,而是代理程式根本沒有中止操作;原本會被歸為篩除的事件,就會落入失去互動、無法聯繫或其他類別。人類組的剩餘類別占 18%,AI 組則為 13%,所以缺失的部分並未全塞在那裡;但不論如何,這個標籤都依賴口頭說出的不合格理由,是一種與處置相連的定義。
分類手冊以一個會受處置影響的變數設門檻。 失去互動定義為 topic_count < 8;完整面試定義為 topic_count ≥ 8;三種篩除層級則按主題數區間區分(0–2/3–7/≥8)。處置使平均主題涵蓋率由 38% 提升至 45%(Controlled Variance: AI's Edge as Reduced Dispersion)。因此,涵蓋率分布右移會機械性地使機率質量跨過這些門檻。完整面試增加 3 個百分點(39% → 42%;論文自身 Table B.10 中為 +2.99pp/+4.82pp),大致只是 +7 個百分點涵蓋率變化的離散化結果,而非對它的獨立佐證——提早/中途/延後篩除的組成也會被同樣的算術推動。
這是經濟學論文中的 LLM-Judge Validation 缺失步驟問題,而不是評估工具組的問題:分類器沒有分層檢驗、沒有經過驗證,且其決策規則與處置相關。要妥善回答 Q1,必須先驗證分類器;因此 Q2 不是平行問題,而是 Q1 的前提。
第二部分——確實有原則性的上限,而且 ATLAS 有資料可以計算#
估計量:對同一批項目計算留一標註者一致度#
這種有原則的方法並不新鮮,語料庫中已有實例。LLM-Judge Validation 中,Yang et al. 以留一標註者法的人類上限校準評審:每次留下一位標註者,根據其他人的標籤預測其標籤,再用完全相同的程序、在完全相同的項目上評分模型。結果以比率而非原始數字呈現——PandaLM 最佳評審相對於 0.920 的人類上限達到 κ = 0.753(仍有進步空間);Judge's Verdict 最佳評審的 κ = 0.620,則高於 0.562 的人類上限,也就是評審超越了人類;這說明的是標籤,而非評審本身。
這正是 Q2 想要的答案,而且ATLAS 已經蒐集了所需資料。其附錄 B.3.1 讓三位內部標註者評估 N ≈ 110–120 個群集,並針對 SOC Major Group 報告模型相對於人類多數決共識的 Cohen's κ(0.83,Manski 界限 [0.75–0.85]),同時報告僅人類評分者之間的成對 κ(0.66)與僅人類的 Fleiss κ(0.68)。兩者之間只差最後一步:
- 模型對三人多數決,比人類對人類的成對比較容易。 與評分者小組的共識一致,不等於與隨機抽取的一位評分者一致;從這兩欄數字讀出「0.83 > 0.68,模型勝過人類」,正是留一法設計要避免的比較。ATLAS 的文字敘述很謹慎(「表現與人類相當(甚至可能更好)」);數字卻容易讓人作出更強的解讀。
- 修正不需要額外標註。 每個群集有三位評分者,根據現有資料就能計算留一法:先以另外兩位的多數決評估每位人類,再以同一組兩人多數決評估模型。只需重新計算一次,ATLAS 不可比較的一對數字就能轉成 Q2 所需的比率。
同一頁中的第二種工具:LLM-Judge Validation 對 Shopify Sidekick 的介紹,在分類器存在之前就先估計上限:由實際標註者依實際評分規準,針對實際流量進行評估——兩位專家盲標 25 個正式環境樣本,以 Cohen's κ 記錄一致度,而 κ ≈ 0.2 是重寫評分規準的觸發值,不是及格線。之後才讓評審以該數字為目標,而非 100%(「目標不是打造『完美』的評審,而是讓它與人類的吻合程度,大致等同人類彼此的吻合程度」;報告的人類一致度為 83%,評審則為 80%,圖表並註明「無法達到完美」)。ATLAS 的對照正是重點:ATLAS 的上限是取自文獻(Mellow & Sider 1983、Mathiowetz 1992),Shopify 的上限則是在任務上測量。借來的上限只告訴你上限存在;實測上限才告訴你何時該停止最佳化。
這項做法的一般形式,見於 Matched Comparisons for Memorization Claims:用基準修正原始比率,而這個基準過去被領域假設為零。該文中,被假設為零的是非訓練資料上的生成率;這裡則是人類錯誤率。兩種修正幅度都很大,而且兩者的原始數字若沒有修正,都無法解讀。
重新正規化,實際計算#
使用 ATLAS 自己借來的上限——在一位數與三位數職業分類層級,勞工與雇主歧異率分別為 17%/24% 和 42%/48%——並以 (accuracy − chance) / (ceiling − chance) 呈現,也就是經機率修正後,可達範圍中的占比:
| 層級 | 類別數 | 機率基準 | 準確率 | 人類上限 | 重新正規化 |
|---|---|---|---|---|---|
| SOC Major Group | 23 | 4.35% | 71.57% | 76–83% | 85–94% |
| SOC Occupation Title | 1,016 | 0.10% | 42.47% | 52–58% | 73–82% |
| O*NET Specific Tasks | 18,797 | 0.005% | 22.58% | 不存在 | 無法計算 |
因此,「分類器有 42.5% 的機率能正確指派確切職業標題」會變成「分類器找回了約四分之三至五分之四的人類上限,也就是在人類以相近粒度編碼職業時所達到的一致度」——同一套流程,說法卻不同,也更能回答這些經濟分析是否可用。
有三項但書,三者都指向同一件事:這只是示範性的重新正規化,不是經驗證的數值;目的在於展示報告形式應該如何呈現,而非提供確切數字。
- 粒度不一致,而且方向明確。 1,016 個 SOC 職業標題,比測量 42–48% 歧異率時所用的三位數人口普查職業分類更細;23 個 SOC 大類則比 Mellow & Sider 時代的 11 類一位數分類更粗——ATLAS 自己也指出了這個不一致。因此,兩個借來的上限都對應到較低粒度,套用到目前層級時會過於高估,所以兩個重新正規化數字都會低估分類器在可達範圍中的占比。
- 母體和任務不一致。 準確率數字來自 18,801 段合成、由 Gemini 生成的對話;上限則來自 1980 至 1990 年代的美國家戶調查,當時由勞工與雇主各自描述工作。評分者、任務、證據與分類法版本都不同。用一者除以另一者只是合理性檢查,不是估計值——這也正是留一法設計的理由:上限與分數都來自同一批項目。
- 合成資料但書兩面皆成立,ATLAS 也有說明:由 Gemini 生成的提示再由 Gemini 分類器分類,可能包含可還原的線索(使準確率膨脹);也可能是提示本身確實比其種子標籤更適合另一類別(使準確率降低)。
核准率不是上限,也無法變成上限#
一個看似方便的捷徑,是把 85.8% 的人類核准率當成上限,計算 22.6/85.8;但這是錯的,而且其機制已由語料庫精確測量。
核准評分會問評分者「這個標籤是否站得住腳?」並向他展示標籤。盲標則要求評分者自行產生一個標籤。ATLAS 自己的資料量化了兩者差異:在最高的分類層級,評分者核准率比模型對多數決一致度高 11–15 個百分點;報告指出原因是「評分者[可以]在沒有提示時選擇不同選項,但若有人提供另一選項,仍會同意它」。Reference-Free Judge Over-Crediting 在評審情境中衡量了這種效應的極端案例——要求評分者先自行作答、再看候選答案,能將相同文字上的假陽性率由 0.719 降至 0.012;而 LLM-Judge Validation 已指出人類評估中缺少的控制方式:「讓部分標註者先盲標,再揭露評審的判定,並分別報告兩組數字。」
因此,Q2 並置的兩個數字本來就不在同一尺度上:42–48% 的歧異率是盲測統計(兩方各自獨立描述同一份工作),而 85.8% 的核准率是有錨定的統計。核准率只能說是與驗證者分類器一致度的未知緊密程度上限,不是分類準確率的上限。
上限可證明無法測量之處——這是答案的一部分,不是答案的缺口#
ATLAS 不報告低於 ATUS Tier 2/SOC Minor 層級的評分者間一致度,並在 B.3.1 提出統計理由;這個理由也適用於任何嘗試測量 O*NET 任務層級的研究:當候選類別數遠多於評分觀察數時,數百或數千個未抽樣類別不會對預期機率一致度有所貢獻,因此 p_e 會被高估、κ 會被低估;更糟的是,若各類別的一致度不同,只涵蓋極少數類別的樣本,就無法提供母體資訊,計算出的 κ 會受恰好抽到哪些類別所左右。
這是證明,不是預算限制。任何可行的標註研究,都無法為 18,797 個 O*NET 任務陳述確立人類上限,所以 22.58% 沒有可報告的分母,也不會因為多花錢請評分者而出現。由此可得兩個結論:
- 在這種粒度上,誠實的報告方式就是 ATLAS 實際採用的說法——核准率與準確率是信心的界限,確切指派率則是「不應過度依賴超具體任務分析的警示」。重新正規化的數字只會是捏造。
- 彙總是介入上限的作法,不是降低雜訊的技巧。 ATLAS 發布的三項緩解措施看似是錯誤管理,但在這套框架下會有不同解讀。將確切任務映射至 Autor–Thompson 任務類型,能把 22.58% 提升至 70.44%;在只有 5 個類別、機率基準為 20% 的層級上,一致度研究便可行。合併分類法基於非經濟理由拆分的類別——例如按目的區分旅遊,以及家戶內外的照護——能將 ATUS Tier 2 準確率從 42.9% 提升至 51.7%,Tier 3 則從 23.7% 提升至 32.4%。這些合併正好針對使用者沒有經濟理由要揭露的區別;換言之,人類評分者閱讀同一段對話時也無法做出區分。合併類別會同時提高上限與準確率。 上限是類別系統的屬性,不是分類器的屬性——因此「相對於上限報告準確率」和「合併沒有人能用現有證據區分的類別」是同一項介入的兩種說法,只有前者能告訴你何時該停止。
由此推得的報告標準#
對任何輸出承載經濟主張的分類器:
- 以機率修正後的一致度(κ 或 α)作為醒目數字,而不是完全匹配率——LLM-Judge Validation 的發現 1,不變。
- 以留一標註者法,報告在相同項目、依相同流程測得的人類上限。三位評分者就不需要新增標註。
- 將準確率報告為可達範圍中的占比:
(observed − chance) / (ceiling − chance)。 - 分別報告盲測與有錨定的驗證者數字;絕不可將核准率當作上限。
- 若在報告粒度上無法估計上限,就明說並彙總到可估計的層級——並將彙總視為提高上限,而非掩蓋錯誤。
ATLAS 實際上已做到步驟 1、4、5。步驟 2 有資料可做,卻沒有計算。語料庫中沒有人執行步驟 3。
第三部分——將兩個問題合而為一#
兩個問題都是同一種失誤:醒目比率的分母未經測量便被假設,而且這個假設不易察覺,因為分母看起來像自然常數。
- 「所有隨機分派的應徵者」看似是隨機實驗的中性分母;對 ITT 而言確實如此。但主張一旦從指派 AI 面試官會發生什麼事轉向為什麼會發生,它就不再中性,因為邀約率此時合併了設計刻意分開的兩個階段,而且兩組進入第二階段的方式不同。
- 「100%」看似是準確率數字的中性分母。但只要人類對標籤有 42–48% 的歧異,它就不再中性。
兩者的修正方式相同:使用相同工具,在相同樣本上測量分母。 Q1 需要的是以完成面試為條件的子樣本——公司有資料,論文未報告。Q2 需要的是留一法人類上限——ATLAS 已蒐集資料,卻未計算。兩種情況的修正都以 LLM 分類器經過驗證為前提,因此 Q2 的答案是 Q1 的先決條件。
這也正是 Telemetry vs. Survey Measurement 已提出規則的精確版本——依工具能看見的內容替工具賦予權重。隨機分派比遙測和調查更上一層,因為它能辨識反事實;Jabarian & Henkel 的設計是知識庫中唯一的實例。但它只辨識指派對比。除此之外的一切——哪個通道、哪個階段、為什麼——都仰賴與遙測研究相同的觀察性、分類器介導證據,且帶有同樣未量化的誤差範圍。隨機實驗不會提升其中工具的可信度。
對兩個問題的判定#
Q1——部分回答;仍未解決。 已確定的是:中止通道的影響有界;對稱的完成條件修正會使效果升至 +16%,而不是下降;−10% 的符號反轉,是只修正一組中止而不修正另一組所造成的假象。r* = 5.8% 的損益兩平值,以及以不可妥協的不合格條件定義篩除的分類手冊,都表示這個通道不太可能承載全部效果。尚未確定、且無法從已發布資料得知的事項包括:r 本身、提早/中途/延後篩除的拆分、以隨機分派分母計算的各組可評估紀錄比率,以及 AI 代理程式是否根本具有中止操作。整個拆解分析所依賴的工具——十類 LLM 面試類型分類器——沒有已發布的驗證結果,而且以一個會受處置影響的變數設門檻。
Q2——已回答。 可以:在相同項目上使用留一標註者一致度,並以 (observed − chance) / (ceiling − chance) 報告準確率;ATLAS 自身的標註資料已足以計算。示範性重新正規化結果為職業標題層級的人類上限 73–82%,大類別層級為 85–94%,但須注意前述借用上限的但書。若類別數多到任何可行的一致度研究都無法處理——例如 ONET 的 18,797 個任務——就無法估計上限;這本身也是答案的一部分:可行的方法是彙總至能估計上限的層級,而這種彙總就是修正上限*。
解析說明#
依照 _system/compiler-prompt.md 的 PDF 表格處理原則,除非另有註明,上述數字都引自內文,且各表列都先經過核對。
- Jabarian & Henkel。 所有邀約、留任、篩除和面試類型數字都取自 §3.1 與 §4.1 的內文;分類手冊定義取自附錄 E.1 與 J.3 的逐字分類器提示。Table B.10(處置對「面試是否完整」的效果)僅用作佐證,而且有table-collapse:兩個標籤列被焊接成一列(
Mean DV in Human Interviewer Controls and fixed effects | 0.3879 - | 0.3880 Yes)。數值可以還原,且與內文相符——人類平均值 0.3879 加上 +0.0299 係數得到 41.8%,符合內文的 39%/42%——因此只以核對後的形式引用該列。Controlled Variance: AI's Edge as Reduced Dispersion 已記錄的損毀 Table 1、B.5 Panel B 與 B.6 在此未使用。 - 在把涵蓋率百分比換算成主題數前,須注意一項定義上的細節: §4.2 描述 14 個指引主題,但附錄 E.2 將主題涵蓋率定義為已涵蓋主題數除以最多 15 個主題(14 個主題加上「其他」類別)。38%/45% 的百分比不受影響;但依採用的分母不同,推算的主題數相差約 7%,而這很重要,因為面試類型分類手冊以原始主題數 8 設門檻。
- ATLAS。 Table 5(按分類層級的準確率)解析無誤——每層一列、儲存格彼此獨立——且與內文「SOC 大類準確率接近 72%……在較細的 SOC 小類仍高於 57%」一致。Tables 6 和 7 解析無誤,N 欄也完整。一項核對結果與本文論點有關:B.3.1 內文針對 SOC Major 報告「多數決一致 κ 為 0.83,Fleiss' κ 為 0.69」,其中 0.69 是 Table 6 中含 LLM 的 Fleiss 值,不是僅人類評分者的數值;後者為 0.68。若把內文數字當成人類上限,就會讓模型落在一個已包含模型本身的上限之內——這正是留一法要排除的循環論證。
資料來源#
- Voice AI in Firms: A Natural Field Experiment on Automated Job Interviews — Jabarian & Henkel,Voice AI in Firms: A Natural Field Experiment on Automated Job Interviews,arXiv 2607.28222(2026-07-30),
empirical,預先註冊(AEA RCT #15385)。§2.4–2.5(設計、組別、隨機分派數量;AI 代理程式的提示只描述為「相同的結構化面試指引」)、§3.1(邀約/開始/留任率與人數、依接受邀約條件篩選的樣本)、§4.1(面試類型分類與 25%/7% 篩除比例;34,109 份申請的逐字稿涵蓋率被描述為「所有已進行面試的一個子集」)、§4.2(主題涵蓋率 38%/45% 與每位招募人員的基準)、§7(招聘時間拆解)、附錄 E.1 + Table E.1(十種面試類型及其主題數與時間區間)、附錄 E.2(主題涵蓋率以 15 個主題定義)、附錄 J.1–J.3(gemini-2.0-flash 預處理、面試類型分類提示及其中的「招募人員說明原因」與「沒有結語」規則)。完整證據說明、揭露內容和解析警示見 Controlled Variance: AI's Edge as Reduced Dispersion。 - Google's AI & Economy ATLAS v1.0: Mapping Gemini Usage in the Economy — ATLAS v1.0,附錄 B:分類器驗證。B.1(Mellow & Sider 1983 的 17%/42%、Mathiowetz 1992 的 24%/48%;歧異早於 AI 的論點)、B.2 + Table 5(各層級準確率與機率基準;93.7% 工作/非工作閘門;合成資料的雙向但書)、B.2.2(結構化混淆;合併類別帶來 +8.8pp/+8.7pp 的增幅)、B.3.1 + Table 6(三位標註者,N ≈ 110–120;模型對多數決 κ、僅人類的成對與 Fleiss κ;明確拒絕在更細層級計算 κ 及其理由)、B.3.2 + Table 7(核准研究、單一是/否問題,以及核准率高於多數決 11–15pp 的差距)。完整討論見 Usage-Telemetry Classifier Validation 和 Google AI & Economy ATLAS。
- Controlled Variance: AI's Edge as Reduced Dispersion — 對實驗的完整討論:+12%/+18% ITT 結果、AI 組內 12% 失敗率、變異主張的雙峰性但書、招募人員折扣信號的結果,以及既有解析警示。
- Usage-Telemetry Classifier Validation — 準確率與核准率的差距、彙總與存在而非頻率的緩解措施,以及本文所回答的上限問題。
- LLM-Judge Validation — κ 的縮減(完全匹配率會高估 κ 33–41pp);Yang et al. 的留一標註者人類上限校準(PandaLM 為 0.753,相對於 0.920;Judge's Verdict 為 0.620,相對於 0.562);Shopify Sidekick 在評審之前估計上限的流程(專家盲測組合、κ ≈ 0.2 作為重寫觸發值、人類 83% 對評審 80%);以及認可與預測的不對稱,和先盲測再揭露的修正方式。
- Reference-Free Judge Over-Crediting — 錨定效應幅度:先承諾再去錨定,能使評審對相同文字的假陽性率從 0.719 降至 0.012,說明核准率為何不能充當上限。
- Matched Comparisons for Memorization Claims — 修正的一般形式:在用相同程序測量領域假設為零的基準前,原始比率無法解讀。
- Telemetry vs. Survey Measurement — 本文進一步說明的工具加權原則:隨機分派只能辨識被指派的對比,除此之外皆不能;因此隨機實驗內的機制分析,仍受其所用分類器的誤差範圍影響。
Cited by 9
- Controlled Variance: AI's Edge as Reduced Dispersion×3
The paper folds this into the standardization story. It is worth naming separately, because it is a…
- Usage-Telemetry Classifier Validation×2
What The Instrument Can Resolve — supplies the ceiling this page asks for and renormalizes against…
- LLM-Judge Validation
What The Instrument Can Resolve — the human-ceiling step, promoted from an aside to a reporting…
- Matched Comparisons for Memorization Claims
What The Instrument Can Resolve — this page's correction generalized into a reporting standard for…
- AI Economics & Labor
What The Instrument Can Resolve — Answers two open questions as one: the +12% AI-interview offer…
- Open Questions Dashboard
Controlled Variance: How much of the +12% is controlled variance in information collection versus…
- Open Questions Backlog
Controlled Variance: How much of the +12% is controlled variance in information collection versus…
- Reference-Free Judge Over-Crediting
What The Instrument Can Resolve — where that observation becomes a load-bearing constraint on…
- Telemetry vs. Survey Measurement
What The Instrument Can Resolve — the bound on this page's third rung. Randomization identifies the…
Related articles
- Usage-Telemetry Classifier Validation
Google ATLAS is the first AI-usage-economics program to publish accuracy numbers for the LLM classifiers every such stu…
- Controlled Variance: AI's Edge as Reduced Dispersion
Jabarian & Henkel (arXiv 2607.28222): a pre-registered natural field experiment randomizing 70,884 job applicants betwe…
- Exposure Taxonomy: Observed, Theoretical, Reported, Anticipated
Four distinct ways to measure AI's reach into an occupation — observed exposure (tasks seen done with Claude), theoreti…
- LLM-Judge Validation
UC Berkeley's 21-judge / 9-provider / ~541K-judgment audit (Norman et al., 2026): LLM-as-a-judge validation is systemat…
- Open Questions Backlog
Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…
