資料來源#
- Do job seekers value procedure in AI hiring only for error correction? Evidence from a conjoint experiment
- Normative boundaries of AI in scientific work: Evidence from PhD researchers
摘要#
幾乎每一篇關於 AI 系統中人類參與的 wiki 頁面,都是從操作者的角度論證——準確度、問責、監督完整性、誰該承擔責任。本頁則站在另一端:被系統評斷的人想要什麼,以及為什麼。
Do job seekers value procedure in AI hiring only for error correction?(Chuyao Wang、Patrick Sturgis、Daniel de Kadt——LSE Methodology / LSE Data Science Institute / Cornell,arXiv 2609.16390,2026-09-14,32 頁,empirical)以預先註冊的配對檔案聯合實驗作答:1,919 位美國求職者,每人進行八次強制選擇,共 30,704 個檔案,六項屬性各自獨立隨機化。研究設計的貢獻在於將程序與績效正交地變動。先前申請人反應研究會固定績效,或讓受訪者置身決策之外,成為第三方觀察者——而第三方的反應與受評對象不同(Langer & Landers 2021)。此處受訪者正是系統拒絕的人。
兩項重要發現:
- 誰來決定,比任何程序特色都重要。 人類參與的合併價值使選擇機率增加 +0.272,與基準值在統計上無法區分:將錯誤拒絕率從 30% 降至 10%(+0.285;差異 95% CI [-0.007, 0.033])。
- 程序價值不隨錯誤增加而上升。 系統拒絕 10% 合格申請人時,申訴、選擇退出與偏誤稽核的價值,和拒絕 30% 時相同——這是以預先註冊的等效性檢定確立,而非未能拒絕虛無假設所得。
兩者共同限制了一種簡單的錯誤修正解釋,用以說明人們為何想要程序。若申訴的價值在於糾正錯誤,錯誤率愈高,其價值理應愈高。但實際上完全沒有變化。
研究設計#
| 屬性(分析名稱) | 顯示的層級 | 螢幕標籤 |
|---|---|---|
| 決策權 | AI 提出建議,人類決定 / AI 先篩選申請人,人類決定 / AI 單獨決定(參照組) | 「決策流程」 |
| 錯誤率 | 錯誤拒絕約 10% / 20% / 30% 的合格申請人 | 「準確度」 |
| 解釋 | 未提供解釋(參照組) / 有意義的解釋 | 「透明度」 |
| 選擇退出——從一開始就有人類選項 | 無法選擇(參照組) / 可選擇 | — |
| 申訴——遭拒後由人類重新審查 | 無法申訴(參照組) / 可申訴 | — |
| 獨立偏誤稽核 | 未提供(參照組) / 提供 | — |
各層級獨立且均勻隨機化,但兩個檔案至少須有一項屬性不同;每項任務的屬性列順序皆隨機化,並在一對檔案中保持固定;同時記錄任務位置。估計方式是對二元選擇進行 OLS,標準誤按受訪者群組化,並報告相對於指定參照組的 AMCE 與邊際平均數。主要模型將錯誤率編碼為連續變數,因此登錄的調節項等於 30% 與 10% 兩個端點的差異——邊際平均數的變化幾乎等距(0.642 / 0.499 / 0.357),論文據此採用線性編碼。
此處所稱的「人類參與」是決策權限,不是審查。 兩種人類參與層級都由人類做最後決定;差異在於 AI 是否先行篩選(人類看不到遭拒的申請),或只提出建議(人類能看到所有申請)。兩者都不是寬泛意義上的「人類審查 AI 輸出」——論文明確指出,加入一名監督者是另一種安排,這也解釋了為何研究結果不同於 Yurrita et al. 的貸款情境實驗:其中監督者完全沒有改變結果。
預先註冊與探索性分析之間的差別,會在下文發揮實際作用(分析前計畫於 2026-06-17 張貼至 OSF,早於檢視資料;倫理審查通過日期為 2026-05-28;複現程式碼已發布):
- 確認性分析家族——僅四項屬性:人類參與、申訴、選擇退出、偏誤稽核。解釋特意排除在其中,另行測量與報告。
- 確認性假設:H1a(各項皆提高選擇機率)、H1b(人類參與效果最大)、H2a/H2b(其價值是否隨錯誤率上升?以等效性檢定測試)、H3(有人類參與時,申訴與選擇退出的價值上升)、H4(偏誤稽核的排序低於三項個別屬性)。
- 探索性/未註冊分析:四項特色 × 人類參與的交互作用聯合估計(僅申訴與選擇退出已註冊)、「AI 提出建議」與「AI 先行篩選」兩者 × 錯誤率的對比、年齡與性別調節項、異質性模擬,以及選擇退出 × 人類參與交互作用的事後等效性檢定。論文附錄 I 是一份明確的偏離紀錄——相當坦率,因為它記錄一項已註冊的方向性檢定未通過,且研究者沒有暗中將其改寫成等效性主張。
偏好階梯#
選擇機率的 AMCE,全部 p < 0.001(正文 §4.1 與圖 1 列印了相同數值標籤,無須從格線讀值):
| 屬性 | AMCE | 95% CI |
|---|---|---|
| AI 提出建議,人類決定 | +0.287 | [0.273, 0.301] |
| AI 先行篩選,人類決定 | +0.257 | [0.244, 0.271] |
| (人類參與合併值) | +0.272 | [0.260, 0.284] |
| 申訴(重新審查) | +0.156 | [0.145, 0.167] |
| 選擇退出(從一開始就由人類處理) | +0.129 | [0.118, 0.140] |
| 解釋 | +0.128 | [0.118, 0.139] |
| 獨立偏誤稽核 | +0.068 | [0.058, 0.079] |
| 錯誤率,每增加 1 個百分點 | -0.014 | [-0.015, -0.014] |
這個交換比是論文中最值得引用的數字。 錯誤拒絕率相差 20 個百分點——涵蓋整個測試範圍——能帶來 +0.285。加入一位人類決策者則帶來 +0.272。兩者差異在統計上無法與零區分(95% CI [-0.007, 0.033])。雇主若以更準確的機器取代人類決策者,交換比大致是一比一,很難說明顯占優勢。
人類參與內部的安排順序也很重要。 受訪者偏好「AI 提出建議,人類決定」,勝過「AI 先篩選申請人,人類決定」0.030(p < 0.001)——這符合程序正義理論:當 AI 被賦予的決策權超過人們認為其能力所能支撐的程度時,程序正義感會下降(Jiang et al. 2023)。只有第一種安排會讓人類看見 AI 原本會拒絕的申請;這正是遭錯誤拒絕者在意的安排。然而探索性檢定發現,這項差距不會隨錯誤率變化(整個範圍內變化 +0.005,95% CI [-0.026, 0.036])。即使人類參與有明顯工具性解讀的部分,表現仍非工具性。
支撐論點的虛無結果,以及它為何是精確的虛無結果#
交互作用未達顯著,不代表調節幅度可忽略,因此 H2 預先註冊為兩個單尾檢定的等效性程序(α = 0.05,也就是 90% CI 落在界限內),並採用選擇機率尺度上預先指定的 ±0.05 界限——作者願意稱為實質上可忽略的屬性效果最大變化量。
| 屬性 | 10-30% 範圍內的調節效果 | 90% CI | 在 ±0.05 下是否等效? |
|---|---|---|---|
| 申訴 | +0.001 | [-0.020, 0.022] | 是(在 ±0.03 下亦是) |
| 選擇退出 | +0.005 | [-0.016, 0.026] | 是(在 ±0.03 下亦是) |
| 解釋 | +0.010 | [-0.011, 0.030] | 是(在 ±0.03 下不成立:上界 +0.0304) |
| 偏誤稽核 | +0.012 | [-0.009, 0.032] | 是(在 ±0.03 下不成立:上界 +0.0323) |
| 人類參與 | -0.046 | [-0.067, -0.025] | 否(需要 ±0.07) |
若「沒有影響」這項主張要有參考價值,就得呈現這種樣貌。90% 信賴區間寬約 ±0.021——足以偵測到偏誤稽核本身主要效果一半的調節幅度。申訴是最具診斷力的案例:四項中,它的矯正功能最直接(遭拒的申請人可藉此要求人類重新審查),依錯誤修正說法預期斜率最陡,估計斜率卻是 +0.001。錯誤修正預測(H2a)對四項屬性全都不成立;績效獨立性標準(H2b)則符合申訴、選擇退出與偏誤稽核,不包括人類參與。
人類參與這項例外確實存在,而作者拒絕解讀它。 相較於 AI 單獨決定,在錯誤率 10%、20%、30% 時,其優勢分別為 0.285、0.289、0.239——先持平,只有到了最高水準才下降。登錄的連續編碼交互作用(-0.046)在線性機率模型中達顯著(p < 0.001),在 logit 中則未達顯著(p = 0.21)。它不是單調變化,對尺度敏感,而且符號與錯誤修正預測相反——因此不能據此說人類參與的價值會隨錯誤增加而下降,更不足以挽救工具性解釋。附錄 I 如實記錄:「報告為對尺度敏感,且不作實質解讀。」
可行使的權利,勝過無法介入的監督#
排序並非平滑遞減,而是依誰能啟用該項功能而分層:
- 決策權——決定由誰做出裁決:+0.272。
- 申訴與選擇退出——個別申請人可親自啟用的途徑(以 Hirschman 的說法,即發聲與退出):+0.156 與 +0.129。
- 獨立偏誤稽核——系統層級、群體層級、範圍分散,且不提供個人重新審查:+0.068。
預先規劃的對比結果毫不含糊:人類參與 − 申訴 +0.116、− 選擇退出 +0.143、− 解釋 +0.144、− 偏誤稽核 +0.204(H1b,皆 p < 0.001);申訴 − 偏誤稽核 +0.088,選擇退出 − 偏誤稽核 +0.061(H4,兩者 p < 0.001)。
這直接對應到目前生效的三項監管工具,而它們對這些功能的分配各不相同。 EU AI Act 將特定招募系統分類為高風險系統,並要求人類監督(Annex III(4)(a)、Arts. 14 和 26(2))。GDPR Art. 22 賦予個人在特定條件下不受純自動化決策約束的權利,並享有人為介入及提出異議的權利。New York City 的 Local Law 144 要求進行偏誤稽核,並通知申請人如何要求採用替代流程——但執行規則並未要求雇主實際提供替代流程。依據這些估計,三者不能互相替代:LL144 立法規範了申請人最不重視的屬性,並要求通知可申請替代流程,卻不要求提供替代流程。偏好無法決定法律是否足夠妥善,但「單靠監督無法涵蓋申請人重視的所有面向」在此是有測量依據的陳述,而非斷言。
研究設計本身也提出相同警示。名義上讓人類介入,申請人仍然沒有任何可行使的權利:審查者可能順從原本應該檢查的建議(Alon-Barkat & Busuioc 2023;Green 2022),或在介入時降低準確度(Sele & Chugunova 2024)。得分 +0.272 的屬性是決策權,而研究設計沒有測試名義上擁有此權的人類是否真的行使它。
互補效應不如理論預期#
H3 預測,已有人工參與時,申訴與選擇退出會更有價值(當權威者能對發聲與退出採取行動時,兩者才更重要)。結果是:部分支持。
- 申訴 × 人類參與:在已註冊的雙交互作用模型中為 +0.025,95% CI [0.004, 0.047],p = 0.021——但在 logit 下,同一交互作用未達顯著(p = 0.31)。
- 選擇退出 × 人類參與:-0.0003,p = 0.99。實質上等於零。論文描述性地報告了事後等效性檢定,並明確表示不將其視為支持 H3。研究設計無法判定原因。
在探索性聯合模型中,申訴(+0.026)、解釋(+0.027)與偏誤稽核(+0.029)在人類參與下的 LPM 效果都略為增加,也都通過 Holm 校正——但只有偏誤稽核交互作用在 logit 中仍達顯著(+0.117,p = 0.036)。最誠實的摘要就是論文原文的意思:互補效應並非在所有尺度下都成立,研究設計也無法指出哪種組合最能保障申請人或改善決策品質。依據這些估計來設計功能組合,都屬於外推。
應徵不代表接受#
另一項經測量的結果,也是最能延伸至招募以外的發現。以五點量表衡量:使用 AI 招募的雇主,其應徵意願平均為 3.24,高於對 AI 招募正當性的認定(2.85;配對差異 0.389,d_z = 0.42,t(1918) = 18.56,p < 0.001)。兩者高度相關(r = 0.65),卻測量不同構念——一項是規範性判斷,另一項是行為意圖。樣本中有 7.8%(n = 150)同時對正當性的評分低於中點,且應徵意願高於中點(圖 4——框線區塊合計為 106 + 8 + 30 + 6 = 150,占 1,919 人中的 7.82%)。退出意願平均為 2.52,且與正當性及應徵意願都呈負相關(r = -0.46、-0.67)。
因此,應徵人數並非衡量申請人是否接受某系統為正當的可靠指標——人們會應徵自己懷疑其程序的雇主,因為另一個選項可能是不應徵。這項測量警示可以廣泛適用:若在受試者沒有其他選項的情境中蒐集接受度的行為代理指標,測到的是服從,不是同意。
此處的陳述偏好,彼處的實際選擇#
知識庫中最明顯的張力,來自 Controlled Variance: AI's Edge as Reduced Dispersion,而它之所以能化解,是因為兩項研究的選擇對象不同。
Jabarian & Henkel 的現場實驗發現,若讓菲律賓初階求職者自行選擇,78.4% 會選 AI 語音面試官;錄取通知接受率在統計上沒有變化,兩組的感知公平性也無差異。本研究則發現,美國求職者願意為人類決策者支付 +0.272 的選擇機率——這是很高的陳述偏好溢價。
兩者能一致的原因是,現場實驗兩組的所有招募決策都由人類做出。 AI 負責進行面試,從未掌握決策權,而這正是本聯合分析估價的屬性。選擇 24/7 語音代理,而不是和招募人員安排面談的申請人,選擇的是一種互動方式,決策權結構並未改變——而本研究受訪者評分最高的安排正是「AI 提出建議,人類決定」,與現場實驗場域的安排大致相同。兩項結果一致;合併來看,這提醒我們不要將任一結果解讀為「申請人喜歡/不喜歡 AI 招募」:申請人看重的是誰做決定,只改變其他條件的工具找不到差異也就不足為奇。
仍有三項差異尚未消解,且知識庫中的研究都未交叉檢驗:族群(美國 Prolific 求職者與菲律賓初階 BPO 申請人)、利害程度(假設性強制選擇與實際應徵),以及外部選項(聯合分析受訪者可以零成本表達偏好;拒絕 AI 的申請人可能就此失去面試機會)。上述正當性與意願的落差正好在此最明顯——78.4% 是從正面臨實際求職申請的人身上收集到的行為統計,而本研究顯示,這類測量可能與規範性接受度不同。
研究設計無法做到的事#
以下是論文明確指出且值得保留的限制:
- 假設性任務中的陳述選擇,而非實際應徵行為。沒有維持現狀或兩者皆拒的選項,因此每項任務都迫使受訪者在兩個系統中擇一。
- Prolific,且預先篩選目前正在找工作的美國受訪者;n = 1,919(軟啟動 150 人 + 1,769 人)。平均年齡 36.6 歲(SD 12.1),54.6% 為女性,58.6% 為白人,35.0% 失業且正在找工作,74.9% 曾有 AI 評估經驗。研究明確指出,樣本不代表更廣泛的求職人口。92% 通過操弄檢查;主要分析未以任何條件篩選。
- 二元屬性記錄的是功能是否有提供,而非功能品質——所有功能都被呈現為免費,但真實申訴與重新審查會帶來延遲、心力與結果不確定性。申訴層級僅告知受訪者可重新審查,沒有說明其運作成效。
- 平坦調節效果背後的機制無法辨認。 論文列出兩種無法排除的競爭性解讀:申請人可能懷疑錯誤增多時申訴是否有效,也可能將申訴的可用性解讀為實際績效高於顯示數值的訊號。
- 穩健性檢驗相當嚴格。 單獨套用資料品質限制、位置控制或無序錯誤率編碼,AMCE 的變化都不超過 0.003(一次移除全部三項品質標記時為 0.005);五點可接受度結果重現了相同方向與排序(等級相關 0.89);軟啟動與其餘批次的差異在抽樣誤差範圍內。本文較脆弱的是不同連結函數下的交互作用,而非主要效果。
延伸閱讀#
-
Controlled Variance: AI's Edge as Reduced Dispersion——前述揭示偏好研究,也是知識庫中的另一項招募實驗。實驗設計中兩組都由人類掌握決策權,78.4% 的申請人仍選擇 AI 面試官;本聯合分析則將該決策權估為 +0.272,並說明兩者為何不矛盾。兩者的公平性證據也有差異:現場實驗發現兩組的感知公平性無差異,性別歧視回報比例減半,實際錄取差距卻未變;本研究則發現受訪者高度偏好一項現場實驗未曾變動的屬性
-
Human-AI Accountability Redesign——同一邊界問題中,決策受影響者的觀點。該頁提出五大支柱建議,並以 CIVIC-AI 稽核根據可驗證性、可逆性與利害程度劃定人類與代理的界線——這些都是工作本身的特性。本頁則加入企業外部的限制:受系統評斷的人,偏好自己能親自啟用的權利(申訴 +0.156、選擇退出 +0.129),遠勝於自己無法介入的系統層級監督(稽核 +0.068),而且決策權高於兩者。即使重設方案符合所有內部稽核條件,只要申請人沒有可行使的權利,仍可能不被接受
-
Configurable Human Participation——HAS-Bench 將人類參與視為可配置變數,並依任務結果評分;本研究依受影響者是否接受來評分,發現兩者不一定一致。兩者都得出相同的後設結論——重要的是配置方式,不是人類參與的多寡——但採用相反的目標函數;兩者之間的差距,正是人機協作設計究竟在最佳化誰的偏好的問題
-
The Automation–Optimism Link——接受 AI 服務的人群,測量的是另一種構念。該頁的開放問題在問,樂觀態度是否和由 AI 提供服務有關,而非將工作委派給 AI;本頁中,曾受 AI 評估的人占絕大多數(74.9%),仍願意為人類決策者支付高額溢價,而先前 AI 評估經驗並不會調節該溢價(交互作用 -0.013,p = 0.36)。正當性與意願的落差(3.24 對 2.85;7.8% 懷疑但仍應徵)也為該頁倚重的行為證據加上限制
-
AI Adoption in Scientific Work——同一種重視過程勝於結果的偏好,由 AI 的使用者持有,而非被 AI 評斷的人。 Angelini & Lyrvall 調查 3,785 位博士生,發現他們接受 AI 用於文獻工作(51.5% 覺得摘要工作令人安心),卻不接受 AI 用於寫作、資料分析與實驗設計(約 30%)——這條界線依據機器執行哪個步驟劃定,而非輸出品質如何,正是本頁核心主張在科學評估中的延伸。他們在 §5.1 直言,治理制度「若只關注輸出品質,可能忽視研究過程中作者身分、問責,以及智識貢獻分配的差異。」兩項限制讓這項比較保持審慎——該工具測量的是未經隨機化的安心程度,不是因果 AMCE;也沒有測量交易意願,因此無法估價
-
Telemetry vs. Survey Measurement——可加入該頁清單的第四種工具:隨機化的陳述偏好設計。它不是遙測(沒有觀察任何行為),也不是態度意義上的問卷(屬性經過隨機化,因此 AMCE 在情境實驗內具有因果解釋),並帶來另外兩種工具都無法提供的一項優點——程序與績效的正交變化。代價是外部效度;而本文的正當性與意願落差,直接衡量了陳述接受與行為可能分離到什麼程度
-
The Enablement–Regulation Axis——同一問題的供給面,無法回答本頁測量的需求。 申請人最重視可由個人啟用的程序:人類決策權 +0.272、申訴 +0.156、選擇退出 +0.129;系統層級偏誤稽核則為 +0.068。Chueri & Törnberg 的 33 個國會語料庫發現,恰好涵蓋這些工具的立法主題——演算法管理、平台工作保障與人類監督——在管制與限制框架中是最小的部分,占 13.0%,即全部 5,470 則框架回應中的 155 次提及;著作權與創意產業保護則以 36.1% 居首。補償是事後補救措施,本研究受訪者從未獲得此選項,只占所有提及的 2.3%。兩項研究觀察的族群、國家與時期都不同,單獨看任何一項都無法證明存在代表性落差——但這是知識庫中唯一測量同一問題兩端的研究,而且方向一致
延伸至主題中心(單向)#
- Verification as the New Bottleneck——申請人一方說明瓶頸為何無法單靠自動化消除。名義上的審查者若順從建議,形式上符合監督要求,卻沒有給決策受影響者任何可行使的權利;而申請人實際重視的是誰擁有決策權,不是誰名義上在迴圈中
待解決的問題#
- 本設計中的所有程序功能都不需付出代價:層級僅標示「可用」,從未說明啟用後會帶來多少延遲、心力或不確定性。若申訴被標上成本,平坦的調節效果是否仍會成立——例如隨機呈現「3 天內重新審查」與「6 週內重新審查」,或為其附上明確成功率?只要讓功能的預期矯正效益變得清楚,錯誤修正解釋應該會重新成立;而等效性界限足夠嚴格(90% 下為 ±0.021),足以偵測真實斜率。
- 論文提出兩種無法區分、用以解釋平坦調節效果的競爭說法——申請人重視程序帶來的立足權與尊嚴,或申請人恰好在錯誤增加時降低對申訴效能的評價(和/或將申訴可用性視為實際績效高於顯示數值的訊號)。兩種說法會預測相同的 AMCE,卻導出相反的政策結論。若設計能一併測量受訪者相信申訴有效的程度,或將申訴成功率列為另一項隨機化屬性,是否就能區分兩者?
- 知識庫現在同時有一項人類決策權的陳述偏好溢價(+0.272,美國 Prolific 求職者),以及 78.4% 選擇 AI 面試官的揭示偏好(菲律賓初階申請人,兩組皆由人類決策)。上述依選擇對象所作的調和解釋了方向,卻沒有解釋幅度:剩餘差異來自族群與利害程度嗎?還是面對實際求職申請時,美國求職者也會選 AI?在有新來源之前,可先綜合這兩頁與知識庫中其他陳述偏好與揭示偏好研究來回答。
資料來源#
- Do job seekers value procedure in AI hiring only for error correction? Evidence from a conjoint experiment — Chuyao Wang、Patrick Sturgis(LSE Department of Methodology;Wang 亦任職於 LSE Data Science Institute)與 Daniel de Kadt(Cornell),Do job seekers value procedure in AI hiring only for error correction? Evidence from a conjoint experiment,arXiv 2609.16390(2026-09-14;32 頁、18 張表、6 張圖;
empirical)。§3.1 樣本與倫理(Prolific、美國居住與目前求職的預先篩選、n = 1,919、平均每小時 £10.22、92% 通過操弄檢查);§3.2 六項屬性與螢幕文字;§3.3 估計量、AMCE/邊際平均數定義,以及預先註冊的 ±0.05 TOST;§4.1 AMCE 階梯與錯誤率降低 20 個百分點的基準;§4.2 等效性結果與人類參與的例外;§4.3 互補性交互作用;§4.4 正當性與應徵意願;§4.5 穩健性;§5 監管對應(AI Act Arts. 14/26(2) 與 Annex III(4)(a)、GDPR Art. 22、NYC Local Law 144)及明示限制。附錄:B(樣本特性)、C1-C3(AMCE、規劃對比、邊際平均數)、D1(等效性檢定)、E1-E2(子群與完整交互作用估計,LPM 與 logit)、F(穩健性)、G(檢定力——目標約 1,400 人,由調節效果與選擇退出 × 人類測試設定,以另外一批排除在外的先導樣本進行 Monte Carlo 模擬)、H(異質性)、I(偏離分析前計畫的紀錄)。預先註冊:OSF https://osf.io/5ju4d/,於 2026-06-17 張貼,早於檢視資料;LSE Methodology 於 2026-05-28 通過倫理審查;複現資料與程式碼已發布。聲明沒有競爭利益;這份預印本的資助聲明仍是未填寫的範本佔位文字,因此資助資訊未披露,而非聲明不存在資助。 - 已檢視並核對圖表。 圖 1(AMCE 森林圖)列印了明確資料標籤,與附錄 C1 完全相符(+0.287 / +0.257 / +0.156 / +0.129 / +0.128 / +0.068,錯誤率每 -1 個百分點為 +0.014),並以 +0.285 標示錯誤率降低 20 個百分點的參考線。圖 2 B 區重現正文的人類參與對比序列(0.285 / 0.289 / 0.239),A 區則呈現等效性區間。圖 3 列印的差值與附錄 E2 B 區相符(偏誤稽核 +0.029、解釋 +0.027、申訴 +0.025、選擇退出 -0.000)。圖 4 的框線區塊合計 150 位受訪者(106 + 8 + 30 + 6),確認正文的 7.8%。圖 5 確認 ±0.03 / ±0.05 / ±0.07 界限敏感度。依知識庫慣例,本頁沒有任何數值是直接從圖表讀取;所有引用數值皆來自正文,或來自已與
pdftotext -layout核對過的表格。 - 解析備註——已核對每張引用表,兩項無害的 docling 產物,一張無法驗證的表。 原始資料中沒有
[!note]/[!warning]修復區塊,因此 18 張表都視為未修復,並逐格與本機 PDF 的pdftotext -layout輸出核對。表格 1、B1、B2、C1、C2、C3、D1、E1、E2 與 I1 逐位元組完全一致,包括正負號、CI 括號與減號字形。匯入驗證中的四個table-collapse與兩個table-weld標記,確認都是誤報:它們觸發於多層摘要列(「錯誤率:10% / 20% / 30%」、「先前 AI 評估:是/否/不確定」)與兩行換行標籤(「決策權:AI 先行篩選,人類決定」、「先前 AI 經驗:沒有或不確定」)。有兩項產物值得留意:(i) 表格 C1、C3、E1 與 B1 在原始資料中各呈現為兩張 markdown 表格,因為 PDF 在頁面邊界處將表格拆開並重複欄名;沒有遺失任何列,拆分點分別為 24/25、25/26 與 26/27;(ii)表格 B1 的尾段(Mixed、Other、就業狀態、先前 AI 評估、國家)在原始資料中出現在「Table B2: Attribute-level frequencies」標題下方,因此標題看起來像是在介紹人口統計列,但實際上並非如此——PDF 中的順序是先延續 B1,再出現標題,B2 本身則是其下方的屬性占比表。表格 2(配對檔案任務範例)是研究工具的截圖,沒有 PDF 文字層,所以原始資料中只有 RapidOCR 輸出,無法與pdftotext核對;匯入階段修正了一處將AI誤讀為Al的錯誤。本頁沒有引用表格 2 的內容——設計描述來自表格 1 與 §3.2 正文,兩者都已核驗。 - Normative boundaries of AI in scientific work: Evidence from PhD researchers — Angelini & Lyrvall,Normative boundaries of AI in scientific work: Evidence from PhD researchers,arXiv 2608.25678,2026-08-26,15 頁,
empirical。此處僅引用 §5.1 的過程與結果治理論點,以及表格 1 中按任務列出的安心程度邊際值,作為本頁決策受影響者偏好的使用者端類比。完整分析見 AI Adoption in Scientific Work
Cited by 10
- AI Adoption in Scientific Work
Procedural Value In Ai Decisions — the same process-over-outcome preference measured on the people…
- The Automation–Optimism Link
Procedural Value In Ai Decisions — the served-by-AI population measured directly, on a different…
- Configurable Human Participation
Procedural Value In Ai Decisions — the same configuration sweep scored on a different objective.…
- Controlled Variance: AI's Edge as Reduced Dispersion
Procedural Value In Ai Decisions — the stated-preference counterpart, and the page that explains…
- The Enablement–Regulation Axis
Procedural Value In Ai Decisions — the two halves of one representation gap, measured independently…
- Human-AI Accountability Redesign
Procedural Value In Ai Decisions — the constraint from outside the firm. Every pillar here locates…
- AI Economics & Labor
Procedural Value In Ai Decisions — Wang, Sturgis & de Kadt (LSE/Cornell, arXiv 2609.16390): a…
- Open Questions Dashboard
Procedural Value In Ai Decisions: The vault now holds a stated premium for human decision authority…
- Open Questions Backlog
Procedural Value In Ai Decisions ×3 (oldest 6d) — Every procedural feature in this design was…
- Telemetry vs. Survey Measurement
Procedural Value In Ai Decisions — an eighth aperture: the randomized stated-preference design. A…
Related articles
- Organizational Complements to AI
The general-purpose-technology argument: AI productivity gains depend on complementary workflow, skill, and org-design…
- Controlled Variance: AI's Edge as Reduced Dispersion
Jabarian & Henkel (arXiv 2607.28222): a pre-registered natural field experiment randomizing 70,884 job applicants betwe…
- The Tragedy of the Cognitive Commons
Lovett (HRD Review, July 2026): professional expertise is a profession-level commons whose regeneration mechanism — ent…
- AI Brain Fry
Kropp et al. 2026/03: mental fatigue from excessive AI oversight increases minor errors +11%, major errors +39%; cognit…
- Exposure Taxonomy: Observed, Theoretical, Reported, Anticipated
Four distinct ways to measure AI's reach into an occupation — observed exposure (tasks seen done with Claude), theoreti…
