資料來源#
- Google AI & Economy ATLAS: AI in Science (September 2026)
- Normative boundaries of AI in scientific work: Evidence from PhD researchers
- Quo Vadis? Scientific Discovery in the Age of Artificial Intelligence
摘要#
AI in Science: Early Insights(Codreanu、Imas、Mateos-Garcia 等人,Google + Google DeepMind + MIT FutureTech,2026 年 9 月)首次嘗試以使用遙測儀器,而非出版物痕跡,測量科學領域中的 AI。作者依序提出四項發現:科學家使用 AI 的程度高於其他職業;通用 LLM 與專業科學模型互補,而非互相取代;科學家表示節省了大量時間(每週略低於 7 小時);這些節省的時間沒有轉化為發現,因為限制因素已移至下游,包括實體實驗、臨床驗證與 AI 輸出的查核。
此頁現在加入第二種儀器(2026-09-23)。 Angelini 與 Lyrvall 對 Nature's Graduate Survey 2025 中的 3,785 名博士生進行潛在類別分析。這項分析測量的不是 ATLAS 所測的任何項目——不是使用情形、節省時間或產出——而是改問:研究者認為 AI 適用於哪些研究任務。答案補足了前一種儀器的規範面向:科學領域對 AI 的接受度依任務而組織,界線落在文獻工作與涉及著作權責及認知責任的活動之間。這兩種儀器也出現了無法由任一方定論的分歧——見下文的矛盾。
最後一項發現正是此頁值得記錄之處。這是在研究生產函數中測量互補品論點,也是採用者一方對能力主張的對應觀察——那些頁面從理論上討論的驗證落差,在此由 637 位在職科學家以時間分配呈現。
證據說明。
empirical——三項經測量的資料來源,具備有文件記載的流程、已發表的分類器驗證,以及作者明確陳述的限制。每個數字都涉及兩項利益衝突事實。供應商測量自己的產品:遙測資料是 Gemini 流量,由 Google 分析,使用 Google 自家的分類器,並發表於一篇主張 AI 能提高科學生產力的論文。問卷由 Google DeepMind 委託,再由第三方 More in Common 執行;第三方執行並不會消除贊助者的利害關係。問卷中的所有資料都是自陳——節省時間、瓶頸位置、驗證占比、產出變化——來自一個經篩選的非機率樣本,沒有母體抽樣框,報告未加權,也沒有誤差範圍;作者也指出,樣本偏向熱衷 AI 的受訪者,可能導致採用率與節省時間的估計偏高。論文建立的是關聯,而非因果關係,作者也明確如此說明。
並非第二個資料時間窗#
值得先說清楚,因為後續文章的形式容易讓人以為是另一回事。此處的遙測資料是同一份 ATLAS v1.0 資料集——「2026 年 4 月初從 Google Gemini App、Google AI Mode 與 API 介面抽樣,約有 1,500 萬筆匿名互動」(§2.2.1),也就是 Task Saturation: Broad but Shallow AI Diffusion 所用的 4 月 6 日至 19 日時間窗。新增的是篩選器與分類架構,而非資料收集:三階段流程(工作/非工作分類器 → 六個研究密集型 2 位數 SOC 群組 → 專為科學設計的分類器)將 1,500 萬筆互動縮減為約 36 萬筆科學互動,再將其對應至 OpenAlex 學科與 MIT FutureTech 新任務分類架構,而非 ONET。
因此,這份報告沒有為 ATLAS 計畫增加時間維度。企業與代理式工具的排除條件也原樣延續:不含付費 Gemini API、不含企業合約;§6.1 也將這點列為限制,指出不含 Antigravity 等代理式工具,「將代理式資料納入分析是重要的下一步」。
科學家是最頻繁的使用者,使用方式也更成熟#
- 過度代表。 六個研究密集型 SOC 家族的 Gemini 使用量,是其美國就業占比的 1.8 倍;SOC 19(生命、物理與社會科學)為 2.7 倍,SOC 15/17/19 中核心 STEM 細分類職業則為 5.8 倍(§3.1 與註 7)。論文也以另一套儀器交叉檢視:Anthropic Economic Index 發現,截至 2026 年 6 月,SOC 19 在美國的代表性約高出 4.5 倍(註 8)——方向相同、程度不同,這正是兩項計畫長期呈現的模式。
- 廣度。 科學領域 217 個次領域中,有 195 個的使用量達到 25 位使用者的隱私門檻(§3.2)。物理科學(含電腦科學)占科學互動的 55.3%,社會科學占 21.4%,健康科學占 14.1%,生命科學占 9.2%;光是電腦科學就接近十分之三。
- 規模關係。 在各領域內,某領域的 OpenAlex 研究者占比每增加 1 個百分點,預測其科學互動占比會增加 約 0.7 個百分點,解釋略低於 30% 的變異——因此大部分領域差異並非由人數決定。跨國分析的同一迴歸得到約 0.9 個百分點,可解釋約四分之三的變異(§3.2)。
- 互動本身更深入。 與平均工作對話相比,科學互動的 token 多 19%、輪次多 11%、多模態內容多 7%,ATLAS 領域專業度分數高 26%(§3.1,僅計對話介面)——這是跨實驗室呼應運算量追隨工作價值的觀察。
任務組成(圖 4)#
科學領域 Gemini 互動的第一層任務占比,加權計算:
| 任務領域 | 占比 |
|---|---|
| 分析與建模量化研究資料 | 42.5% |
| 傳達研究發現與利害關係人資訊 | 14.0% |
| 開發產品、原型與製程技術 | 11.4% |
| 執行實驗與樣本處理作業 | 9.8% |
| 教授與訓練學生及研究人員 | 6.4% |
| 管理研究計畫與營運流程 | 3.9% |
| 概念化、設計並提出研究構想 | 3.0% |
| 協調臨床研究執行與參與者作業 | 2.8% |
| 開發並排除研究檢測方法與軟體的問題 | 2.3% |
| 管理研究資料、完整性與品質 | 1.5% |
| 確保品質、合規與法規文件完備 | 1.3% |
| 收集研究資料與參與者資訊 | 1.1% |
作者指出,溝通類任務的占比是下限估計:提示若附有附件,流程會過度預測「分析與建模」;例行寫作則較可能被篩成一般文字編輯(註 16)。此處的領域代表性高低比較(表 1)取自 §3.3 的文字,而非表格,因為表格解析時標籤欄被拆開(見來源)。
LLM 與專業模型互為補充#
這是報告中測量最明確、且不依賴自陳的結果。
模型清單包括 2,690 個專業科學模型:自 2012 年以來發表,附有論文與官方程式碼儲存庫;它們來自更大的 5,501 個模型資料集(去重後為 4,858 個),該資料集透過代理式網路搜尋儲存庫與文獻建立,再與 Epoch AI 資料庫(2026 年 8 月快照)合併,並以 OpenAlex 資料補充。這些模型涵蓋 OpenAlex 的全部 26 個領域與 83% 的次領域;OCTO 從摘要中擷取出 4,475 項下游任務,涵蓋該分類架構第三層任務的 17.6%;排除營運與教學任務後則為 24.3%(§4.2)。
兩類模型在分類架構頂層看起來相似——量化分析與建模在兩者中都占主導地位——但更細層級則完全分歧。專業模型任務占比對 Gemini 任務占比的對數—對數彈性會隨分類解析度提升而單調下降:第一層略高於 0.6,第二層為 0.5,第三層為 0.2(若納入只出現在其中一個資料集的任務,第三層會略為負值)。專業模型集中於疾病與臨床結果預測、分子構築工程與模擬;Gemini 則處理統計分析、程式碼疑難排解、文獻統整與草擬(§4.3)。作者提醒,下降幅度部分來自衰減偏誤——分類器準確度會隨粒度提高而下降——因此名目彈性是任務重疊程度的上限估計。
還有兩項佐證,各自都帶有但書。專業模型的引用度很高——自 2012 年以來累積 130 萬次引用,49% 的模型位於其領域標準化引用數前 1%,83% 位於前 10%——但作者指出,抽樣框偏向知名模型,因此這是影響力的質性證據,而非測得的引用溢價(註 22)。此外,開發集中,使用則否:排名前十的國家擁有 84% 的模型,低收入與中等收入國家(LMICs)幾乎沒有模型開發者;但中國約占引用數的 40%,拉丁美洲、東南亞與非洲的 LMICs 引用遠多於自行開發——論文的解讀是,開放模型會擴散到缺乏建模能力的地方(§4.5)。
問卷:637 位科學家,以及他們如何使用時間紅利#
More in Common 於 2026 年 7 月 27 日至 8 月 11 日在線上透過專業研究小組執行問卷,並設置四道篩選條件(主要工作屬於科學/臨床/生命科學/社會研究;研究或研發是工作主要部分;依英國 Science Council 定義自我認定為科學家;排除市場研究、行銷與顧問業)。除「透過專業研究小組招募」外,未揭露其他誘因安排。637 位在職科學家:美國 379 位、英國 258 位;物理科學與工程(含電腦科學)230 位、生命科學 167 位、健康與臨床 147 位、社會科學 93 位;資深人員 356 位(PI、教授、實驗室主任、產業研發經理),中生涯 234 位,早期生涯 47 位;研究經驗平均略低於 13 年(附錄 3)。
- **使用頻率(圖 11)。**46.6%(n=297)每天使用 AI,30.6% 每週使用,15.5% 有時使用,7.2% 很少或從不使用——**77.2% 每週至少使用一次。**依自陳的 AI 工作時間計,約 70% 用於通用 LLM(41% 用於通用聊天與文件 LLM,其餘用於程式碼代理與助理),約 30% 用於專業模型。
- 時間花在哪些工作上。資料收集與實驗略低於8 小時,資料分析與詮釋約 7 小時(略低於一週的五分之一,也是 AI 最常接觸的部分),寫作約 5 小時、方法學約 5 小時、知識取得約 5 小時、概念化加上募資/行政工作合計約 9 小時(§5.2)。
- 節省時間。略低於四分之三表示每週淨節省時間,6% 表示淨損失時間;平均每週節省 6.9 小時。節省時間的用途:略低於 30% 用於增加研究產出、約 21% 用於實驗室實作與資料收集、約 19% 用於更困難的問題、約 18% 用於工作與生活平衡及減少工時、12% 用於教學與行政。
- 產出。約 84% 表示過去三年實驗室或專業產出淨增加,略低於 47% 表示增加 10% 以上;約十分之九預期未來三年產出會增加,預期增加 25% 以上的比例則從約 7% 升至約 18%(圖 12)。
瓶頸移往下游,驗證消耗時間紅利#
這項發現讓前一節的結果不致失之片面。
- **目前的限制在哪裡。**實體實驗與資料收集是目前最大的速度瓶頸,占整體 24%,在物理科學與工程領域則為 30%;其次是資料分析(約 21%)與寫作(約 14%)(§5.3)。
- **瓶頸往哪裡移(圖 13A)。**43.5% 表示主要瓶頸在兩年間往下游移動,13.8% 表示往上游移動,差距為 3.1 倍;另有 42.4% 表示沒有變化。
- **待處理工作(圖 13B)。**40.5% 表示未經測試的假說比三年前更多,24.8% 表示更少,33.8% 表示沒有變化。
- **驗證成本(圖 13C)。**在使用 AI 節省時間的科學家中,89.3% 將超過 10% 的節省時間用於驗證、除錯或查核輸出;45.7% 用於這些工作的時間超過 25%;9.3% 超過一半。報告指出,生命科學領域的驗證成本最高。註 25 說明了這些結果能被解讀到什麼程度:下游移動與待處理工作增加,與自陳 AI 使用強度之間的關聯「在統計與經濟上都非常顯著」;但驗證成本僅達邊際顯著,且會依模型設定而異。
論文以歐靈模型總結其機制,並引用 Demirer 等人(2026)、Gans 與 Goldfarb(2026)以及 Garicano 等人(2026):任務層級的加速沒有傳遞到整體產出,因為「科學工作組合中的剩餘任務更難擴展,也更難吸收節省下來的時間」,因此要實現效益,「可能必須重新劃定工作界線」。這就是加入濕實驗室場景的電氣化論點。
街燈效應傾向#
這是問卷中最令人不安、測量依據也最薄弱的結果(圖 14,全部是對過去兩年經驗的自陳):
| 感受 | 正面 | 負面 |
|---|---|---|
| 取得其他學科見解的機會 | 68.1% | 6.1% |
| 所處理問題的企圖心 | 67.3% | 6.4% |
| 研究議程的廣度 | 65.0% | 7.1% |
| 發表高品質論文 | 59.8% | 9.1% |
| 每篇論文所需心力減少 | 31.2% | 44.6% |
| 發表低品質論文的數量減少 | 35.0% | 40.3% |
| 計畫風險:較高風險 vs 較安全 | 27.5% 認為風險較高 | 48.8% 認為較安全 |
科學家同時表示 AI 擴大了自己的觸及範圍,也讓他們更傾向選擇較安全、較漸進的問題;近乎以 2 比 1 的比例認為,這些問題「資料與 AI 能力都已相當成熟」。作者稱之為可能的街燈效應(Nagaraj 與 Tranchero;Hoelzemann 等人):AI 降低了資料豐富、可用基準評估問題的工作成本,排擠了缺乏訓練資料、實體驗證又昂貴的非結構化高風險探索。也請留意,同一群受訪者既表示高品質論文變多(59.8%),也表示低品質論文變多(40.3%,高於表示減少的 35.0%)——用論文的說法,就是「不只是產出變多,產出也變得不同」。
規範面:3,785 名博士生,以及一條與能力無關的界線#
以上內容測量科學家如何使用 AI,以及節省的時間能帶來什麼。Angelini 與 Lyrvall(Francesco Angelini,義大利獨立研究者;Johan Lyrvall,Inria Lille——arXiv 2608.25678,2026-08-26,15 頁,empirical)則測量另一半:研究者認為 AI 適用於哪些研究任務。答案不是某個接受程度,而是一種形態——一條區分文獻工作的界線,以及承載智識貢獻的任務。
**測量工具。**作者對 Nature's Graduate Survey 2025 進行次級潛在類別分析(問卷由 Springer Nature 與 Thinks Insights & Strategy 合作,於 2025 年 5 至 6 月執行;資料集公開於 figshare):3,785 名來自 107 個國家的博士生自行選擇參與,透過 Nature 網站、其他 Springer Nature 數位產品及定向電子郵件招募。五個題項分別對應一種研究活動——撰寫研究論文、收集與分析資料、設計實驗、追蹤科學文獻、摘要科學文獻——每題詢問受訪者「使用 AI 工具(如 ChatGPT、Copilot 與 Claude)」從事該活動時的自在程度;回答分為六個有序類別,另有「不知道」,且所有題項均無遺漏值。3,785 人中有 3,722 人的共變數資料完整。
這個母體比「博士研究者」更狹窄:76% 是 STEM 領域,其餘為醫學與健康科學,完全沒有人文學科或非醫學的社會科學。38% 的人仍在博士班前兩年,87% 為全職,76% 年齡在 34 歲或以下,54% 為男性,15% 來自英國免除英語母語要求的國家。自我選擇偏誤嚴重到作者明確不主張盛行率推論——樣本「無法支持這些型態在更廣泛博士研究者群體中的盛行率主張」。這與科學家問卷一再遇到的抽樣框問題相同:沒有博士生母體名冊可供加權。
**各項邊際分布已呈現主要發現(表 1,n=3,785)。**能接受(非常+有些自在)對比不自在(非常+有些不自在):
| 任務 | 能接受 | 不自在 |
|---|---|---|
| 摘要文獻 | 51.5% | 31.2% |
| 追蹤文獻 | 43.1% | 35.0% |
| 撰寫研究論文 | 31.0% | 50.0% |
| 設計實驗 | 30.5% | 45.2% |
| 收集與分析資料 | 29.5% | 49.9% |
只有一項任務獲得多數受訪者接受,那就是閱讀他人的論文。「不知道」占 4–8%,在實驗設計上的比例最高(8%)。
四種型態(表 4;ICLbic 選出四個類別——57,453,三類為 59,860,五類為 57,713,見表 3)。
- 「分工型」,44%——占比最高,也是論文的主打發現。這類人對任何事情都不會非常熱衷:其非常自在的機率最高只有 0.10(摘要文獻)。對文獻持溫和正面態度(摘要文獻有 0.50 有些自在,追蹤文獻有 0.41),對寫作(0.28 有些不自在+0.14 非常不自在)、資料收集與分析(0.30+0.10)及實驗設計(0.27+0.06)則持溫和到明確的負面態度。其特徵是梯度,而非程度。
- 「維持現狀型」,34%——普遍拒絕 AI:寫作、資料與設計的非常不自在機率分別為 0.71、0.76、0.71,但在追蹤與摘要文獻方面只有 0.47 和 0.44。
- 「通用型」,16%——普遍能接受:三種生成任務的非常自在機率為 0.51/0.51/0.47,兩種文獻任務則為 0.65 和 0.76。
- 「未定型」,7%——五個題項的「不知道」機率介於 0.57–0.81。作者明確提醒,不要將此型態解讀為一種態度取向;它可能代表不使用、不熟悉,或只是一種作答方式。這類受訪者若有回答,傾向正面。
摘要低估了結構性重點:每一類內部的任務排序都相同。拒絕者對文獻最不排斥;熱衷者對文獻最熱衷;甚至未定者對文獻也最不疑惑。因此,文獻與貢獻之間的界線並非主導型態的特徵,而是整個母體排列的軸線;四種型態的主要差別,在於各自沿軸線所在的位置,以及在界線上的態度變化有多劇烈。
共變數(表 5;兩階段估計,參照類別為「分工型」,參照使用頻率為「從不」;n=3,722)。
- **領域是唯一的結構性預測因子。**相較於醫學與健康科學,STEM 對「維持現狀型」的係數為 +0.307(SE 0.11,p<0.01)——STEM 學生更傾向拒絕,方向與「STEM 較熟悉工具」的先驗預期相反。另兩組差異皆不顯著(通用型 0.132,未定型 −0.237)。
- **職涯階段與投入時間:沒有影響。**博士班前兩年對三種非參照型態的係數為 −0.057/0.019/−0.083,皆不顯著;全職狀態也一樣。作者提出了關鍵推論:可用於研究的 AI 約在兩年前出現,因此,若這些態度是從一開始就接觸 AI 所形塑,初階年級應會有所不同;但並沒有。
- 使用頻率讓人走向差異化型態,而非更寬鬆的型態。相較於從不使用,每日或每週使用者對「維持現狀型」的係數為 −1.911(SE 0.16,p<0.01),對「未定型」為 −2.402(SE 0.24,p<0.01);「通用型」則為 +0.434(SE 0.23,不顯著)。每月/每年使用在三種型態上的係數皆為負且顯著(−1.128、−0.561、−1.987)。因此,重度使用者大多不是拒絕者或未定者,但也沒有顯著提高成為全面熱衷者的可能性:使用似乎會釐清界線,而非消除界線。因果關係無法辨識——熱衷態度很可能和使用一樣會推動使用行為——且研究設計是橫斷面的。
- **論文未討論的三個係數。**英語母語者:對「維持現狀型」為 +1.047(SE 0.14,p<0.01),對「通用型」為 −0.777(SE 0.26,p<0.01)——是表中影響最大的係數,且符合 AI 對第二語言研究者而言可能是語言支援、而非一般研究工具的解讀(Hoomanfard 與 Shamsi 對第二語言論文寫作所記錄的機制)。男性:對「維持現狀型」為 −0.413(SE 0.10,p<0.01),對「通用型」為 +0.272(SE 0.12,p<0.05)——女性更可能屬於拒絕型態。34 歲或以下:對「維持現狀型」為 +0.297(SE 0.12,p<0.05)——較年輕的受訪者更傾向拒絕。§4.1 只報告領域、職涯階段與使用頻率的結果;論文八項共變數中,有三項顯著係數在內文完全未提及。
這項工具測量的不是什麼。標題寫「規範界線」,題項詢問的卻是自在程度。作者在 §5.4 承認兩者有落差:自在程度「可能反映規範評價,也可能反映對 AI 工具的熟悉度、取得管道、使用信心,以及對其可靠性的看法」,因此這些型態是「帶有規範面向的任務特定態度組合,而非對共享科學規範的直接測量」。作者根據型態的形狀提出規範解讀——界線追隨著作權責與認知責任,而不是任務難度——但資料無法檢驗此點;單純以可靠性解釋也會預測相同排序:目前的模型最能勝任文獻搜尋與摘要。本文沒有測量任務層級的使用情形、正當性判斷、揭露行為或結果。使用頻率只以未作區分的共變數納入分析。
此頁遙測部分的矛盾,無法簡單化解。ATLAS 的 Gemini 資料集顯示,科學互動中有 42.5% 屬於「分析與建模量化研究資料」——是占比最大的單一任務領域;然而,這些博士生最不願委託 AI 的任務是收集與分析資料(29.5% 能接受,49.9% 不自在)。目前有四種可能解讀,來源無法選定其一:(1)母體不同——637 位以資深人士為主的美英在職科學家,對比 3,785 位國際招募的博士生;(2)測量概念不同——互動占比不是接受率,而自在程度題目問的是委託 AI 執行該活動,並非請模型檢查迴歸分析;(3)已知的分類器偏誤——ATLAS 註 16 自己就說,有附件的提示會使流程過度預測「分析與建模」,也會低估例行寫作;(4)態度根本不支配行為,這正是作者自己的提醒,也是儀器涵蓋範圍頁面持續記錄的一般結果。誠實的總結是,兩種儀器測量同一職業的不同面向,只有一點一致——分析單位是任務,不是科學家。**現在又有第三種儀器家族縮小了這個問題的範圍(2026-09-23)。**出版物痕跡的科學計量方法看不到有爭議的項目——分析不會在論文中留下痕跡——但它能以相鄰項目區分不同解讀:這批受訪者最排斥寫作(31.0/50.0),但痕跡估計方法發現 AI 最常出現在寫作上;截至 2024 年 9 月,電腦科學產出中有 22% 帶有 AI 修改文字。見下文痕跡家族一節;其結果讓解讀(4)成為值得考慮的可能性,也削弱了寫作項目上的解讀(2)。
為什麼此處要連結到本頁其餘內容。§5.1 的治理論點在於過程與結果之別:若研究者重視的是哪些活動交由 AI 執行,那麼只評分輸出品質的評估制度就會忽略他們在意的事情,而籠統揭露「使用了 AI」幾乎不含任何資訊。大型出版商已經區分 AI 用於執行研究、準備稿件,以及審查他人作品等情境,因此無論研究者是否認同這條任務界線,政策都正在將其寫入規範。§5.2 補上博士訓練的版本:這些任務既是產出工作,也是習得研究技能的方法,因此委託 AI 會以養成換取產出——作者引用 Bastani 等人(2025)與 Fan 等人(2025)的研究,指出 AI 輔助提高當下的輔助表現,卻降低後續無輔助表現。這是能動性置換概念從完全不同研究方法得出的觀察:抗拒恰好集中在 AI 可能接手工作中生成性部分的任務。
第三種儀器家族:出版物痕跡(2026-09-23)#
上述兩種儀器分別是遙測(人們傳送給模型的內容)與自陳(人們所述)。Jedlička 的調查(arXiv 2608.17970,2026-08-18,practitioner-opinion)彙整了第三種家族——已出版文獻留下的痕跡。它本身沒有測量任何資料;§3 彙編四項指標,而這項彙編就是其貢獻,因為這四項指標常被引用得彷彿測量的是同一件事。事實並非如此。
兩項指標將 AI 當成研究主題來計算:
- Ding、Lawson 與 Shapira,Rise of Generative Artificial Intelligence in Science(Scientometrics 130(2025):5093–5114)——追蹤自 2022 年以來生成式 AI 在各學科的擴散,於社會科學、心理學、教育與藝術領域「尤其明顯」。調查明確指出原因,而這正是此指標的根本問題:這些領域「本身就以 AI 的社會影響為重要研究對象」。一篇以 ChatGPT 為題的心理學論文,會和一篇使用 ChatGPT 撰寫的心理學論文被同樣計入。
- Stanford's AI Index 2026——自然科學領域與 AI 相關的出版物在 2024 至 2025 年間增加超過四分之一,2025 年約有 80,000 篇。
一項指標計算文字中的 AI:
- Liang 等人,Quantifying Large Language Model Usage in Scientific Papers(Nature Human Behaviour 9(2025):2599–2609)——估計經 LLM 修改文字的分布情形。截至 2024 年 9 月,AI 輔助寫作「在電腦科學已占已發表作品的最高 22%」,統計與物理學的比例較低,數學則接近 9%。調查本身也提醒:「此類估計在方法上仍不完善。」
最後一項是作者自行計算,也是論文中最薄弱的部分。圖 1 與圖 2 是從 nature.com 搜尋框取得的關鍵字計數(查詢日期為 2026-06-11):在 Nature 出版品中,提及人工智慧的論文從 2015 年到 2025 年增加超過 70 倍,每年超過 16,000 篇;旗艦期刊 Nature 的數量則從 2015 年的每年約 50 篇增至 2025 年的 700 多篇。沒有納入標準、沒有字串消歧,也只有一個查詢日期。從圖表圖片讀取,旗艦期刊的序列並非單調上升——2019 年接近 247 篇,2021 年降至約 172 篇,之後才開始 ChatGPT 出現後的攀升(2022 年約 213 篇、2023 年約 478 篇、2024 年約 572 篇、2025 年約 740 篇)。內文只引述兩端數值,因此呈現出平滑的指數成長,但作者自己的圖表並不支持這種說法。這段下降正好顯示,該序列追蹤的是編輯注意力,而非研究實務。
痕跡家族能看見與看不見的事#
三者之中,只有這一種不打擾研究、回溯性,且不屬於供應商——不用招募樣本、沒有同意效應、沒有待售產品,而且可回溯到 2015 年;另外兩種家族各自只有一個 2026 年時間窗。它看不到的,卻正是本頁討論的核心:**痕跡儀器觀察的是已出版成果,不是任務。**論文位於流程末端,因此寫作之前的事情完全不會留下痕跡——文獻篩選、被棄置的分析、設計後放棄的實驗皆然。而主題指標與文字指標回答的是不同問題,調查卻將兩者放在同一節裡處理。
這對上文遙測與問卷之間的矛盾有何影響#
它無法解決矛盾,原因值得精確說明。矛盾關乎資料分析——ATLAS 科學互動中 42.5% 屬於「分析與建模量化研究資料」,而 49.9% 的博士生不自在於委託 AI 收集與分析資料。分析對痕跡儀器而言不可見:借助模型進行迴歸分析,與自行進行迴歸分析,留下的論文完全相同。因此,第三種家族對爭議項目沒有任何可說的。
但它確實與相鄰項目有關,而且只支持一種解讀。撰寫研究論文是博士生最排斥的任務——31.0% 能接受,50.0% 不自在,在五項任務中負向差距最大;寫作也正是痕跡儀器最容易偵測到 AI 使用的任務:在問卷執行整整一年前,電腦科學產出中已有 22% 帶有 AI 修改文字。在上述四種解讀中,這支持**(4):表態態度不支配行為**,而且是既有兩種儀器無法檢驗的解讀,因為它們都在同一時間、從受訪者同一側觀察。這也削弱了寫作項目上的**(2)不同測量概念說**:「你對 AI 撰寫研究論文有多自在」與「已發表論文中有多少帶有 LLM 修改文字」的指涉相近,因此 22% 與 50% 不自在之間的落差,很難只歸因於測量概念偏移。
有四個因素使這項證據還不足以定論。各研究的母體並不重疊(Liang 的語料來自 arXiv/bioRxiv/Nature 出版品作者;問卷對象是博士生,其中只有 76% 為 STEM,且未單獨報告電腦科學)。「LLM 修改」不等於「LLM 撰寫」——估計方法偵測的是詞頻分布偏移,因此潤飾作者自己的草稿與代為生成文字都會被計入,但自在程度題項問的是後者。日期相隔九個月且方向相反(2024 年 9 月的痕跡,對比 2025 年 5 至 6 月的態度),因此差距可能反映態度跟上行為,而非兩者分歧。估計是母體層級資料,無法指出哪些論文,因此不能依受訪者特徵切分。誠實的說法是:這是本資料集首次顯示接受界線與行為界線在某項任務上並不一致的證據,但兩邊的母體並未配對。
問卷所揭示的制度風險,也就是重述本頁 §5.2 的論點#
§7.1.2 不用問卷資料提出博士訓練論點:若 AI 取代「博士生、博士後研究人員或其他早期生涯科學家」所做的工作,失去的不是產能,而是知識傳遞機制——「默會知識、方法判斷、專業規範與共享的科學價值觀」,其中大多數「無法完全形式化或編碼化」。Jedlička 以法律與軟體開發為先例,指出自動化減少了入門職位需求,並說明由此產生的矛盾:**科學生產力提升,人類參與、訓練與職涯發展的機會卻減少。**這是認知公地論點在科學領域的應用,作者並未引用該論點;它從科學哲學而非 HRD 得出,屬於practitioner-opinion,沒有測量資料支持,而公地頁面至少還有 Canaries 修訂版。它除了重述論點以外的唯一貢獻,是堅持提出對稱的可能性:若 AI「旨在支援人類研究者,而非只依成效評估」,相同的制度整合也可能增加科學領域的就業。問卷沒有任何資料能判定這兩種可能性。
脆弱之處#
- **沒有時間維度。**遙測資料與 ATLAS v1.0 使用相同的 2026 年 4 月時間窗;問卷則只在 2026 年中執行一次。除透過受訪者回憶「三年前」與「兩年前」的情況外,本文沒有測量任何時間變化,而這正是報告中最薄弱的測量方式。
- **每一項影響力主張都依賴自陳。**6.9 小時、驗證占比、待處理工作、風險取向,全都是受訪者的感受。遙測部分看得到人們把哪些任務交給 Gemini,卻看不到節省的時間、任務是否完成或最終結果(註 14)。
- 樣本涵蓋不同資歷,卻未加以分析。附錄 3 報告 356 位資深、234 位中生涯、47 位早期生涯,以及約 13 年的平均經驗;但論文完全沒有依職涯階段分析採用情形、節省時間或驗證成本——現成的專業程度梯度沒有被計算。也沒有依性別切分的結果。
- 分類器準確度會隨粒度提高而下降,與 v1.0 的情形相同——任務層級主張的數字與影響見 Usage-Telemetry Classifier Validation。
- **模型清單不是普查。**作者兩度如此說明:它偏向知名、容易看見的開放模型,漏掉客製化、針對特定研究設計的模型、微調模型與商業模型。
延伸閱讀#
- The Tragedy of the Cognitive Commons — 問卷 §7.1.2 的制度風險,是作者未引用該論點,卻將其應用於科學領域:取代博士生與博士後的工作會移除傳遞默會知識與方法判斷的機制,產出增加的同時,成為科學家的機會卻減少
- Task Saturation: Broad but Shallow AI Diffusion — 同一份遙測資料,依職業而非學科切分。科學領域位於該頁所測分布的高端:SOC 19 的使用比率高出就業占比 2.7 倍,科學互動在同一領域專業度分類器上的分數高出 26%;使用的是相同消費者介面與相同兩週時間窗
- Organizational Complements to AI — 在研究生產函數中測量互補品論點:任務層級的加速之所以沒有轉化為產出,是因為工作組合中的剩餘任務形成限制
- Autonomous Scientific Discovery — 同一問題的能力面向。該頁探討缺少快速驗證器的自主系統是否會加重驗證瓶頸;本頁則記錄在職科學家如何描述自己一週的工作
- Returns to Expertise in Agentic Coding — 母體中的專家群體,具自陳的節省時間幅度,卻沒有專業程度梯度
- Conversation Artifacts — 科學互動比平均工作對話多 19% token、多 11% 對話輪次;這是在第二間實驗室的遙測資料中,重現 Anthropic 所見「運算量追隨價值」的規律
- Usage-Telemetry Classifier Validation — 遙測部分的測量基準,如今又加入第二套經驗證的分類器堆疊
- Exposure Taxonomy: Observed, Theoretical, Reported, Anticipated — 同一母體的另一組儀器配對:遙測與自陳分歧,且方向與問卷的選擇偏誤預測相同
- Verification as the New Bottleneck — 此處測得的驗證成本,在軟體工程領域的對應版本;節省時間中有 45.7% 用於查核,正如審查成為限制因素
- Google AI & Economy ATLAS — 本文承接的計畫、共用資料集與方法
- Anthropic Economic Index — 另一套儀器;其 SOC 19 代表性偏高(約 4.5 倍),是論文用來交叉檢查主要結果的依據
- Telemetry vs. Survey Measurement — 本頁現在納入兩種觀察同一職業的儀器家族,且它們對同一任務的結果不一致:42.5% 的科學 Gemini 互動是量化分析,但 49.9% 的博士生不自在於委託 AI 收集與分析資料
- Psychological Costs of AI Adoption — 能動性置換預測,採用成本取決於 AI 接手多少角色中的生成性工作;博士生正好在這些任務周圍劃出抗拒界線,但研究對象與方法都不同
- Procedural Value in AI Decisions — 同樣測量過程優先於結果的偏好,對象則是受 AI 系統評斷的人,而非使用 AI 的人。本頁 §5.1 主張,只評分輸出品質的評估制度會忽略研究者在意的事情;該頁則將類似偏好量化為由人類掌握決策權的選擇機率增加 +0.272
- The Solo-Authorship Rebound — 一組令人不安的對照:左尾證據顯示 AI 在寫作與執行上取代共同作者,而博士生在這些任務上恰恰最不自在。不是表態界線無法支配行為,就是取代現象發生在界線不同的人身上
- Codified vs Tacit Knowledge Exposure — §7.1.2 博士訓練憂慮背後的測量機制:AI 取代明文知識並補足默會知識,因此最先影響早期生涯工作者;Canaries 證據正是本問卷論點所缺少的,也讓「知識傳遞機制」的損失成為具體預測,而非單純恐懼
- The Enterprise AI Adoption Gradient — ATLAS 排除的母體有另一套以行政紀錄為依據的互補儀器:此處沒有企業合約,彼處只有企業合約,因此科學工作解讀與企業規模梯度取自採用 AI 經濟體中互不重疊的部分
尚待解答的問題#
- 驗證成本(節省時間的 45.7%,超過 25%)只在 2026 年中期的模型上測量過一次。模型更可靠後,這個比例會下降嗎?還是無論紅利多大,都會有大致固定的比例用於驗證——這是使用自己未產出的成果所需支付的代價?若此計畫下一輪在稍後時間窗提出相同問題,即可檢驗此假設。
- 問卷記錄了全部 637 位受訪者的職涯階段(356 位資深/234 位中生涯/47 位早期生涯),卻沒有依此切分結果。其他儀器發現的專業程度梯度——經驗較豐富者使用更多、成效也更好——若在科學家群體中進行同樣分析,會出現嗎?#oq/source 部分已有答案(2026-09-23):Nature Graduate Survey 分析確實對科學家群體進行職涯階段切分,結果是沒有差異——博士班前兩年的三種非參照態度類別係數為 −0.057/0.019/−0.083,皆不顯著;作者將此零結果解讀為態度並非由從一開始就接觸 AI 所形成。但仍有三項限制:比較的是博士訓練內部(第 1–2 年 vs 第 3 年以上),而非資深與初階研究者;結果變項是態度類別,而非使用強度或成效;同一張表還顯示,34 歲或以下對拒絕型態為 +0.297(p<0.05),因此有限的梯度反而與專業報酬的先驗預期相反。
- LLM 與專業模型的互補性(第三層彈性 0.2)是快照;作者預期,隨著前沿 LLM 吸收數學、基因體學與生命科學的領域任務,這個數字會改變。下一輪的彈性會上升嗎——這會是其中一類開始取代另一類的訊號嗎?
- 接受度排序(文獻工作被接受,寫作/分析/設計遭拒)同樣符合規範解釋(那些任務涉及著作權責),也符合可靠性解釋(模型最不擅長那些任務)。問卷無法區分兩者,因為它從未詢問正當性或受訪者感知的準確度。若固定任務並改變模型可靠性的說明,或分別詢問自在程度與正當性,界線會移動嗎?
- 在相同的領域分類中,讓痕跡儀器與態度儀器同時觀察:某領域可偵測的 LLM 修改文字比例,會隨研究者對 AI 寫作的自陳自在程度而變動、呈反向變動,還是毫不相關?Liang 等人按領域報告數據(電腦科學約 22%,數學約 9%),Nature Graduate Survey 資料也已公開於 figshare,因此任何能對應兩者領域分類的人今天就能回答;但兩篇論文都未進行此分析,相關方向將決定「態度落後於行為」與「態度是行為遵循的領域規範」哪一種說法較合理。
- 英語母語者身分是共變數模型中影響最大的係數(對「維持現狀型」為 +1.047,對「通用型」為 −0.777,兩者皆 p<0.01),但論文完全未提。科學領域對 AI 的接受度是否部分受到語言近用影響——第二語言研究者接受 AI 作為語言支援,母語者則沒有這項需求?在控制國家所得與機構資源後,這種差異仍會存在嗎?
資料來源#
- Google AI & Economy ATLAS: AI in Science (September 2026) — AI in Science: Early Insights,Codreanu、Imas、Mateos-Garcia 等人(Google、Google DeepMind、MIT FutureTech、University of Chicago、Oxford、CMU、Penn、CUNEF),2026 年 9 月,42 頁,
empirical,具有供應商利益衝突。§2(資料與測量)、§3(科學領域的 LLM 使用,圖 1–4)、§4(專業模型,圖 5–10)、§5(問卷,圖 11–14)、§6(限制)、附錄 1–3(分類器驗證、模型清單建置、問卷組成)。解析說明:由 PDF 轉換(docling 2.126.0,MLX 版面與表格階段,42 頁、2 個表格、14 張圖,信心等級為excellent)。作者資訊區塊與表 1皆出現標籤欄重複/分割(「Computer (CS) | Science」),屬常見的分組標籤合併問題——因此表 1 的內容取自 §3.3 文字,而非其列項。本文的問卷與任務占比數據皆取自圖表圖片(圖 4、11、13、14),並與內文核對;如有差異即為四捨五入(文字稱「約 44%」,圖 13A 為 43.5%),本文採用圖表數值 - 部落格文章 「New insights from Google's AI & Economy ATLAS」(Iscenko 與 Strand,blog.google,2026-09-15)以公告區塊形式重現於原始文件頂端,提供本報告未涵蓋的 ATLAS 整體分類結果——印度藝術/設計/媒體職業占工作 AI 使用量的 19%(全球平均的 1.6 倍);美國電腦與數學職業占 30%(是世界其他地區的兩倍);巴西與德國的手動任務使用量為 7%,日本則為 4%。這些是 ATLAS v1.0 資料集的部落格主張,應視為
vendor-claim等級,而非本論文的發現;引用時應指向該公告 - Normative boundaries of AI in scientific work: Evidence from PhD researchers — Normative boundaries of AI in scientific work: Evidence from PhD researchers,Francesco Angelini(義大利獨立研究者,通訊地址在 Bologna)與 Johan Lyrvall(Inria,Villeneuve-d'Ascq),arXiv 2608.25678,2026-08-26,15 頁,
empirical。次級分析:資料來自 Nature's Graduate Survey 2025(Springer Nature 與 Thinks Insights & Strategy 合作,2025 年 5 至 6 月執行,公開於 figshare),並非作者自行收集,因此利益衝突屬於 Springer Nature——出版社調查自身讀者對其編輯政策所規範之作法的看法——而非工具供應商。§3(方法與樣本)、§4(四類解答、共變數模型)、§5.1–5.4(治理、技能養成、常態化、限制)。解析說明:由 PDF 轉換(docling 2.126.0,MLX 版面與表格階段,15 頁、5 個表格、0 張圖片,信心等級為excellent)。原始資料含一則涵蓋表 4 與表 5的[!note]資料匯入修正區塊:表 4 中兩個文獻部分的neither/somewhat uncomfortable儲存格合併後,後續欄位整體向下錯列一列;表 5 的儲存格文字分散於不同表格列,且博士班前兩年共變數整列遭靜默遺漏。編製本文時,已透過同一 PDF 的pdftotext -layout(第 11–15 頁)逐格重新核對五張表:表 1、2、3 未經修復且完全吻合,修復後的表 4 與表 5 現在也符合參照解析結果,包含補回的共變數列。因此,本文引用的此來源數字都經參照核對,而非只取自 docling 表格 - Quo Vadis? Scientific Discovery in the Age of Artificial Intelligence — Petr O. Jedlička(Institute of Philosophy, Czech Academy of Sciences),Quo Vadis? Scientific Discovery in the Age of Artificial Intelligence,arXiv 2608.17970,2026-08-18,40 頁,
practitioner-opinion。本文只引用 §3(科學計量彙編與圖 1–2)及 §7.1.2(訓練流程風險)。這是一篇單一作者的調查,沒有原創測量;文中每項科學計量數字都是次級資料——Ding/Lawson/Shapira、Stanford AI Index 2026 與 Liang 等人的資料都不在此語料中,因此數字反映調查作者對資料的解讀,而非直接查閱原始來源。兩張圖是作者自行在 nature.com 搜尋關鍵字的結果,沒有明確納入標準。解析說明:由 PDF 轉換(docling 2.126.0,MLX 版面與表格階段,40 頁、0 個表格、2 張圖片,信心等級為excellent)。沒有表格風險,但 §3 文字段落順序在 docling 文字流中遭到打亂——相鄰段落的句子互相交錯,且一段關於 Liang 等人的句子被拆成兩段。本文引用的所有數字都已透過該文件的pdftotext -layout(第 6–8 頁)重新閱讀,且與內文完全一致;參考書目中的頁碼範圍有 en dash 遺失(「50935114」原應為 5093–5114),但不影響任何內文數字。上述圖表數值依兩階段規則從兩張圖片讀取,並與內文所述端點核對。類型、學科概覽與限制的完整討論見 Autonomous Scientific Discovery
Cited by 17
- Autonomous Scientific Discovery×8
Ai Adoption In Scientific Work — the adopter-side complement to this page's capability claims: what…
- Open Questions Backlog×4
Ai Adoption In Scientific Work: The survey holds career stage for all 637 respondents (356 senior /…
- Conversation Artifacts×3
Replicated on a second lab's telemetry, in the one direction it was easy to check (September 2026).…
- Google AI & Economy ATLAS×3
Ai Adoption In Scientific Work — the September 2026 follow-on: the same corpus re-cut for science,…
- Organizational Complements to AI×3
google atlas ai in science september 2026 — AI in Science: Early Insights (Google, Google DeepMind,…
- Psychological Costs of AI Adoption×3
Ai Adoption In Scientific Work — agency displacement arriving from the other side of the decision.…
- The Solo-Authorship Rebound×3
It sits awkwardly next to what researchers say they will let AI do (2026-09-23). The substitution…
- Usage-Telemetry Classifier Validation×3
google atlas ai in science september 2026 — AI in Science: Early Insights (Google, Google DeepMind,…
- Exposure Taxonomy: Observed, Theoretical, Reported, Anticipated×2
google atlas ai in science september 2026 — AI in Science: Early Insights (Google, Google DeepMind,…
- Procedural Value in AI Decisions×2
Ai Adoption In Scientific Work — the same process-over-outcome preference, held by the people who…
- Returns to Expertise in Agentic Coding×2
google atlas ai in science september 2026 — AI in Science: Early Insights (Google, Google DeepMind,…
- Telemetry vs. Survey Measurement×2
normative boundaries ai science — Angelini & Lyrvall (independent / Inria), Normative boundaries of…
- Codified vs Tacit Knowledge Exposure
Ai Adoption In Scientific Work — the same mechanism argued for science without measurement:…
- The Enterprise AI Adoption Gradient
Ai Adoption In Scientific Work — the population this admin-record study excludes by construction,…
- AI Economics & Labor
Ai Adoption In Scientific Work — Three instrument families on one profession. Google ATLAS…
- Task Saturation: Broad but Shallow AI Diffusion
Ai Adoption In Scientific Work — the same corpus and the same two-week window, re-filtered to the…
- The Tragedy of the Cognitive Commons
Ai Adoption In Scientific Work — this argument reached independently from philosophy of science and…
Related articles
- Exposure Taxonomy: Observed, Theoretical, Reported, Anticipated
Four distinct ways to measure AI's reach into an occupation — observed exposure (tasks seen done with Claude), theoreti…
- Organizational Complements to AI
The general-purpose-technology argument: AI productivity gains depend on complementary workflow, skill, and org-design…
- Conversation-to-Delegation Shift
OpenAI's Codex usage study (June 2026): the move from conversational AI ('asking') to agentic AI ('delegated production…
- Returns to Expertise in Agentic Coding
Anthropic's 400K-session study: domain expertise (not coding skill) is what amplifies an agent — experts get 2× the act…
- The Automation–Optimism Link
AEI Cadences survey finding: people who use Claude in more automated ways are MORE optimistic across all six job-qualit…
