H
Howardism
Plate IIAI Economics & Labor機器翻譯 · machine-translatedENHOWARDISM

對話轉向委派

OpenAI 的 Codex 使用研究(2026 年 6 月):從對話式 AI(「詢問」)轉向代理式 AI(「委派生產」),以 Codex 在三種族群中的輸出 token 占比衡量——OpenAI 內部 99.8%/組織 63.3%/個人 16.5%——採用範圍也擴及開發者以外;當使用單位從對話轉為委派工作流程,標準使用指標(活躍使用者、聊天)就變得較不具資訊量

Article metadata
Publication details
Published:June 26, 2026
Filed:Concept
Domain:AI Economics & Labor
Tags:GovernanceWorkforceAI Coding WorkflowEngineering MetricsEmpiricalOpenai
Reading:19 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

對話轉向委派的插圖

資料來源#

摘要#

OpenAI 的 The Shift to Agentic AI: Evidence from Codex(Johnston、Holtz、Richmond、Ong、Tambe、Chatterji,2026 年 6 月)的核心論點是:代理式 AI 並非能力更強的聊天機器人,而是一種不同的使用模式。 對話系統(ChatGPT)用來交換資訊:你提問,模型回答。代理式系統(Codex)則用來執行工作:你委派任務,系統便檢視情境、使用工具,並代表你修改產物。論文衡量個人使用者、組織使用者,以及 OpenAI 員工這三種族群的轉變,發現這項轉變快速、並不平均,而且透過輸出 token 比透過使用者人數更能看清楚。 這篇文章是 Codex 這一側、跨族群的補充研究,對照的是Anthropic 在 Claude Code 內觀察到的工作組成轉變:同樣是「從詢問走向執行」的變化,由第二家前沿實驗室在第二種工具上進行衡量。

證據說明。 empirical——研究使用隱私保護、自動分類器流程分析 Codex 使用紀錄(研究者從未閱讀原始訊息);涵蓋三種族群;成長幅度採索引化並抽樣(使用者樣本 3–4%,複雜度樣本 0.1%)。有兩項應坦承的限制:這是第一方研究(OpenAI 衡量自家產品與員工),而且OpenAI 內部使用情況明確不代表一般組織——作者將之定位為低摩擦採用的前沿預覽,而非族群估計。研究結果由分類器推斷。

密集邊際:看輸出 token,而不是活躍使用者#

這篇論文的方法論轉折在於:計算使用者人數會低估這項轉變。 許多人仍會開啟 ChatGPT;但採用 Codex 的人,使用強度高得多。因此,論文的核心指標是截至 2026 年 6 月 11 日的前 28 天內,Codex 生成的輸出 token 占 Codex 與 ChatGPT 輸出 token 總量的比率:

族群Codex token 占比28 天 Codex 採用率(廣延邊際)
個人使用者16.5%活躍使用者的 <1%
組織使用者63.3%使用者的 17.3%
OpenAI 員工99.8%幾乎普遍採用

廣延與密集邊際之間的落差就是關鍵:28 天內接觸過 Codex 的個人活躍使用者不到 1%,卻占個人輸出 token 的 16.5%——採用者的使用量異常高。在 OpenAI 內部,Codex 已大致取代 ChatGPT,成為工作介面。2026 年 1 月 1 日至 6 月 1 日間,每週活躍 Codex 使用量總計成長超過五倍,而成長最快的是非開發者,不是原本的軟體開發者族群。

同樣的廣延/密集落差也出現在職務別:組織中的工程師平均有 26.8% 的個人 token 用於 Codex;但在採用 Codex 的工程師所生成的 token 總量中,Codex 占88.3%。法律職務使用者的 Codex token 占個人平均 token 的 1.9%,但占該職務 token 總量的 17.6%。採用面不廣,但一旦採用,使用就很深入。

詢問與執行#

這項概念轉折明確借鑑 Chatterji 等人(2025)的研究 How People Use ChatGPT(本篇論文的共同作者之一):在對話式使用中,近半數提示都是**「詢問」——索取資訊、建議或學習。Codex 的使用則是「執行」**:使用者委派除錯、重構、驗證、設定、文件草擬與資料分析。論文將這些活動界定為生產而非諮詢——「使用者要求 Codex 執行工作,而不只是提供建議。」在代理式介面中,一個使用單位對應的是委派工作流程,而不是單次對話。(工具使用是粗略的替代指標:截至 2026 年 6 月 11 日前一週,Codex 回合中有 60.3%、ChatGPT 回合中有 21.9% 呼叫外部工具。)

衡量方式失效:當使用變成委派,該計算什麼#

論文對未來的主張,也連結到 wiki 中的衡量主題:標準的 AI 使用指標——活躍使用者、聊天次數、訊息量——「隨著代理式系統普及,可能會變得較不具資訊量」。 當一條指令就能啟動數小時、自主使用工具的多步驟工作,訊息數便無法再追蹤產出。作者提出應改為追蹤以下指標:

這延續了 Telemetry vs. Survey Measurement 與 Production-Sourced Evaluation 所體現的相同思路:「衡量系統實際做了什麼,而不是替代指標」;更進一步說,不只是遙測優於問卷,而是輸出與委派指標優於互動次數指標。

將三種族群視為自然實驗#

由於三組人都能使用同一個模型,他們之間的巨大差異顯示,採用取決於情境而非能力——這正是組織互補條件論點。OpenAI 員工(邊際使用成本低、認同度高、接受過訓練,且接近這些系統)是前沿預覽:當採用摩擦接近零時,代理式使用會是什麼樣子。他們的使用模式——涵蓋研究、規劃、溝通、招募、銷售;2025 年 11 月至 2026 年 6 月間,所有職務的輸出 token 都增加**≥10 倍**(研究人員增加 50 倍以上)——呈現的是論文所描繪的終點,而非平均狀況。

不只是模型,也是產品:不同介面的自主程度#

Anthropic 的 AEI Cadences 報告(2026 年 6 月)從 Claude 一側提供不同介面的比較。若以 1–5 分衡量 AI 自主程度,Claude Code 在 31 種輸出類型中的 26 種都比聊天/Cowork展現出更高自主性(平均差距 +0.37;腳本與程式碼片段為 +0.53)。差距的三分之二來自同一任務交由系統執行時委派程度更高——在聊天/Cowork 中,一篇部落格文章的撰寫往返中位數為 13 回合,在 Claude Code 中卻只需一個提示——另三分之一則來自輸出組成不同。關鍵是,即使控制模型後,差距依然存在:在由 Sonnet 服務的對話中,Claude Code 的自主性仍高出 +0.26,儘管 Code 使用 Opus 的頻率高得多(54%,而聊天/Cowork 為 10%)。報告的結論——「所使用的產品可能比底層模型更重要」——正是本頁「代理式 AI 是不同的使用模式,而非更好的聊天機器人」的介面設計對照,也呼應了 Harness Shrinkage as Models Improve:決定使用者委派多少工作的,是 harness/介面,不只是模型。

組織採用邊際,以及停滯之處(McKinsey,2026 年 8 月)#

上述轉變是透過三種使用者族群中的 token 衡量。The state of AI in 2026(McKinsey/QuantumBlack,2026-08-25,empirical,但採自陳資料;97 個國家的 1,719 名受訪者)衡量的則是組織採用邊際——有多少組織已進入使用可支援委派的工具進行擴大規模階段;結果顯示,對話的進展約是委派的兩倍,而且大型與小型組織之間的差距正在擴大。

已達「至少擴大規模」階段全體營收 ≥$1B營收 <$1B
AI 聊天機器人476439
專用 AI 工具—3520
軟體編碼代理程式~203117
其他 AI 代理程式~202513

逐年比較,至少有一項職能中的代理程式擴大規模比例,在營收超過 $1B 的組織中由 27% → 40%,在營收低於該門檻的組織中則由 21% → 22%(圖表 2)。AI 高績效者擴大委派工具的規模,速度約為其他人的兩倍(編碼代理程式 40% 對 20%,其他代理程式 40% 對 15%;圖表 13)。按職能來看,整體擴大規模比率多在個位數至低雙位數——知識管理 11%、軟體工程 10%、IT 12%——而科技產業中的軟體工程則升至 31%(側欄圖表)。

因此,整體族群的樣貌不是沿著「對話→委派」路徑前進的單一曲線,而是分化:委派邊際在大型企業推進,在小型企業則持平。使用這些數據時有兩項提醒:這衡量的是組織的部署階段,而非委派工作的占比,因此與前述 token 占比是不同數量,不能直接用數字比較;而且編碼代理程式項目是這份調查中「不知道」比例最高的項目(大型企業為 11%),在已確認職務的 1,490 名受訪者中,654 人是 C-level。

同一實驗室的企業帳冊:對話基準(2026 年 8 月)#

How Organizations Use AI: Evidence from ChatGPT(Chatterji、Holtz、Rakholia、Tambe 與 Weeratunga,arXiv 2608.12236,empirical)是上述 Codex 研究在 ChatGPT 一側的對照研究——兩篇論文有兩位共同作者 Holtz 與 Chatterji——並衡量本頁 token 占比的分母母體。完整分析見 The Enterprise AI Adoption Gradient。

這篇研究在此有三項貢獻。以 token 而非問卷階段衡量外部組織曲線: ChatGPT Enterprise 客戶的輸出 token 總量在 2025 年 6 月至 2026 年 3 月間約成長七倍;而在 2025 年 6 月已採用的固定客戶群中,約成長四倍——約一半的成長發生在早已是客戶的公司內。加速成長與採用批次無關: 不同時間採用的公司都在 2026 年初同步加速,作者認為這顯示「影響 ChatGPT Enterprise 客戶整體的發展,而不只是採用後使用量的正常擴張」。而這不是代理式使用的時間序列: 論文合併計算 ChatGPT 與 Codex token,但附錄圖 A1 顯示,觀察期間的成長「幾乎完全由 ChatGPT 及相關的非代理式 AI 工具所帶動」;作者明確將 Codex 留待本頁依據的配套論文處理。

因此,委派占比是在一個本身已成長七倍的對話基礎上攀升。這對解讀組織 token 占比 63.3% 很重要:在快速擴大的分母中,占比上升,比在持平分母中占比上升所代表的主張強得多;而 Codex 論文並未說明分母屬於哪一種情況。

企業研究也補上 Codex 論文職務分類所沒有的依資歷區分的使用強度梯度:以活躍使用者為條件時,職涯早期員工與受訓人員每週傳送的訊息比同公司其他人都多(論文稱比公司平均多八到九則;圖 6 B 面板的點估計約為 +7),高階主管、創辦人與合夥人則較少。無論委派轉變帶來什麼影響,至少在對話介面上,使用強度最高的是階層底部。

相關連結#

  • The Enterprise AI Adoption Gradient——本頁 token 占比所使用的對話介面分母:ChatGPT Enterprise 輸出 token 九個月成長 7 倍(2025 年 6 月前採用的客戶群中成長 4 倍),所有採用批次同時加速,而且觀察期間的使用幾乎全為非代理式

  • Task Crossover——同一實驗室在另一個軸向上的遙測資料:本頁衡量使用強度(詢問 → 委派),交叉衡量工作邊界(自身職業的工作 → 他人的工作)。兩者中,重度使用者都打破了簡單的單調模式

  • Usage-Telemetry Classifier Validation——本頁數據尚未量化的誤差範圍:此處每個 token 占比與採用數字都經過分類器處理,而 Google ATLAS 迄今是唯一公開該層準確度的使用經濟研究計畫

  • Task Saturation: Broad but Shallow AI Diffusion——從介面而非工具觀察同一委派邊界:ATLAS 發現 Gemini API 流量中有 98.8% 與工作相關,對話流量中則有 13%;並將非例行認知工作對話中不到 10% 歸類為端對端自動化意圖——消費者介面排除了本頁所衡量的代理式編碼流量

  • Agentic Coding Work-Composition Shift——Anthropic/Claude Code 對同一「詢問→執行」轉變的遙測資料;本文是 OpenAI/Codex 的跨族群補充研究(兩家實驗室、兩種工具、一項轉變)

  • Conversation Artifacts——同一份 Cadences 報告中的產物配套章節;產物的自主性與運算量同步變動(r = 0.68)

  • AI Usage Cadences——該報告探討時間節奏的章節;呈現這項逐漸普及之委派的廣延節奏

  • The Automation–Optimism Link——探討認知的章節:自動化占比(本頁以問卷衡量的委派)可預測員工樂觀程度

  • Exposure Taxonomy: Observed, Theoretical, Reported, Anticipated——問卷衡量信念的一側,補足本頁行為的一側所呈現的轉變

  • Anthropic Economic Index——相關研究計畫;本篇 OpenAI 研究引用了該計畫探討專業知識報酬的報告

  • Returns to Expertise in Agentic Coding——本文引用報告中的配套研究發現(Hitzig 等人,2026):當工作轉向委派,人類不可或缺的技能是領域理解與監督,而非執行

  • Organizational Complements to AI——解釋為何同一模型在三種族群中表現差異如此巨大:價值取決於工作流程、權限與技能的互補條件,而非單靠能力

  • Agentic Work Systematization——三種「如何」邊際之一:將臨時委派鞏固為可重用的技能/外掛流程

  • Parallel Agent Orchestration——另外兩種「如何」邊際:並行度與長時間執行,也就是密集使用者的工作流程

  • Task Time-Horizon Scaling——委派任務複雜度(所需時間超過 8 小時的任務占比由 2.1% 升至 25.6%),是從使用面觀察可靠任務長度上限攀升的方式

  • Planning / Execution Division of Labor——委派是已實現的一側:每個提示啟動了多少自主工作,以及使用者實際交出了多少工作

  • Telemetry vs. Survey Measurement——衡量方式失效的觀點由此延伸:不僅遙測優於問卷,委派指標也優於互動次數

  • Verification as the New Bottleneck——使用從詢問轉向委派後,人類角色轉向審查、監督與協調——這正是本文指出的新瓶頸

  • Engineer PM Convergence——密集使用者「管理一組代理式工作」,轉向委派、監督與整合——使用資料呈現的職務匯流

  • AI as Primary Author——委派生產意味著作者角色轉移給代理程式;token 占比呈現了轉移的程度

  • Harness Shrinkage as Models Improve——從使用面來看,harness 縮減讓委派增加:每項任務所需的手把手引導變少,交辦出去的工作變多

  • Shared Harness, Differentiated Surfaces——OpenAI 如何因應這股趨勢:OpenAI 表示,這裡衡量的知識工作者成長(截至 2026 年 6 月約占 Codex 使用者的 20%,成長速度比開發者快 3 倍以上)正是將 Codex 整合到 ChatGPT Work、共用同一 harness 的原因

  • OpenAI——本篇 Codex 遙測資料所屬的實驗室,其內部使用情況也是前沿預覽

  • Codex——本研究衡量其採用情況的代理式工具

  • Market-Priced AI Exposure (the AI Premium)——以跨供應商方式獨立佐證同一「詢問→執行」轉變:Borri-Liu-Tsyvinski 的 OpenRouter 面板(涵蓋 400 多種模型,而非單一實驗室)顯示,代理式 token 占比——完成原因為 tool_calls 的請求——從 2024 年接近零升至 2026 年初的 52.2%。這是由單一供應商產品以外的資料衡量同一轉變;其以「密集邊際,而非使用者人數」計價,也呼應本頁的「輸出 token,而非活躍使用者」

  • Pilot-to-Production Gap——以企業工作流程為對象,前瞻性論述同一轉變,而非在開發者工具中進行衡量。 Anthropic × Accenture(vendor-claim)將超越輔助使用的理由表述為產能上限論證:「副駕駛工具的吞吐量上限仍取決於使用它的人……協助分析師更快撰寫報告的工具,仍受限於該分析師能審查並核准多少份報告。」只有端對端完成工作(處理發票並將例外情況上報、讓一線客服單從開啟到結案),才能讓吞吐量隨工作量而非人數增加。值得保留兩者的不對稱:該文件主張存在上限,卻未提供實際衡量上限的案例;本頁則提供委派輸出占比(99.8%/63.3%/16.5%),但未對上限提出主張

尚待解答的問題#

  • token 占比指標會讓冗長的代理式輸出得到較高權重。99.8%/63.3%/16.5% 的差距,有多少反映真實的工作轉變,又有多少只是代理式工具每單位人類意圖輸出的 token 更多?
  • 依據假設,OpenAI 內部使用情況是前沿預覽。外部組織的曲線是否真的沿著 OpenAI 的路徑前進(論文隱含的主張),還是會在採用摩擦未消失之處趨於平穩?已有部分答案(2026-09-22),來自 The state of AI in 2026: On the road to ROI(empirical,自陳資料;97 個國家的 1,719 名受訪者,調查於 2026 年 5 月 4 日至 6 月 8 日進行):以組織層級來看,答案是兩者皆是,依公司規模而分。營收超過 $1B 的組織中,至少在一項職能擴大 AI 代理程式規模的比例逐年由 27% 升至 40%;營收低於此門檻者則由 21% 升至 22%,呈持平狀態(圖表 2);軟體編碼代理程式也呈現相同規模差異(至少進入擴大規模階段者為 31% 對 17%,圖表 3)。因此,外部沒有單一曲線可供追蹤:大型企業邊際推進得夠快,符合前沿預覽的主張;小型組織邊際則已連續一年停滯在略高於五分之一,這正是採用摩擦未消失時的樣貌。三項限制使答案仍不完整。衡量的數量不對——是單一受訪者回報的部署階段,而非委派工作占比,因此無法與 99.8%/63.3%/16.5% 的 token 占比作數值比較。觀察期間只有一年。而且「至少擴大規模」是受訪者依自己的判斷作答;編碼代理程式項目在此調查中的「不知道」比例最高。#oq/source 另一項研究在指標相符、產品不符的情況下提供補充觀察(2026-09-23): How Organizations Use AI: Evidence from ChatGPT(empirical,涵蓋 2024-01-01 至 2026-03-31 間採用產品的組織之 OpenAI 行政紀錄)以輸出 token而非部署階段呈現外部曲線,使用與前沿預覽主張相同的單位。曲線急速上升,沒有停滯:2025 年 6 月至 2026 年 3 月總量約成長 7 倍;在 2025 年 6 月前已採用的固定客戶群中約成長 4 倍;所有批次也在 2026 年初同步加速。依據這項衡量方式,外部組織的使用持續加深,而非停滯,這較支持前沿預覽的解讀,也較不支持 McKinsey 發現的小型組織停滯現象。有兩個原因使它無法定論,而且兩者指向相反方向。產品不符:這個序列主要是ChatGPT,而非 Codex(作者如此說明,並將代理式使用的分析留待本頁依據的研究),因此衡量的是對話基礎使用加深,而非委派擴散。母體也不符,而且方向與原始主張相同——只有 ChatGPT Enterprise 買家,且偏向大型美國上市公司;這正是 McKinsey 發現正在推進的族群。無法被這項指標觀察到的,正是那些陷入停滯的組織。
  • 「ChatGPT 的使用有一半是詢問,Codex 的使用多半是執行」——但兩種工具各自吸引了不同工作。詢問與執行的差異,有多少來自使用模式本身的轉變,又有多少只是把原本就屬於「執行」的任務分流到為此打造的工具?

資料來源#

  • The Shift to Agentic AI: Evidence from Codex — 摘要;§1 導論(四項風格化事實);§3 誰在使用代理式 AI;§6 結論
  • Anthropic Economic Index report: Cadences — Anthropic Economic Index Cadences(2026 年 6 月),第 2 章「Claude 在多大程度上能自行決定?」(依介面比較自主性,並控制模型)
  • Chatterji 等人(2025),How People Use ChatGPT(NBER WP 34255)——用來對照的對話式 AI 基準:「詢問」約占一半
  • The state of AI in 2026: On the road to ROI — Dan Tinkoff、Lieven Van der Veken 與 Michael Chui,另與 Tara Balakrishnan 合著,The state of AI in 2026: On the road to ROI(McKinsey/QuantumBlack,2026-08-25,empirical,自陳資料;線上調查,97 個國家的 1,719 名參與者,調查於 2026 年 5 月 4 日至 6 月 8 日進行,依 GDP 加權)。本文引用圖表 2(2025 與 2026 年依營收級距分類的代理程式使用情況)、圖表 3(依工具與營收級距分類的階段)、圖表 13(高績效組織依工具分類的擴大規模情況),以及側欄的產業與職能熱圖。組織部署階段為自陳資料,並非工作占比指標。
  • Deploying AI from pilot to production: A practical blueprint for CIOs and technical leaders — Deploying AI from pilot to production,Anthropic × Accenture,2026-09-11,38 頁,vendor-claim。本文僅引用其副駕駛工具吞吐量上限論點(考量 07)。完整分析及證據限制見 Pilot-to-Production Gap
  • How Organizations Use AI: Evidence from ChatGPT — Chatterji、Holtz、Rakholia、Tambe 與 Weeratunga,How Organizations Use AI: Evidence from ChatGPT,arXiv 2608.12236(2026-08-12,69 頁,empirical;與上述 Codex 論文有兩位共同作者)。本文引用 §4.1 與圖 3(輸出 token 成長 7 倍/4 倍的拆解及各採用批次在 2026 年初同步加速)、註腳 13 與附錄圖 A1(企業 token 成長中非 Codex 的占比),以及 §4.3.2/圖 6(依資歷區分的使用強度梯度)。作者沒有獨立性——三位 OpenAI 員工與兩位以 OpenAI 付費承包商身分參與的學者;僅涵蓋 ChatGPT Enterprise 買家;屬描述性研究,未衡量成果。表格核對說明及來源內文與圖表之間的差異見 The Enterprise AI Adoption Gradient
§ end
Cited by 31
Related articles