資料來源#
摘要#
OpenAI 的 The Shift to Agentic AI: Evidence from Codex(Johnston、Holtz、Richmond、Ong、Tambe、Chatterji,2026 年 6 月)的核心論點是:代理式 AI 不是能力更強的聊天機器人,而是一種不同的使用模式。 對話式系統(ChatGPT)用於交換資訊:你提問,模型回答。代理式系統(Codex)用於執行工作:你委派任務,系統代表你檢查脈絡、使用工具並修改成果物。這篇論文衡量了三類族群的轉變——個人使用者、組織使用者,以及 OpenAI 自己的員工——發現這種轉變快速、不均衡,而且最好透過產出 token,而非使用者人數來觀察。 這是 Codex 端、跨族群的補充研究,對應 Anthropic 在 Claude Code 內部的工作組成轉變:同樣是「從提問走向執行」的移動,由第二家前沿實驗室透過第二種工具測量。
證據說明。
empirical——研究來自一套針對 Codex 使用記錄的隱私保護自動分類器流程(研究人員從未讀取原始訊息);涵蓋三類族群;成長率經過索引與抽樣(使用者樣本為 3–4%,複雜度樣本為 0.1%)。有兩項應坦承的限制:這是第一方研究(OpenAI 衡量自己的產品與員工),而且OpenAI 內部使用情況明確不代表典型組織——作者將其定位為低摩擦採用的前沿預覽,而非母體估計。結果由分類器推斷而來。
密集邊際:產出 token,而非活躍使用者#
這篇論文的方法論轉向在於:計算使用者人數會低估這項轉變。 許多人仍會開啟 ChatGPT;採用 Codex 的人則使用得密集得多。因此,標題指標是截至 2026 年 6 月 11 日、過去 28 天內,Codex 在 Codex 與 ChatGPT 產出 token 總量中的占比:
| 族群 | Codex token 占比 | 28 天 Codex 採用率(廣度邊際) |
|---|---|---|
| 個人使用者 | 16.5% | 活躍使用者的 <1% |
| 組織使用者 | 63.3% | 17.3% 的使用者 |
| OpenAI 員工 | 99.8% | 幾乎普及 |
廣度/密集度之間的落差就是故事本身:不到 1% 的個人活躍使用者在 28 天內使用過 Codex,卻占個人產出 token 的 16.5%——採用者的使用強度異常高。在 OpenAI 內部,Codex 已大幅取代 ChatGPT,成為工作的介面。Codex 的每週活躍使用量在 2026 年 1 月 1 日至 6 月 1 日間增長超過五倍,而且成長最快的是非開發者,不是原本的軟體開發者族群。
同樣的廣度/密集度分離,也會按職能重現:組織中的工程師平均將 26.8% 的自身 token 產生於 Codex,但對採用 Codex 的工程師而言,Codex 占其產生總 token 的 88.3%。法律職能使用者:平均使用者 token 的 1.9%,但占該職能總量的 17.6%。採用面很淺,但一旦落地,使用就很深。
提問與執行#
這個概念上的關鍵點,是明確對照 Chatterji et al.(2025)的 How People Use ChatGPT(也是本論文的共同作者):在對話式使用中,「提問」幾乎占所有提示的一半——資訊、建議、學習。Codex 的使用則是**「執行」**:使用者委派除錯、重構、驗證、設定、文件撰寫與資料分析。論文將這些框定為生產,而非諮詢——「使用者是在要求 Codex 執行工作,而不只是提供建議。」在代理式介面中,一個使用單位對應的是委派工作流程,而非單次對話交換。(工具使用是粗略代理指標:在截至 2026 年 6 月 11 日前的一週,Codex 的 60.3% 回合相較於 ChatGPT 的 21.9% 回合呼叫了外部工具。)
衡量方式的過時:當使用變成委派,該計算什麼#
論文面向未來的主張,也連結到 wiki 的衡量主題:標準的 AI 使用衡量方式——活躍使用者、聊天數、訊息量——「隨著代理式系統擴散,可能變得較不具資訊性」。 當單一指令引發數小時的自主、多工具、多步驟工作時,訊息數便不再追蹤產出。作者提出應追蹤的替代指標:
- 委派任務複雜度(每項任務估計所需的人力工時——見任務時間跨度擴展)
- 執行時間(代理每天工作的時間——見平行代理編排)
- 工作流程重用(skills/plugins——見代理式工作系統化)
- 並行度(平行代理——見平行代理編排)
- 生產產出(代表使用者產生的 token)
這與遙測與問卷衡量及生產來源評估所秉持的「衡量系統實際做了什麼,而非代理指標」的直覺相同,只是更進一步:不只是以遙測取代問卷,而是以產出與委派指標取代互動次數指標。
三類族群作為自然實驗#
由於三個群體都能使用同一個模型,它們之間的巨大差距證明,採用取決於脈絡,而非能力——也就是組織對 AI 的互補條件論點。OpenAI 員工(邊際使用成本低、認同度高、受過訓練,且接近系統)是前沿預覽:它展示了採用摩擦接近零時,代理式使用的樣貌。他們的模式——使用分布於研究、規劃、溝通、招募與銷售;2025 年 11 月至 2026 年 6 月間,每個職能產生的 output token 都至少增加 10 倍(研究人員增加 50 倍以上)——是論文描繪的終點,而非平均情況。
產品,而不只是模型:按介面衡量自主性#
Anthropic 的 AEI Cadences 報告(2026 年 6 月)從 Claude 端提供了介面比較。以 1–5 分量表評定 AI 自主性,Claude Code 在 31 種產出類型中的 26 種,展現出比聊天/Cowork更高的自主性(平均差距**+0.37**;腳本與程式碼片段為**+0.53**)。差距的三分之二來自以更多委派執行相同任務——一篇部落格文章在聊天/Cowork 上來回互動的中位數為13 回合,但在 Claude Code 上只需單一提示——三分之一則來自不同的產出組成。關鍵是,在控制模型後,差距仍然存在:在由 Sonnet 提供服務的對話中,Claude Code 仍顯示多出**+0.26** 的自主性,即使 Code 使用 Opus 的頻率高得多(相較於聊天/Cowork 的 10%,Code 為 54%)。報告的結論——「所使用的產品可能比底層模型更重要」——正是本頁「代理式 AI 是不同的使用模式,而不是更好的聊天機器人」的介面設計對應,也呼應模型改進下的工具層收縮:決定使用者委派多少的,是工具層/介面,而不只是模型。
相關連結#
- 代理式程式撰寫工作組成轉變——Anthropic/Claude Code 對同一「提問→執行」移動的遙測;這是 OpenAI/Codex 的跨族群補充(兩家實驗室、兩種工具、同一項轉變)
- 對話成果物——同一份 Cadences 報告中的成果物配套;自主性與運算量會在成果物之間共同移動(r = 0.68)
- AI 使用節奏——該報告的時間節律章節;這項擴散中委派的廣度節奏
- 自動化—樂觀連結——認知章節:自動化占比(本頁的委派,由問卷衡量)預測工作者樂觀程度
- 暴露分類法:觀察到的、理論上的、回報的、預期的——問卷的信念面衡量,補足這項行為面轉變
- Anthropic Economic Index——姊妹研究計畫;其專業回報報告被這份 OpenAI 研究引用
- 代理式程式撰寫中的專業回報——本研究引用之報告中的配套發現(Hitzig et al. 2026):當工作變成委派時,關鍵的人類技能是領域理解加監督,而非執行
- AI 的組織互補條件——在同一模型下,為什麼三類族群差異如此之大:價值取決於工作流程/權限/技能互補,而不只是能力
- 代理式工作系統化——三種「如何」邊際之一:臨時委派逐漸固化為可重用的 skill/plugin 例程
- 平行代理編排——另外兩種「如何」邊際:並行度與長時間執行,也就是密集使用者的工作流程
- 任務時間跨度擴展——委派任務複雜度(超過 8 小時任務的占比從 2.1% 上升至 25.6%)是可靠任務長度上限上升的使用面解讀
- 規劃/執行分工——委派是已實現的一半:每個提示引發多少自主工作,以及使用者實際交出了多少工作
- 遙測與問卷衡量——衡量過時的論點在此延伸:不只是以遙測取代問卷,也是以委派指標取代互動次數
- 驗證成為新瓶頸——當使用從提問轉向委派,人類角色轉向審查、監督與協調,也就是此處指出的瓶頸
- 工程師與 PM 的融合——密集使用者「管理一組代理式工作」,轉向委派/監督/整合;這是使用資料中看到的角色融合
- AI 作為主要作者——委派式生產意味著作者身分轉移給代理;token 占比數字顯示了這項轉移走了多遠
- 模型改進下的工具層收縮——使用面上,工具層收縮所促成的正是委派增加:每項任務需要較少手把手引導,交出去的工作更多
- OpenAI——這是其 Codex 遙測資料所屬的實驗室,其內部使用情況也是前沿預覽
- Codex——本研究衡量其採用情況的代理式工具
- 以市場定價的 AI 暴露(AI 溢價)——對同一提問→執行移動的獨立、跨供應商佐證:Borri-Liu-Tsyvinski 的 OpenRouter 面板(400 多個模型,而非單一實驗室)顯示代理式 token 占比——完成原因為
tool_calls的請求——從 2024 年約為 0,上升至 2026 年初的52.2%。同一項轉變,是在任何單一供應商產品之外進行的衡量;其「密集邊際,而非使用者人數」定價,也與本頁的「產出 token,而非活躍使用者」相互呼應
待解決的問題#
- token 占比指標會獎勵冗長的代理式產出。99.8%/63.3%/16.5% 的分布中,有多少是真實的工作轉變,又有多少只是代理式工具針對每單位人類意圖產生了更多 token?
- OpenAI 內部使用依假設是前沿預覽。外部組織的曲線是否真的沿著 OpenAI 路徑前進(這是論文的隱含主張),還是會在採用摩擦沒有消失的地方達到平臺期?
- 「提問占 ChatGPT 的一半,執行占 Codex 的大多數」——但兩種工具會自行選擇不同的工作。有多少提問→執行的對比是轉變本身造成的,又有多少只是把原本就屬於「執行」的任務導向為其打造的工具?
資料來源#
- The Shift to Agentic AI: Evidence from Codex——摘要;§1 Introduction(四項風格化事實);§3 Who Uses Agentic AI;§6 Conclusion
- Anthropic Economic Index report: Cadences——Anthropic Economic Index Cadences(2026 年 6 月),第 2 章 §"How much autonomy does Claude have to decide on its own?"(按介面衡量自主性、控制模型)
- Chatterji et al. (2025), How People Use ChatGPT (NBER WP 34255)——此處用來對照的對話式 AI「提問 ≈ 一半」基準
Cited by 28
- Agentic Work Systematization×3
One of three "how" margins OpenAI's Codex usage study uses to measure whether agentic AI is moving…
- Conversation Artifacts×3
Conversation To Delegation Shift — the autonomy/delegation lens; compute and delegation co-move (r…
- Market-Priced AI Exposure (the AI Premium)×3
Defining agentic requests as those whose finish reason is tool_calls, the agentic share of tokens…
- Organizational Complements to AI×3
The economics frame OpenAI's Codex usage study uses to explain why agentic-AI adoption is so uneven…
- The Automation–Optimism Link×2
The delegation-breeds-anxiety story is too simple. Proximity to automation correlates with…
- Codex×2
Conversation To Delegation Shift — the June 2026 usage study built on Codex telemetry; its adoption…
- OpenAI×2
Workforce-economics research. Its June 2026 study The Shift to Agentic AI: Evidence from Codex uses…
- Parallel Agent Orchestration×2
Two of the three "how" margins in OpenAI's Codex usage study — concurrency (running multiple agents…
- Task Crossover×2
Conversation To Delegation Shift — the same lab's prior usage telemetry, on the intensity axis…
- Agentic Coding Work-Composition Shift
Conversation To Delegation Shift — the OpenAI/Codex, cross-population telemetry of the same…
- AI as Primary Author
Conversation To Delegation Shift — delegated production is authorship moving to the agent; Codex's…
- AI Usage Cadences
Conversation To Delegation Shift — the intensive-margin usage study; cadences is the extensive…
- Anthropic Economic Index
Conversation To Delegation Shift — OpenAI's Codex usage study is the cross-lab counterpart; it…
- Claude Code
Conversation To Delegation Shift — the AEI Cadences report finds Claude Code drives higher AI…
- Engineer PM Convergence
Conversation To Delegation Shift — OpenAI's Codex study sees the same convergence in usage:…
- Exposure Taxonomy: Observed, Theoretical, Reported, Anticipated
Conversation To Delegation Shift — the intensive-margin usage evidence behind observed exposure…
- Google AI & Economy ATLAS
Conversation To Delegation Shift — OpenAI's Codex study, the third lab's usage instrument; ATLAS's…
- Harness Shrinkage as Models Improve
Conversation To Delegation Shift — rising delegation (Codex token share by population) is what a…
- AI Economics & Labor
Conversation To Delegation Shift — OpenAI's Codex usage study (June 2026): the move from…
- Open Questions Backlog
Conversation To Delegation Shift ×3 (oldest 47d) — The token-share metric rewards verbose agentic…
- Planning / Execution Division of Labor
Conversation To Delegation Shift — the cross-population realized-autonomy data: how much work users…
- Production-Sourced Evaluation
Conversation To Delegation Shift — its measurement-obsolescence argument is the same instinct one…
- Returns to Expertise in Agentic Coding
Conversation To Delegation Shift — OpenAI's Codex study cites this report (Hitzig et al. 2026) and…
- Shared Harness, Differentiated Surfaces
Conversation To Delegation Shift — the usage trend that motivated the merge: OpenAI reports…
- Task Saturation: Broad but Shallow AI Diffusion
Conversation To Delegation Shift — the delegation reading from OpenAI's Codex data; ATLAS's <10%…
- Task Time-Horizon Scaling
Conversation To Delegation Shift — the usage-side reading of this ceiling: OpenAI's Codex study…
- Telemetry vs. Survey Measurement
Conversation To Delegation Shift — the third major usage-telemetry study (OpenAI/Codex, empirical),…
- Usage-Telemetry Classifier Validation
The entire genre of AI-usage economics — Anthropic's Economic Index, OpenAI's Codex study, Google's…
Related articles
- Returns to Expertise in Agentic Coding
Anthropic's 400K-session study: domain expertise (not coding skill) is what amplifies an agent — experts get 2× the act…
- Exposure Taxonomy: Observed, Theoretical, Reported, Anticipated
Four distinct ways to measure AI's reach into an occupation — observed exposure (tasks seen done with Claude), theoreti…
- Claude Code
Anthropic's agentic coding product; created by Boris Cherny late 2024; TypeScript/React on Bun (itself Claude-rewritten…
- Open Questions Backlog
_456 actionable open questions across 205 pages · 107 predictions · 9 notes · 147 in progress · 69 watching (entities),…
- Anthropic Economic Index
Anthropic's recurring economic-research program measuring how Claude usage maps to and diffuses through the economy — p…
