H
Howardism
Plate IIAI Economics & Labor機器翻譯 · machine-translated過時翻譯 · stale translationENHOWARDISM

從對話到委派的轉變

PublishedJune 26, 2026FiledConceptDomainAI Economics & LaborTagsGovernanceWorkforceAI Coding WorkflowEngineering MetricsEmpiricalOpenaiReading10 minSourceAI-synthesised

OpenAI 的 Codex 使用研究(2026 年 6 月):從對話式 AI(「提問」)轉向代理式 AI(「委派生產」),以 Codex 在三類族群產出 token 中的占比衡量——99.8% OpenAI/63.3% 組織/16.5% 個人——且採用已擴展到開發者之外;隨著使用單位從對話轉為委派工作流程,標準使用指標(活躍使用者、聊天)變得較不具資訊性

「從對話到委派的轉變」插圖

資料來源#

摘要#

OpenAIThe Shift to Agentic AI: Evidence from Codex(Johnston、Holtz、Richmond、Ong、Tambe、Chatterji,2026 年 6 月)的核心論點是:代理式 AI 不是能力更強的聊天機器人,而是一種不同的使用模式。 對話式系統(ChatGPT)用於交換資訊:你提問,模型回答。代理式系統(Codex)用於執行工作:你委派任務,系統代表你檢查脈絡、使用工具並修改成果物。這篇論文衡量了三類族群的轉變——個人使用者、組織使用者,以及 OpenAI 自己的員工——發現這種轉變快速、不均衡,而且最好透過產出 token,而非使用者人數來觀察。 這是 Codex 端、跨族群的補充研究,對應 Anthropic 在 Claude Code 內部的工作組成轉變:同樣是「從提問走向執行」的移動,由第二家前沿實驗室透過第二種工具測量。

證據說明。 empirical——研究來自一套針對 Codex 使用記錄的隱私保護自動分類器流程(研究人員從未讀取原始訊息);涵蓋三類族群;成長率經過索引與抽樣(使用者樣本為 3–4%,複雜度樣本為 0.1%)。有兩項應坦承的限制:這是第一方研究(OpenAI 衡量自己的產品與員工),而且OpenAI 內部使用情況明確不代表典型組織——作者將其定位為低摩擦採用的前沿預覽,而非母體估計。結果由分類器推斷而來。

密集邊際:產出 token,而非活躍使用者#

這篇論文的方法論轉向在於:計算使用者人數會低估這項轉變。 許多人仍會開啟 ChatGPT;採用 Codex 的人則使用得密集得多。因此,標題指標是截至 2026 年 6 月 11 日、過去 28 天內,Codex 在 Codex 與 ChatGPT 產出 token 總量中的占比

族群Codex token 占比28 天 Codex 採用率(廣度邊際)
個人使用者16.5%活躍使用者的 <1%
組織使用者63.3%17.3% 的使用者
OpenAI 員工99.8%幾乎普及

廣度/密集度之間的落差就是故事本身:不到 1% 的個人活躍使用者在 28 天內使用過 Codex,卻占個人產出 token 的 16.5%——採用者的使用強度異常高。在 OpenAI 內部,Codex 已大幅取代 ChatGPT,成為工作的介面。Codex 的每週活躍使用量在 2026 年 1 月 1 日至 6 月 1 日間增長超過五倍,而且成長最快的是非開發者,不是原本的軟體開發者族群。

同樣的廣度/密集度分離,也會按職能重現:組織中的工程師平均將 26.8% 的自身 token 產生於 Codex,但對採用 Codex 的工程師而言,Codex 占其產生總 token 的 88.3%。法律職能使用者:平均使用者 token 的 1.9%,但占該職能總量的 17.6%。採用面很淺,但一旦落地,使用就很深。

提問與執行#

這個概念上的關鍵點,是明確對照 Chatterji et al.(2025)的 How People Use ChatGPT(也是本論文的共同作者):在對話式使用中,「提問」幾乎占所有提示的一半——資訊、建議、學習。Codex 的使用則是**「執行」**:使用者委派除錯、重構、驗證、設定、文件撰寫與資料分析。論文將這些框定為生產,而非諮詢——「使用者是在要求 Codex 執行工作,而不只是提供建議。」在代理式介面中,一個使用單位對應的是委派工作流程,而非單次對話交換。(工具使用是粗略代理指標:在截至 2026 年 6 月 11 日前的一週,Codex 的 60.3% 回合相較於 ChatGPT 的 21.9% 回合呼叫了外部工具。)

衡量方式的過時:當使用變成委派,該計算什麼#

論文面向未來的主張,也連結到 wiki 的衡量主題:標準的 AI 使用衡量方式——活躍使用者、聊天數、訊息量——「隨著代理式系統擴散,可能變得較不具資訊性」。 當單一指令引發數小時的自主、多工具、多步驟工作時,訊息數便不再追蹤產出。作者提出應追蹤的替代指標:

這與遙測與問卷衡量生產來源評估所秉持的「衡量系統實際做了什麼,而非代理指標」的直覺相同,只是更進一步:不只是以遙測取代問卷,而是以產出與委派指標取代互動次數指標

三類族群作為自然實驗#

由於三個群體都能使用同一個模型,它們之間的巨大差距證明,採用取決於脈絡,而非能力——也就是組織對 AI 的互補條件論點。OpenAI 員工(邊際使用成本低、認同度高、受過訓練,且接近系統)是前沿預覽:它展示了採用摩擦接近零時,代理式使用的樣貌。他們的模式——使用分布於研究、規劃、溝通、招募與銷售;2025 年 11 月至 2026 年 6 月間,每個職能產生的 output token 都至少增加 10 倍(研究人員增加 50 倍以上)——是論文描繪的終點,而非平均情況。

產品,而不只是模型:按介面衡量自主性#

Anthropic 的 AEI Cadences 報告(2026 年 6 月)從 Claude 端提供了介面比較。以 1–5 分量表評定 AI 自主性,Claude Code 在 31 種產出類型中的 26 種,展現出比聊天/Cowork更高的自主性(平均差距**+0.37**;腳本與程式碼片段為**+0.53**)。差距的三分之二來自以更多委派執行相同任務——一篇部落格文章在聊天/Cowork 上來回互動的中位數為13 回合,但在 Claude Code 上只需單一提示——三分之一則來自不同的產出組成。關鍵是,在控制模型後,差距仍然存在:在由 Sonnet 提供服務的對話中,Claude Code 仍顯示多出**+0.26** 的自主性,即使 Code 使用 Opus 的頻率高得多(相較於聊天/Cowork 的 10%,Code 為 54%)。報告的結論——「所使用的產品可能比底層模型更重要」——正是本頁「代理式 AI 是不同的使用模式,而不是更好的聊天機器人」的介面設計對應,也呼應模型改進下的工具層收縮:決定使用者委派多少的,是工具層/介面,而不只是模型。

相關連結#

  • 代理式程式撰寫工作組成轉變——Anthropic/Claude Code 對同一「提問→執行」移動的遙測;這是 OpenAI/Codex 的跨族群補充(兩家實驗室、兩種工具、同一項轉變)
  • 對話成果物——同一份 Cadences 報告中的成果物配套;自主性與運算量會在成果物之間共同移動(r = 0.68)
  • AI 使用節奏——該報告的時間節律章節;這項擴散中委派的廣度節奏
  • 自動化—樂觀連結——認知章節:自動化占比(本頁的委派,由問卷衡量)預測工作者樂觀程度
  • 暴露分類法:觀察到的、理論上的、回報的、預期的——問卷的信念面衡量,補足這項行為面轉變
  • Anthropic Economic Index——姊妹研究計畫;其專業回報報告被這份 OpenAI 研究引用
  • 代理式程式撰寫中的專業回報——本研究引用之報告中的配套發現(Hitzig et al. 2026):當工作變成委派時,關鍵的人類技能是領域理解加監督,而非執行
  • AI 的組織互補條件——在同一模型下,為什麼三類族群差異如此之大:價值取決於工作流程/權限/技能互補,而不只是能力
  • 代理式工作系統化——三種「如何」邊際之一:臨時委派逐漸固化為可重用的 skill/plugin 例程
  • 平行代理編排——另外兩種「如何」邊際:並行度與長時間執行,也就是密集使用者的工作流程
  • 任務時間跨度擴展——委派任務複雜度(超過 8 小時任務的占比從 2.1% 上升至 25.6%)是可靠任務長度上限上升的使用面解讀
  • 規劃/執行分工——委派是已實現的一半:每個提示引發多少自主工作,以及使用者實際交出了多少工作
  • 遙測與問卷衡量——衡量過時的論點在此延伸:不只是以遙測取代問卷,也是以委派指標取代互動次數
  • 驗證成為新瓶頸——當使用從提問轉向委派,人類角色轉向審查、監督與協調,也就是此處指出的瓶頸
  • 工程師與 PM 的融合——密集使用者「管理一組代理式工作」,轉向委派/監督/整合;這是使用資料中看到的角色融合
  • AI 作為主要作者——委派式生產意味著作者身分轉移給代理;token 占比數字顯示了這項轉移走了多遠
  • 模型改進下的工具層收縮——使用面上,工具層收縮所促成的正是委派增加:每項任務需要較少手把手引導,交出去的工作更多
  • OpenAI——這是其 Codex 遙測資料所屬的實驗室,其內部使用情況也是前沿預覽
  • Codex——本研究衡量其採用情況的代理式工具
  • 以市場定價的 AI 暴露(AI 溢價)——對同一提問→執行移動的獨立、跨供應商佐證:Borri-Liu-Tsyvinski 的 OpenRouter 面板(400 多個模型,而非單一實驗室)顯示代理式 token 占比——完成原因為 tool_calls 的請求——從 2024 年約為 0,上升至 2026 年初的52.2%。同一項轉變,是在任何單一供應商產品之外進行的衡量;其「密集邊際,而非使用者人數」定價,也與本頁的「產出 token,而非活躍使用者」相互呼應

待解決的問題#

  • token 占比指標會獎勵冗長的代理式產出。99.8%/63.3%/16.5% 的分布中,有多少是真實的工作轉變,又有多少只是代理式工具針對每單位人類意圖產生了更多 token?
  • OpenAI 內部使用依假設是前沿預覽。外部組織的曲線是否真的沿著 OpenAI 路徑前進(這是論文的隱含主張),還是會在採用摩擦沒有消失的地方達到平臺期?
  • 「提問占 ChatGPT 的一半,執行占 Codex 的大多數」——但兩種工具會自行選擇不同的工作。有多少提問→執行的對比是轉變本身造成的,又有多少只是把原本就屬於「執行」的任務導向為其打造的工具?

資料來源#

  • The Shift to Agentic AI: Evidence from Codex——摘要;§1 Introduction(四項風格化事實);§3 Who Uses Agentic AI;§6 Conclusion
  • Anthropic Economic Index report: Cadences——Anthropic Economic Index Cadences(2026 年 6 月),第 2 章 §"How much autonomy does Claude have to decide on its own?"(按介面衡量自主性、控制模型)
  • Chatterji et al. (2025), How People Use ChatGPT (NBER WP 34255)——此處用來對照的對話式 AI「提問 ≈ 一半」基準
§ end
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

Cited by 28
Related articles