資料來源#
摘要#
Melissa Z. Pan、Shuo Yang、Negar Arabzadeh、Wei-Lin Chiang、Ion Stoica 與 Matei Zaharia,HarnessTax: How Much Does the Harness Matter for Coding Agents?(Arena.ai blog,發布於 2026-09-16,更新於 2026-09-18,empirical)。頁面上的署名為「Arena Team」;上方六位作者的名單是從該頁自己的 BibTeX 區塊還原而來,並未出現在可見署名中。頁面沒有註明作者的大學 affiliation——Stoica 與 Zaharia 廣為人知的是 UC Berkeley RISELab / Databricks 相關研究人員,致謝中的贊助者名單(Anyscale、Broadcom、Intel、Samsung SDS…)也符合 Berkeley 系統實驗室的模式,但兩者都不是頁面明載的事實,因此本文不將其宣稱為已由頁面核實的資訊。
在 SWE-bench Lite 與 Terminal-Bench 2.0 上測試 21 種模型×Harness 組合(7 個模型:Claude Fable 5、Claude Opus 4.8、Claude Sonnet 4.6、Claude Haiku 4.5、GPT-5.6 Sol、GPT-5.6 Luna、Kimi K3;× 3 個 Harness:Claude Code、Codex CLI,以及精簡的開源 Harness Pi),並對成功率與每次 rollout 成本計算 bootstrap 95% CI。研究有三項發現:
- Harness 選擇對成功率影響甚微,卻會使成本倍增。
- 精簡的開源 Harness(Pi)具有競爭力——並在兩項基準測試中都達到 Pareto 前緣。
- 模型可以跨 Harness 移轉——模型供應商自家的 Harness 並非總是最佳搭配。
發現 1——成本倍增,成功率幾乎不動#
在所有 21 種 SWE-bench Lite 組合中(bootstrap 95% CI,依據文章即時 Plotly trace 資料謄錄):
| 模型 | Harness | 成功率(95% CI) | 成本/rollout(95% CI) | Pareto? |
|---|---|---|---|---|
| Claude Fable 5 | Pi | 96.7% (91.1–100.0%) | $0.666 (0.494–0.875) | 是 |
| Claude Fable 5 | Codex CLI | 96.7% (91.1–100.0%) | $0.890 (0.697–1.127) | 否 |
| Claude Fable 5 | Claude Code | 97.8% (93.3–100.0%) | $1.329 (1.101–1.601) | 是 |
| Claude Opus 4.8 | Pi | 82.2% (71.1–92.2%) | $0.473 (0.272–0.725) | 是 |
| Claude Opus 4.8 | Codex CLI | 88.9% (77.8–97.8%) | $0.694 (0.491–0.946) | 否 |
| Claude Opus 4.8 | Claude Code | 86.7% (75.6–95.6%) | $0.976 (0.733–1.263) | 否 |
| Claude Haiku 4.5 | Pi | 60.0% (43.3–75.6%) | $0.374 (0.308–0.441) | 是 |
| GPT-5.6 Sol | Pi | 74.4% (58.9–88.9%) | $0.441 (0.342–0.553) | 是 |
| GPT-5.6 Luna | Pi | 53.3% (35.6–70.0%) | $0.030 (0.024–0.037) | 是 |
| GPT-5.6 Luna | Codex CLI | 55.6% (37.8–72.2%) | $0.035 (0.028–0.044) | 是 |
| GPT-5.6 Luna | Claude Code | 55.6% (38.9–72.2%) | $0.152 (0.120–0.190) | 否 |
(完整原始資料表有 21 列;此處省略的 10 列是非 Pareto 的 Sonnet 4.6、Kimi K3,以及其餘 Claude Code/Codex CLI 組合,皆未進入前緣。)
Claude Fable 5 是最清楚的單一案例:97.8%(Claude Code)對 96.7%(Pi)——成功率只差 1.1 個百分點——但成本是 $1.329 對 $0.666,幾乎多一倍。以共同模型的成本比幾何平均彙總:在 SWE-bench Lite 上,Claude Code 的成本約為 Pi 的 2.0×、Codex CLI 的 1.6×;在 Terminal-Bench 2.0 上,約為 Pi 的 1.5×(最後這項僅出現在文章正文標題數字中——請見「範圍限制」)。同時,Harness 對成功率的平均影響,在 SWE-bench Lite 上維持於 ±2% 以內,在 Terminal-Bench 2.0 上維持於 ±5% 以內。回合數也無法解釋這個差距:Fable 5 在 Pi 上每次嘗試平均 15.4 回合,在 Claude Code 上為 15.3——回合數相同,支出約多一倍。
發現 2——只有 4 個工具的 Harness 也能進入 Pareto 前緣#
Pi 提供 四個工具:read、write、edit、bash。上表列出的 7 個 Pareto 前緣點中,有 5 個由 Pi 取得(Fable 5、Opus 4.8、Haiku 4.5、GPT-5.6 Sol、GPT-5.6 Luna 都透過 Pi 達到前緣;Claude Code 與 Codex CLI 則各貢獻一個前緣點)。這是來自 Anthropic 以外的基準測試研究,對 Harness 縮減論點反向命題的直接實證佐證:精簡的 Harness 並不會比有 23 個工具的專有 Harness 損失成功率。
稅從第一次模型呼叫就開始#
SWE-bench Lite 中,7 個模型第一次主要模型呼叫的平均上下文(圖 3):
| Harness | 可用工具 | 工具結構描述大小(字元) | 系統指示(字元) | 首次呼叫上下文(tokens) |
|---|---|---|---|---|
| Pi | 4 | 2,873 ± 17 | 2,547 | 1,972 ± 553 |
| Codex CLI | 7.4 ± 2.5 | 18,100 ± 1,500 | 23,500 ± 1,000 | 11,300 ± 2,700 |
| Claude Code | 23 | 77,000 ± 7,200 | 13,500 ± 9,400 | 27,000 ± 6,900 |
依據這些資料,Claude Code 首次呼叫的平均上下文(27.0k tokens)是 Pi(1,972 tokens)的 約 13.7×——與文章四捨五入後「超過 10×」的文字說法一致,但差距更大;各模型的比值範圍還要更廣(GPT-5.6 Luna:18.5k 對 1,306,約 14.2×;Sonnet 4.6:32.6k 對 2,175,約 15×)。Codex CLI 的「7.4 ± 2.5」工具數平均值並非測量雜訊,而是反映明確的分流(Claude/Kimi 模型與 GPT-5.6 Sol 使用 9 個工具,GPT-5.6 Luna 使用 3 個)。
發現 3——模型可以跨 Harness 移轉#
供應商有時會針對自家 Harness 最佳化模型(OpenAI 表示 GPT-5-Codex 是為 Codex 調校)。但資料不支持這是普遍規則:在六個 Anthropic 與 OpenAI 模型及兩項基準測試中,12 次比較有 9 次是替代 Harness 達到觀察到的最高成功率。 兩個具體案例:Sonnet 4.6 在 SWE-bench Lite 上用 Codex CLI 解決 68.9% 的嘗試,在 Claude Code 上則為 66.7%,成本相近;GPT-5.6 Sol 在 Terminal-Bench 2.0 上用 Pi 達到 83.3%,用 Codex CLI 則為 78.9%,成本約只有一半($0.42 對 $0.76)。這與 《超越準確率飽和的測量》在 CORE-Bench 上記錄的模型與 Scaffold 解耦現象相同(在準確率打平的 capsules 中,scaffold 有 31% 意見不一致)——這裡觀察的是跨供應商差異,而不是開源與專有之間的差異。
範圍限制與證據注意事項#
- 兩項基準測試都是開源且已公開多年(SWE-bench Lite、Terminal-Bench 2.0)——作者也提醒可能有訓練資料污染;結果未必能推廣至未見過或私有的基準測試。
- 本次未擷取 Terminal-Bench 2.0 各組合的數字。 四張資料圖表都是透過沙箱化、跨來源的
srcdociframe 在用戶端掛載的 Plotly 圖表;Playwright 透過逐個 frame 的evaluate()讀取每張圖的即時.datatrace,但點擊各圖的「Terminal-Bench 2」分頁後,雖然畫面上的介面確實切換了,底層 trace 的ids仍以swe:...為前綴——這是網站端的切換錯誤,不是擷取失敗。本文只採用了文章中 Terminal-Bench 2.0 的正文標題數字(Pi 成本比約 1.5×、成功率範圍 ±5%、GPT-5.6 Sol 的 83.3% 對 78.9% 比較);原始資料及本文都沒有 Terminal-Bench 2.0 表格。請將上文任何 Terminal-Bench 2.0 數字視為取自正文,而非經表格核對。 - 供應商相關的觀點。 Arena.ai 是一家商業 LLM 評估公司(源自 LMArena);本文也兼作 Arena 自家 profiling/trace-capture 方法的展示,並以承諾「公開發布 profiling traces」作結。本文依據 bootstrap CI 與實際基準測試成本/成功率網格,將研究評為
empirical——這是真正的受控測量,不是公告;但研究未經第三方稽核或獨立複現,而且 Arena 並未特別持有 Claude Code、Codex CLI 或 Pi 的產品利益,因此 COI 疑慮較低,但仍未完全消除。
延伸閱讀#
- Cost-per-Task Over Cost-per-Token——本文提供了成本軸上的案例:第四個資料點(前面是 Cursor 的模型組合、Writer 的 Harness 勝過模型選單、以及 Databricks 的開放權重基準測試),顯示同一個模型只因 Harness 不同,成本就最高相差 2×,成功率差異則落在雜訊範圍內
- 模型進步時的 Harness 縮減(樞紐頁)——來自 Anthropic 以外的基準測試研究提供外部佐證:精簡的 4 工具 Harness,對上有 23 個工具的專有 Harness,並不會損失成功率;首次呼叫上下文約 13.7× 的差距,則是另一家供應商對相同上下文膨脹問題的測量,而 Cat Wu 的精簡準則正是針對這個問題
- Compute-Controlled Benchmarking——Harness 選擇是未揭露的預算面向:在 SWE-bench Lite 上得分只差幾個百分點的兩個代理程式,單是 Harness 就可能造成 2–5× 的美元成本差異,這正是本文網格為計算軸指出的遺漏變數問題
- 超越準確率飽和的測量——在新的軸向佐證「模型與 scaffold 解耦」:12 次跨供應商比較中有 9 次偏好模型的非原生 Harness,將 CORE-Bench 中供應商內 scaffold 意見不一致的發現,延伸至跨供應商案例
- Agent Harness Engineering——對 Cline 單一供應商生產環境軼事(「2024 年形狀的 Harness 會對 2026 年的模型課稅」)提供受控的跨模型補充:此處將成本稅量化為倍增幅度,涵蓋 7 個模型與 3 個 Harness,並固定基準測試不變
- Claude Code——在本研究所有共同模型比較中成本最高的 Harness;該實體頁目前尚未收錄這項成本比較
開放問題#
- 在受測模型訓練時未見過的基準測試上,Harness 成本差距(2–5×,成功率 ±2–5%)是否仍然成立?還是因為 SWE-bench Lite / Terminal-Bench 2.0 已公開多年才出現這種結果?
- 論文提出一種能「在任務展開時調整,同時維持通用性」的 Harness,以取代使用者選擇 Harness 的決策——目前有任何已部署系統嘗試按任務路由 Harness 嗎?它能追回大部分成本稅,還是只把選擇問題搬到別處?
資料來源#
- HarnessTax: How Much Does the Harness Matter for Coding Agents?——Pan、Yang、Arabzadeh、Chiang、Stoica 與 Zaharia,Arena.ai blog,發布於 2026-09-16/更新於 2026-09-18,
empirical。透過r.jina.ai擷取內容(一般 WebFetch 會回傳截斷的 Next.js 外殼);頁面中繼資料與 BibTeX 透過直接curl取得。**擷取警告:**四張資料圖表都是透過 Playwright 的逐 iframeframe.evaluate()讀取即時掛載的 Plotly 圖表,而非根據螢幕截圖謄錄——SWE-bench Lite 的資料可靠(全部 21 種組合,且由兩張獨立繪製的圖表互相確認),但 Terminal-Bench 2.0 各組合資料無法還原(網站端分頁切換錯誤);本文任何地方對 Terminal-Bench 2.0 都只使用正文標題數字。
Cited by 7
- Agent Harness Engineering×3
Harness Tax — Cline's single-vendor tax measured as a cross-vendor grid: cost up to 5× apart for…
- Compute-Controlled Benchmarking×3
Kimi K3's card names the harness per score but publishes no budget for it. HarnessTax (harness tax…
- Cost-per-Task Over Cost-per-Token×3
HarnessTax runs the harness-as-cost-lever question as a controlled grid rather than a single swap:…
- Harness Shrinkage as Models Improve×3
HarnessTax (harness tax coding agent benchmarks, empirical) is a third-party benchmark rather than…
- Measuring Beyond Accuracy Saturation×3
harness tax coding agent benchmarks — Pan, Yang, Arabzadeh, Chiang, Stoica & Zaharia, Arena.ai…
- Agent Systems & Harness Engineering
Harness Tax — Arena.ai's 21-combination study (7 models × Claude Code / Codex CLI / Pi, SWE-bench…
- Open Questions Backlog
Harness Tax ×2 (oldest 4d) — Does the harness-cost gap (2–5×, ±2–5% success) hold on benchmarks the…
Related articles
- Agent-Authored Harness Optimization
An agent runs the whole eval-fix loop on its own harness — read traces, hypothesize, patch, re-run. Seven instances dis…
- Orchestration Sets Token Economics
Writer's controlled harness swap — same 22 tasks, same six models, same judges and price table, only the orchestration…
- Shared Harness, Differentiated Surfaces
OpenAI merged Codex and ChatGPT Work onto one agent harness and differentiated only the UX layer — git-state visibility…
- Cost-per-Task Over Cost-per-Token
Anthropic's inverted model-selection default: start with the most capable model and dial effort down — a stronger model…
- Claude Code Best Practices
Anthropic's guide to effective Claude Code usage: context management, verification-driven development, explore→plan→cod…
