H
Howardism
Plate IIEntities機器翻譯 · machine-translatedENHOWARDISM

Claude Opus 5.5

Anthropic's Opus-class release following Opus 5; METR's predeployment AI R&D evaluation (September 2026) reads it as a modest, incremental gain over Fable 5.1 with no closure of the researcher-judgment gap, and unlikely to be dramatically accelerating its own development

Article metadata
Publication details
Published:September 24, 2026
Filed:Entity
Domain:Entities
Tags:EntityModelAnthropicClaude
Reading:5 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

Claude Opus 5.5 插圖

資料來源#

摘要#

Claude Opus 5.5 是Anthropic繼Opus 5之後推出的 Opus 系列模型。這個 wiki 目前唯一的資料來源並非系統卡,而是METR的第三方部署前 AI 研發評估(2026-09-22)。這項評估依據一份未收費協議進行,由 METR 起草,再由 Anthropic 審閱和編輯,最後經雙方核准,納入 Opus 5.5 系統卡。這段來源脈絡——評估者自己的文字在發布前經受評估方編輯——使METR頁面已記錄的審查存取衝突更加明顯,也限定了以下所有主張:這是關於模型創造者、由雙方共同撰寫的文字,而非獨立報告。

METR 的發現#

能力測試透過 API 存取,在 10 個工作日內針對五項任務進行:Budget NanoGPT Speedrun(NanoGPT Speedrun 競賽的受限版本)、Language Model Conceptual Argumentation (LMCA)(概念推理資料集,Cooper 等人,2026)、Train a Program(訓練 ML 模型複製軟體行為)、Gaming Bot(透過非視覺 API 進行 Python 代理式遊玩),以及 Sunlight(開放式研究能力與報告撰寫)。METR 另外參考了自身《Frontier Risk Report》的背景趨勢、一份 Anthropic 能力/控制問卷,以及對 Anthropic 研究人員的訪談。

(A) Opus 5.5 本身的加速能力。「這個模型帶來的加速幅度會略高於 Fable 5.1,但不太可能完全自動化 AI 研發。」Opus 5.5 相較 Fable 5.1 是「幅度有限而非巨大的飛躍」,在可驗證任務(Budget NanoGPT、Gaming Bot)以及較難驗證的任務(LMCA、Sunlight)上都展現進步;Anthropic 表示,它在內部 AECI 指標上延續了 Mythos 等級的趨勢。完全自動化需要「在預見、預測、建立自身回饋迴路」以及研究人員判斷力方面大幅進步,而 METR 的證據並未顯示 Opus 5.5 在這些方面有重大改善。這就是同一個判斷力/品味落差——見研究品味是人類的瓶頸——也是 Anthropic 過去每一代模型都遇到的瓶頸。儘管如此,「Claude Opus 5.5 仍可能明顯提升研究人員的效率,並將研發的部分工作自動化」,帶來略高於 Fable 5.1 的提升幅度。METR 明確指出,其資料無法區分 AI 研發進步的速度是持續、加快還是減慢——只能說頻繁的漸進式進步與這三種情況都相符。

(B) AI 對 Opus 5.5 自身開發的加速。「AI 至少在某種程度上加速了這個模型的開發,但不太可能造成大幅加速。」此處的證據權重並非來自 METR 自身的能力測試:METR 的另一個團隊在 Anthropic 內部取得較高權限,對內部 AI 研發加速情況進行實驗性評估,並將結論分享給發布團隊——但「無法揭露佐證證據或推理細節」。發布團隊直言,他們「將所提供 AI 研發報告中的證據作為評估依據,但不直接為其中的主張辯護」。該內部報告的核心數字是:「AI 使整體能力加速約 1.5 倍(也就是一年達到原本一年半的進展),或許有 30% 的機率達到 2 倍加速」——未說明時間範圍。按照 Anthropic 內部能力評估,Opus 5.5 相較 Fable 5.1 的進步符合既有趨勢,也與 Mythos Preview 以來 AECI 趨勢的延續相符。

這項評估被描述為「更全面評估的試行版本,預期未來會有更多公開成果」——這是對初步嘗試的承認,並非已定型的衡量工具。

評估未涵蓋的事項#

METR 明確說明了自身的範圍:這項評估蒐集 AI 研發能力證據,「並非旨在驗證是否符合 Anthropic 政策中的任何特定門檻」,也完全不評估對齊特性。

相關連結#

  • METR — 評估者;這是語料庫中 METR 首次進行的部署前 AI 研發評估(有別於其事故後調查),也是 Anthropic 首次在發布前編輯評估者原文的案例
  • AI R&D Autonomy Evaluation (AECI) — 本次評估所處的 AECI/AI 研發門檻架構;Anthropic 聲稱 Opus 5.5 延續 AECI 趨勢,但此處未經稽核(未提供點估計,與 Opus 5 資料卡中的 162.1 不同)
  • 研究品味是人類的瓶頸 — 「預見、預測、建立自身回饋迴路」以及研究人員的判斷力,是本頁未解決的部分;第三方再次指出這些因素是 Opus 5.5 無法縮小自動化落差的原因
  • Claude Opus 5 — 前代模型;目前尚無 Opus 5.5 的能力比較表可直接對照
  • 研究人員從程式碼產出中獲得的效率提升 — 約 1.5 倍(有 30% 機率達到 2 倍)的數字,是同一加速議題上的新資料點,但資訊仍不透明;Kwa 的生產函數估計與 Anthropic 的《Risk Report》也都探討了這個議題

待解決的問題#

  • 內部 AI 研發報告中「約 1.5 倍、或許有 30% 的機率達到 2 倍」加速估計,有哪些佐證?製作報告的團隊雖然取得較高權限,卻沒有向負責發布這項評估的 METR 團隊揭露其推理過程。這引發的指標遭遮蔽問題,與AI R&D Autonomy Evaluation (AECI)頁面記錄的是同一問題。
  • 完整的 Claude Opus 5.5 系統卡是否會改變 METR 以五項任務摘要勾勒出的能力圖像——尤其是是否存在 AECI 點估計,以及該數值與 Opus 5 的 162.1 相比如何?
§ end
Cited by 6
Related articles