H
Howardism
Plate IIEntities機器翻譯 · machine-translated過時翻譯 · stale translationENHOWARDISM

UK AI Security Institute

PublishedJuly 15, 2026FiledEntityDomainEntitiesTagsEntityOrgAI EvaluationGovernanceTest Time ComputeReading6 minSourceAI-synthesised

英國政府 AI 評估機構(Science of Evaluation 團隊);其 2026 年 7 月的 test-time compute 研究,是首個獨立、由政府研究機構提供的實證佐證,證明代理能力是隨運算量變化的曲線,而非固定分數——亦執行網路 CTF 測試套件(「The Last Ones」)、共同維護 Agent Red Teaming 基準測試,並對 Fable 5 探測通用 jailbreak

UK AI Security Institute 插圖

資料來源#

摘要#

UK AI Security Institute(AISI) 是英國政府負責評估前沿 AI 能力的機構。其 Science of Evaluation 團隊 會在大型測試時運算預算下,於代理基準測試(網路、軟體工程、數學、學術、醫療保健)上執行前沿模型。由於它位於各模型實驗室之外,其數據可作為模型供應商所宣稱能力的獨立、政府研究機構佐證——這與 METR 對時間跨度曲線所扮演的角色相同。

其 2026 年 7 月的部落格文章 More compute, more capability 是本語料庫首篇 AISI 一手出版物,也是首個對大規模測試時運算論點群提供獨立 empirical 確認的出版物——截至目前,這組主張幾乎完全建立在一位 OpenAI 研究員(Noam Brownpractitioner-opinion)的研究之上。Brown 從軼聞出發主張「能力是預算的函數」;AISI 則在多個基準測試上實際量測了這一點。

在本語料庫中的職責#

  • 測試時運算評估(2026 年 7 月)。 Science of Evaluation 團隊將 token 預算從低到高進行掃描,回報能力曲線,而非單一分數。研究結果顯示:約 8% 的網路任務只有在預算達到 ≥10M tokens 後才解出(部分任務高達 50M),在較小預算下完全看不見;最新模型在 100M+ 下仍持續上升;將預算從 1M 提高至 10M,使軟體工程分數提高約 25%(TerminalBench 2.0、SWE-Bench Pro),數學/學術分數提高約 22%(Humanity's Last Exam)。其 2026 年 3 月的前身研究首次指出,適度的運算上限會低估網路能力——這正是 Brown 引用的結果(模型「在 100M tokens 下仍持續改善」)。
  • 運算需求—人類時間法則。 在其網路任務與 METR 的軟體工程任務中,代理所需的運算量會隨熟練人類完成任務所需的時間而擴張——這是一條擬合指數約為 0.7–1.0 的冪律(一分鐘任務約需數千 tokens、一小時約需數百萬、一週約需數十億)。
  • 網路 CTF 測試套件。 維護一套狹義的網路 capture-the-flag 任務(Fig-4 分析中有 78 項),包括約需 20 個人類工時的 「The Last Ones」——受測模型中沒有任何一個能在低於 30M-token 預算下完成。並將 METR 的 211 項軟體工程任務集與自有任務一併使用。
  • Agent Red Teaming(ART)。 共同維護 Gray Swan/UK-AISI ART 基準測試;Claude 模型大多已在其中達到飽和(見代理式提示注入)。
  • 模型紅隊測試。簡介 5上,這是唯一被指出曾在短暫初始窗口內朝通用 jailbreak取得部分進展的紅隊測試組織;其他外部紅隊測試者則毫無所獲(見能力門控模型回退由 LLM 驅動的漏洞研究)。

為何在此重要#

AISI 的曲線將測試時運算論點從實驗室研究者的 practitioner-opinion 推進為經量測、獨立重現的事實,也把抽象的「回報預算」規範轉化為實務改變:現在它會跨多個預算進行評估(對最困難的任務也包括非常大的預算),依據預算回報可靠性與可達範圍,避免資源不足的評估被誤認為低能力模型,並正在定義**「最低資訊量預算」(只有當增加更多運算後可達範圍不再上升,才宣告已達到上限)。它也將以較便宜的執行結果預測高預算效能**列為明確且尚未解決的研究方向,並正積極投入——這正是 Brown 僅提出的開放問題。

相關連結#

資料來源#

§ end
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

Cited by 17
Related articles
  • Responsible Scaling Policy Evaluations

    Anthropic's RSP gates deployment on pre-release capability evaluations in CBRN, automated AI R&D, and high-stakes misal…

  • Compute-Controlled Benchmarking

    Noam Brown's critique: the single-number benchmark grid is broken because it ignores test-time compute — plot performan…

  • Claude Opus 5

    Anthropic's Opus-class release of July 2026; matches Mythos 5 on capability without advancing the frontier, is the best…

  • Anthropic

    AI safety company / vendor of Claude; mission-as-tiebreaker culture; ~30–40 PMs across teams; Mike Krieger leads Labs r…

  • Large-Scale Test-Time Compute

    Noam Brown's thesis that model capability is now a function of inference budget (tokens/cost/time): with good scaffoldi…