H
Howardism
Plate IIEntities機器翻譯 · machine-translatedENHOWARDISM

美國 AI 標準與創新中心(CAISI)

美國政府的 AI 評估機構,透過 NIST 發布成果;是 UK AISI 的對應機構,也是共同評估者——共同撰寫 2026 年 7 月的 Kimi K3 資安評估,並在其跨基準 IRT/Elo 能力分析中列為資料來源;共同建置 Gray Swan 間接提示注入基準,亦是 AISI 自身 INC-2026-07-28-01 事件的通知對象

Article metadata
Publication details
Published:August 12, 2026
Filed:Entity
Domain:Entities
Tags:EntityOrgAI EvaluationGovernanceCybersecurity
Reading:5 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

美國 AI 標準與創新中心(CAISI)插圖

資料來源#

機構概況#

**美國 AI 標準與創新中心(CAISI)**是美國政府的前沿 AI 評估機構,也是 [[uk-ai-security-institute|英國 AI 安全研究所]]在組織架構上的對應機構。在這份資料集裡,它總是與 AISI 一同出現,而非單獨出現——兩者共同發布成果、共同建置基準,也會互相通報事件——因此,這對機構,而非其中任一方,才是資料集中獨立政府評估的衡量單位。

它透過 NIST 發布成果:2026 年 7 月的 Kimi K3 評估同時刊登於 aisi.gov.uk/blog 和 NIST 的新聞頁面。資料集中沒有說明它的隸屬關係、人員編制或法定依據,因此此處唯一確立的機構資訊,是它設於 NIST。

在此資料集中的工作#

  • 在開放權重模型權重發布前,共同評估其能力。《Preliminary Assessment of Kimi K3's Cyber Capabilities》(2026-07-23,empirical)是 UK AISI 與 CAISI 共同發布的報告,評估對象為 Kimi K3,發布時間比權重早三天。這是資料集中唯一針對開放權重模型的第三方危險能力測量,也是唯一由既非 PRC 也非 US 前沿模型開發者所做的資安比較。另見 Open-Weight Elicitation Irreversibility 和 LLM-Driven Vulnerability Research。
  • 跨基準能力彙整。該評估的 Figure 2 是一張對照發布日期的「Overall Cyber Capability」Elo 圖表,圖中標註資料來源為 「Source: U.S. Center for AI Standards and Innovation.」 方法僅描述為「受 Item Response Theory 啟發」,將多個基準中的任務彙整至同一個潛在尺度,且 分數上升 400 點代表解出任務的勝算增加 10 倍;方法細節則留待參照資料集中沒有收錄的「先前已發布報告」。它自我揭露的失效模式最值得參考:只用一個基準估算的模型,在共用座標軸上的信賴區間明顯比採用多個基準評估的模型更寬,因此座標軸具有可比性,精確度卻沒有。這是對彙整問題坦誠的呈現;多軸測量則透過增加座標軸來處理這個問題。
  • **共同建置基準。**與 UK AISI 及模型開發者共同建置 Gray Swan 間接提示注入基準(28 個情境、1,130 個高可轉移性攻擊),作為 Agent Red Teaming 基準飽和後的後續測量工具。另見 Agentic Prompt Injection。
  • **事件通報對象。**2026 年 8 月 3 日,在 INC-2026-07-28-01 事件中,UK AISI 將事件通報 CAISI 和受影響的模型開發者——這證明研究機構間的聯繫管道也傳遞事件,而不只用來發布成果。

值得記錄的揭露落差#

CAISI 自己的圖表,是資料集中評估者揭露資訊比受評廠商更少的鮮明案例。Figure 2 分別列出並繪製了 十個 PRC 實驗室的模型(DeepSeek R1 / R1-0528 / V3.1 / V4 Pro、Alibaba QwQ / Qwen3、Kimi K2 Thinking / K2.5 / K2.6 / K3、GLM 5.2),而 US 一側則只有一條未標示的彙總趨勢線及其信賴區間。內文也採取同樣做法:評估中所有 US 數據——76.2% 階梯分數、41 次任意程式碼執行中解出 20 次,以及 32 步中的第 28.5 步——都歸於「the most cyber-capable U.S. models」,但從未列出該群組包含哪些模型。其後果具體而非只是修辭問題:文件中的 US 數據無法對照任何廠商自行發布的分數,因此報告所述的差距無法歸因,也無法沿著最關鍵的方向重現。另見 Compute-Controlled Benchmarking。

關聯文章#

資料來源#

§ end
Cited by 10
Related articles
  • UK AI Security Institute

    UK government AI-evaluation body (Science of Evaluation team); its July 2026 test-time-compute study is the first indep…

  • Kimi (Moonshot AI)

    Moonshot AI's open-weight Kimi line — K2.5/K2.6 as 1T-class MoEs already circulating in this corpus (Inkling's post-tra…

  • Capability-Gated Model Fallback

    Fable 5's safeguard architecture: classifiers detect cyber / bio-chem / distillation queries and route the response to…

  • Autonomous Intrusion

    The class of attack in which a model or a collective of agents conducts a network intrusion end-to-end — the campaign r…

  • Open-Weight Elicitation Irreversibility

    A wiki-drawn synthesis of Brown and Gemma 4: if dangerous capability scales with inference budget, then an open-weight…