H
Howardism
Plate IIAgent Systems機器翻譯 · machine-translatedENHOWARDISM

權限與稽核在豐沛之中依然存續

回應兩個 #oq/now 問題的共同答案。(1) 模型升級時,兩種處方互不支配:精簡處理指令鷹架(請求形式的行——消融並刪除),結晶化處理權限鷹架(由證據門檻把關的權限,能力躍升無法換得,而且循環論證禁止將其委派給模型)——依每一行編碼的內容分類(請求或限制/紀錄),而非依它所在的位置分類;降級斷路器讓權限面在升級時不必做決策。(2) 即使長上下文近乎免費,檢索層仍會存續,因為只有它的成本面向按 token 計價:逐區塊治理不能存在於它所管制的視窗內(『模型答應忽略』並不是界線),而視窗內的歸因只是模型的證詞,稽核需要的是可查驗的紀錄——選擇步驟讓引用紀錄具有實質內容,這項要求也約束編譯式 wiki。價格一旦消失,成本便隨之消失;治理與稽核只有在其要求本身消失時才會消失。

Article metadata
Publication details
Published:August 11, 2026
Filed:Essay
Domain:Agent Systems
Tags:DerivedHarnessAuthorizationRetrievalAgent Engineering
Reading:12 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

說明「權限與稽核在豐沛之中依然存續」的插圖

問題#

兩個 #oq/now 項目分別由不同來源記錄在不同頁面,這裡將它們合併為一份綜合答覆,因為兩者其實都在問同一個關於兩種資源的問題:

  1. 將代理程式工作結晶化為工作流程——結晶化與鷹架精簡在模型升級時給出相反指示:刪除鷹架,還是保留由證據門檻把關的權限。哪一種處方適用?指令鷹架與權限鷹架的答案是否不同?
  2. 文件解析是檢索瓶頸——簡報列出檢索在長上下文時仍存續的三個理由:成本、治理與可稽核性,其中只有成本取決於 token 價格。若 1M-token 視窗變得近乎免費,逐區塊權限篩選與引用紀錄的可稽核性是否仍要求保留檢索層?還是它們會變成能在視窗內解決的歸因問題?

兩個問題有相同的形狀:它們都在問豐沛是否會讓某一層退場——第一個問題是模型能力讓權限鷹架退場,第二個則是 token 容量讓檢索層退場。結果發現,這兩層都由語料庫已辨識出的兩類存續者構成:界線執行與證據紀錄(模型進步後有哪些鷹架會存續——又該如何判斷某一行何時開始有害?)。這兩類都無法取代模型判斷,因此也不會因為模型判斷能力提升而退場——這就是「苦澀教訓」的例外規則(苦澀教訓):編碼任務先驗的結構會遷入模型內部;編碼界線或紀錄的結構則沒有可遷入的「內部」。

問題 1:兩者互不支配,而是各自管不同對象;可用一項測試將它們區分#

兩篇文章都已提出的候選區分是正確的,現在語料庫也能為它提供根據,而不只是提出看法。模型進步時的鷹架精簡一直只測量指令鷹架:system-prompt 行為、行為請求、驗證提示——Cherny 的消融、超過 80% 的刪除,以及 Fable-5 Pokémon 結果,測量的都是那些取代模型判斷的提示文字。Malik所說的「自主性會依據其證據……一份執行紀錄,附加在特定的操作手冊類別與動作類型上」(case-study)談的則是權限:工作流程能在無人監督下執行哪些操作。只有依鷹架所在位置分類時,兩種處方才會在升級時衝突。若依鷹架編碼的內容分類,兩者便不會碰在一起:

  • 指令鷹架編碼的是任務先驗——猜測模型需要被告知什麼。能力更強的模型會讓這種猜測過時,過了有效期限,這一行便開始有害(指令累積)。精簡處方適用:每次發布都做消融,刪除模型如今已能原生完成的部分。
  • 權限鷹架編碼的是界線,以及設定目前界線的證據。Malik 的升級門檻(≥10 次乾淨執行、≥90% 的動作序列完全相同、≥99% 的分類一致性,以及人工審查)是一份組織專屬紀錄——在當地累積的證據,而「模型升級不會轉移其中任何一項」——並以界線執行為外層。兩者都屬於存續類別;兩者都沒有編碼能力躍升所能提供的內容。

安全語料庫支持更強的主張:權限鷹架不只是經驗上耐久,而且在結構上就不可能遷入模型內部。指令可以遷入權重(模型學會這種行為)。授權則不可能,因為授予自身權限的元件根本算不上關卡:能力門控不是授權的帶外原則指出,「讓 LLM 產生、擴大或自行發現每次呼叫的範圍,會構成循環論證——污染呼叫的同一個注入,也可能污染其範圍」;帶外提示注入防禦的 D2 發現(「關卡不能是模型」)說的是同一件事。關卡的安全性在設計上與模型無關——「更強的代理程式改變的是哪些內容會被提議,不是哪些內容會被允許」(NetInjectBench,empirical)。因此,驅動精簡的遷移問題並非在權限方面尚未獲得回答,而是根本問錯了問題。**你可以委派判斷,不能委派授權。**Willison 以「運用你的判斷」取代指令,之所以合理,正是因為這是指令面的調整;對權限部分進行相同的委派,就是安全文獻所禁止的循環論證。

另有兩項資料也指向同一結論。Reddy 等人(empirical)顯示,即使沒有任何對手,權限層仍有價值——在遵循規範的代理程式上,確定性的派發前關卡將任務成功率從 29.6% 提高到 42.0%——因此,這一層的價值並不取決於可能會因模型進步而改善的模型不當行為。另一項鷹架槓桿研究(Orchestration Sets Token Economics,empirical,vendor COI)發現,模型越強,結構性機制的效益越高(品質增益與基準能力的關聯係數 r = 0.99):權限機制屬於能力互補項,而不是被取代項。

**這項區分面臨的壓力測試:一行看似指令的文字實際上執行權限工作。**OverEagerBench(經由Rashidi 的 SoK引述,重述而非複現):從提示中移除明確宣告範圍的句子後,Claude Code 未經請求便採取動作的比例,從 0.0% 升至 17.1%。範圍宣告雖在提示中,卻編碼了界線——這項區分之所以站得住腳,正是因為指令累積中的不對稱性依形式而非位置分類:限制形式的文字(「留在範圍內」)對同一個模型仍然有效,而請求形式的文字則會累積。因此,升級時檢驗任何一行的實際問題不是「它在提示還是程式碼裡?」,而是:**模型能力提升後,這一行會變得不再必要嗎?**請求 → 會 → 精簡處方適用,刪除並消融。限制或紀錄 → 不會 → 結晶化處方適用,只有執行紀錄能改變它。

**升級日的實務答案。**啟動時的檢查與證據循環各自管理不同對象,而 Malik 的設計已包含兩者的調和機制:

  1. 對指令鷹架進行消融(依 Cherny 的方法刪除,再加回),包括代理式工作流程 Type-3 層中的指令部分。
  2. 權限授予維持不變。能力更強的模型能帶來更好的探索(更多候選行為更早達到升級門檻),絕不會擴大權限——要等它探索出的內容結晶化之後,節省效益才會出現。
  3. 其他情況交由降級斷路器裁決。權限會依執行證據持續重新取得(韌體事件的做法:出現退步就降級,乾淨執行後再升級,無須人類決定何時進行)——因此,升級時完全不必做權限決策。指令會悄悄腐化,所以精簡需要每次發布都進行一次例行檢查;結晶化的證據循環從不停歇,因此不需要這種例行程序。

什麼情況會改變這個答案。Cat Wu預測:「現在所有的安全機制——提示注入、命令的靜態驗證、權限模式、人類參與流程——都會變得不那麼重要,因為模型自然會做出正確的事」(practitioner-opinion);這是語料庫中唯一主張權限層本身會淡出的看法。循環論證指出,能力與遭受注入時的可信度彼此正交;經驗資料也不支持依能力等級推理(能力甚至無法一致地決定風險暴露程度——見記憶與上下文中毒中的 Bad Memory 反轉現象)——但這項預測可在未來版本中驗證,而且已列入能力門控不是授權的「關卡是否會變成非必要」追蹤問題。這份綜合分析依照現有語料庫解決治理問題,但沒有結束這項觀察。

問題 2:Token 價格只會讓成本這一面消失#

我們把問題的前提推到極致——1M-token 視窗的費用趨近於零——再逐一檢視簡報列出的三個面向(文件解析是檢索瓶頸)。

**成本:讓步。**簡報本身就承認(「只有成本取決於 token 價格」),而且這個面向支持的編譯與檢索成本計算也會隨之改變。論證中的其他部分都不依賴這一點。

治理:因循環論證而存續,而非因經濟因素——這是問題 1 的答案再往前一層。逐區塊權限篩選是在檢索邊界執行逐次呼叫授權:區塊上帶有 authz 中繼資料,在擷取時進行篩選;「別讓不同租戶共用索引,然後祈禱提示能約束模型」(Agentic Prompt Injection直言,這是帶外提示注入防禦把「授權而非內容」這套觀念從動作邊界移到檢索邊界的重述)。把多租戶語料庫塞進免費視窗,再要求模型遵守權限,就像是多給 token 的困惑代理程式:「模型答應忽略」並不是界線,這是簡報對安全語料庫所測得的帶內失效模式的描述(自適應攻擊下,十二種帶內防禦有超過 90% 遭到破解;模型無法可靠地區分指令與資料)。必須在不受信任或未獲授權的位元組進入運作軌跡之前完成執行——這也是 APPA 採用事前執行位置的原因。若選擇步驟在填入上下文之前套用政策,它依定義就是檢索層,與視窗成本無關。無論價格多少,這個視窗都是錯誤的信任網域。

範圍條件也要坦白說明:只有在主體數量 > 1 時(租戶邊界、請求者範圍),治理才會強制要求檢索層。單一主體的個人語料庫——也就是這個 vault——沒有請求者需要篩選,因此治理要求只需輕鬆滿足,無須大費周章地執行。

**可稽核性:仍然存續,因為視窗內的歸因只是證詞,而稽核需要紀錄。**問題最尖銳的版本——可稽核性是否會變成「能在視窗內解決的歸因問題」?——有兩個理由說明答案是否定的:

  1. 模型自行回報的歸因仍是模型輸出。若要求模型指出填滿的視窗中哪個片段支撐了答案,模型只會再產生更多內容;要查驗這些內容,只能信任正受稽核的元件。這與模型自行編寫授權政策、LLM 評審為自己的生成器打分(「它同意它自己」,LLM-as-a-Judge),以及 AM-Sentry 透過讀取訊息而非讀取已驗證的通道來評分來源(也就是來源判定預言問題,帶外提示注入防禦)有相同的結構性缺陷。檢索層的引用紀錄是在模型之外產生、確定記錄實際擷取內容的紀錄——若能連結到頁面與區域,幾秒內即可查驗(驗證成為新瓶頸對 bbox 定位的解讀);若區塊中繼資料包含解析器版本,也可重現。「檢索提供引用紀錄。長上下文提供一種感覺。」視窗變便宜,不會讓感覺變成紀錄。
  2. **沒有選擇步驟的紀錄不含歸因資訊。**鷹架可以確定地記錄填入視窗的內容——但若把整個語料庫都塞進去,紀錄只會顯示「全部」,無法歸因。引用紀錄所含的資訊,正是來自選擇步驟。讓稽核紀錄具有實質內容的就是檢索;可稽核性不只是偏好檢索層,而是由檢索層構成。

這個面向並非偏袒檢索;而且語料庫在此坦承,它也約束編譯式 wiki 架構:LLM-as-Compiler Knowledge Base已承認,編譯後的文章是根據 wiki 而非原始頁面回答——句子層級的主張無法對應到來源中的特定區域——因此,「編譯步驟將可引用的語料庫轉成可讀取的內容,代價是可追溯性」。編譯與檢索都是「選擇並留下紀錄」;只有把整個語料庫塞進視窗的架構會被稽核面向徹底排除。(vault 的引用規範——每個來源都有 [[raw/…]] 連結、證據層級與解析警告——則是相同要求較不完善但仍存在的形式。)

問題對「免費」估得太便宜的面向:將貨幣價格與能力價格混為一談。Context Window Smart Zone:注意力會以平方速度退化;2026 年的 1M-token 視窗「只是送來大得多的愚蠢區域」;而接近模型有效上限(廣告宣稱的視窗容量無法預測)的測得失敗模式是拒答,某一格高達 89.6%(Eliav,empirical)。長上下文能處理以檢索為型態的測試,但處理大量內容的推理能力會退化,所以即使每個 token 收費 $0,塞滿的視窗仍要付出答案品質下降、無法回答的代價。不過,評估這一面時要拿捏好比重:它是唯一由當前模型限制構成的面向,恰好是模型進步時的鷹架精簡預測會逐漸消退的類別(「愚蠢區域最近沒那麼愚蠢了」),因此它只能增加論證的餘裕,而不能支撐論證的主要分量。

**綜合答案。**簡報的重新詮釋——「結果發現,檢索更像是稽核軌跡,而非容量權宜之計」——在免費視窗的假設下仍然成立,如今也清楚說明其適用範圍:**Token 價格降低時,成本會消失;只有多主體要求消失時,治理才會消失;只有問責要求消失時,可稽核性才會消失。**由於這些是部署本身的特性,而非 token 市場的特性,只要部署具備其中任一要求,無論價格多少都需要保留選擇層;若部署兩者皆無(單一主體、沒有外部問責,語料庫位於有效視窗內),就可以合理地把整個語料庫塞進視窗。這也是將簡報對抽取與解析的務實說法(「大多數真實系統兩者都用」)套用回簡報本身。

核心原則,一次說清楚#

兩個問題都歸結為相同的分類規則,這也延伸了模型進步時的鷹架精簡從檢索面提出的概括。豐沛時會縮減的是任何取代模型判斷的事物——行為請求、手寫查詢轉換、任何鷹架中的指令部分。會存續的機制則會:

  1. 改變哪些內容能抵達模型——解析、依政策選擇內容(檢索層的治理面);
  2. 限制模型輸出可以執行什麼——權限關卡、升級門檻(權限鷹架);以及
  3. 透過模型無法控制的通道記錄發生過的事——執行紀錄、引用紀錄(權限與稽核都會使用的證據)。

第 2 類和第 3 類有共同的底線,而第 1 類只是受益於這項底線:**受治理的元件不能自行編寫授權;受稽核的元件不能自行編寫證據。**無論元件能力提升多少,這項循環論證問題都不會改變——因此模型升級可以精簡指令,卻永遠不能賺得權限;免費的上下文視窗可以消除成本,卻永遠無法取代稽核軌跡。

§ end
Cited by 7
Related articles
  • Open Questions Backlog

    Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…

  • Harness Shrinkage as Models Improve

    Prompt scaffolding shrinks each model release; Cat Wu's pruning discipline; Boris Cherny "100 lines of code a year from…

  • Document Parsing as the Retrieval Bottleneck

    Doulcet's 2024→2026 RAG retrospective: the bottleneck moved out of the model into retrieval, and inside retrieval into…

  • Claude Code

    Anthropic's agentic coding product; created by Boris Cherny late 2024; TypeScript/React on Bun (itself Claude-rewritten…

  • Layerwise Omission Attribution

    Rajan: omission — a decision-critical fact silently missing from an answer — is a pipeline property assignable to one o…