資料來源#
- An Actionable Diagnosis of Multilingual, Multi-Agent Planning Failures
- Where Facts Go Missing: A Layerwise Taxonomy and Per-Layer Attribution of Information Omission in Air-Gapped LLM Agent Pipelines
摘要#
遺漏是幻覺的對偶:不是斷言錯誤的內容,而是應該提出來的事實悄然缺席。Santhiya Rajan(Where Facts Go Missing: A Layerwise Taxonomy and Per-Layer Attribution of Information Omission in Air-Gapped LLM Agent Pipelines,Multiverse Computing,arXiv 2607.22448,2026-07-24,empirical)主張,遺漏比幻覺更危險,也更少受到研究;她提出的「為什麼」論點中,有一句話值得記住:
讀者若熟悉正常範圍,或許能察覺遭到幻覺捏造的檢驗值;關鍵數值若被省略,產出的報告卻流暢、自信,看似完整,卻根本隻字未提。
典型事件是涵蓋範圍崩潰:「工具透過分頁回傳 400 筆觀察資料,代理程式只讀前 20 筆,然後回報『未發現異常』——這個結論忠實反映模型實際看到的內容,卻造成全局性的災難。」
論文的核心主張在於架構:部署中的代理程式,其遺漏可能是整條管線的屬性,而不只是模型本身的問題。 紅編器可能在推論前刪掉關鍵資料;代理程式可能因未繼續翻頁而漏掉資料;資料可能在上下文壓力下遭到淘汰、生成時被抑制,或在協調器壓縮歷史紀錄時流失。僅評估輸出——相關研究中的遺漏偵測器無一例外——只能看到一個位元,無法區分這些機制,而這正是操作者需要據以採取行動的資訊。因此,診斷單位變成整條管線,問題則是:這次失敗與哪個層級相符?
研究情境刻意限縮:醫院、律師事務所或國家機關不得不採用的氣隙隔離/地端堆疊——在單張 16-24 GB GPU 上執行量化的 4-8B 開放權重模型,由 llama.cpp 或 vLLM 提供服務,再包上一個從內部系統分頁讀取文件的 MCP 工具伺服器,並由輕量級協調迴圈驅動。這套分類法是為該堆疊撰寫的;其中大多數層級也存在於任何代理程式管線中。
九個層級#
表 1 是論文最具通用價值的成果。順序固定,才能避免在上游兩個檢查點把同一次失敗重複計算。
| # | 層級 | 主要遺漏機制 | 類別 |
|---|---|---|---|
| L0 | 來源/擷取與遮蔽 | OCR 表格結構流失、PHI/PII 去識別化時移除數值、在地防護措施改寫 | 確定性 |
| L1 | 工具協定與結構描述 | MCP 傳輸大小上限、未繼續翻頁、工具呼叫剖析失敗、工具清單/結構描述遭截斷(上下文成本) | 確定性 |
| L2 | 協調器中介軟體 | 字串切片、移除中繼資料、精簡歷史/狀態 | 確定性 |
| L3 | 序列化/分詞器/範本 | 注入特殊 token、範本漂移、工具角色摺疊、數字/程式碼分詞 | 確定性 |
| L4 | 引擎執行階段與記憶體 | 未使用 -keep 的上下文位移、VRAM 限制、權重與 KV-cache 量化、vLLM 搶占 | 行為性 |
| L5 | 注意力/位置 | 滑動視窗缺口、中間資訊遺失、RoPE 設定錯誤 | 行為性 |
| L6 | 先驗/訓練偏誤 | 先驗覆蓋異常事實、合成資料脆弱性、頻率平滑 | 行為性 |
| L7 | 解碼與結構化輸出 | 貪婪解碼/top-p 剪枝、重複懲罰、文法/結構描述限制生成 | 行為性 |
| L8 | 代理程式迴圈與輸出 | 迭代上限、歷史紀錄壓縮、上下文預算政策、max_tokens/停止序列截斷 | 行為性 |
這個區分是方法本身,不只是標籤。 L0-L3 是確定性軟體:事實是否保留在某個檢查點的位元/token 串流中一目了然,因此每次流失都能針對個別負載精確歸因,並透過檢視確認——不必推論、統計或使用裁判。L4-L8 則是行為性:相同 token 都在,模型可能使用,也可能不使用;因此要固定其他條件、每次只改變一個因素,再以多次試驗估計檢索率的變化。
對真實代理程式而言,L1 才是第零層,也是論文中最能立即派上用場的論點。把「工具回傳一個負載」視為不可分割的整體,會掩蓋這類代理程式最常見的遺漏。FHIR MCP 伺服器可能提供 30 多種工具,光是 JSON 結構描述就占用 5-15k tokens;協調器若限制工具清單,模型就永遠無從得知有檢索工具可用——這是能力無法觸及所造成的遺漏,任何 needle 測試都看不出來。 小型地端模型輸出的 JSON 常不完美;若 harness 悄悄丟棄無法剖析的工具呼叫,就會出現工具根本未被呼叫的回合。「讀取 400 筆觀察資料中的 20 筆,就回報『未發現異常』,是 L1 流失,不是模型錯誤。」
Canary taps:不靠裁判歸因#
這套儀器化方法是可重複使用的工程成果。在管線的每個邊界設置記錄 tap(T0 原始紀錄、T1 擷取後文字、T2 協調器收到的工具結果、T3 編譯後的提示字串、T4 最終 token-ID 序列,將其 detokenize 後進行檢查、T5 根據引擎記錄確認 KV cache 中常駐的 tokens、T6 生成輸出、T7 代理程式最終答案)。每個 needle 都會在臨床或法律數值旁附上一組獨特的英數字 canary(LAB-7Q4X9),因此 T1-T5 是否存在,都能完全離線地以精確比對檢查。
兩個設計細節讓方法更站得住腳:
- 每個 needle 在使用前都必須能無損往返分詞器(encode → decode = original),否則 L3 的流失會偽裝成 L5 失敗。這是先決條件,不是檢查項目——因此測得的 ω3 才會是 0.000。
- 三種 needle 家族各自負責不同的歸因工作。 Literal(精確數值)與 paraphrase(查詢不含任何表層相同字詞)用來探測 L5;conflict needles(與強烈先驗相矛盾的數值,例如 lithium 4.8 mEq/L 對上模型預期的約 0.8)之所以存在,是因為單靠 literal needle 測試無法隔離先驗所造成的遺漏。在深度與長度相同時,(conflict − literal) 的差距就是 L6 的測量工具。半數試驗會加入合理的干擾項,因為沒有干擾項時,檢索表現會被高估。
引擎事件(context shift、SWA checkpoint restore、vLLM 搶占)會以每次試驗的共變項形式記錄——這些就是 L4 的歸因訊號,而整個 L4 分析都仰賴它們。
瀑布分析,以及標題數字不代表什麼#
對於一個連貫的級聯流程,令進入第 i 層的機會數為 N_i,首次在該層流失的數量為 L_i,則條件流失率為 ω_i = L_i / N_i,無條件貢獻為 c_i = ω_i ∏_{j<i} (1 − ω_j),總遺漏率為 O_R = 1 − ∏(1 − ω_i)。
| 層級 | ω_i | 95% CI | 標籤來源 |
|---|---|---|---|
| L0 擷取/遮蔽 | 0.160 | [0.158, 0.163] | 檢查點 |
| L1 工具協定 | 0.175 | [0.172, 0.178] | 檢查點 |
| L2 協調器 | 0.165 | [0.162, 0.168] | 檢查點 |
| L3 分詞器/範本 | 0.000 | [0.000, 0.000] | 檢查點 |
| L4 引擎/記憶體 | 0.000 | [0.000, 0.000] | 遙測資料 |
| L5 注意力/位置 | 0.189 | [0.185, 0.192] | 啟發式 |
| L6 先驗 | 0.012 | [0.011, 0.014] | 啟發式 |
| L7 解碼 | 0.018 | [0.017, 0.019] | 啟發式 |
| L8 代理程式迴圈 | 0.065 | [0.062, 0.067] | 任務對照 |
| 總計 O_R | 0.574 | [0.571, 0.578] | 根據比率推得 |
代入 Eq. 1 後,得到 O_R = 0.5743;L0-L3 的貢獻總和是 0.4213,占瀑布流失的 73.4%。
這個 73.4% 並非生產環境的研究發現,而論文少見地嚴謹,反覆說明這一點——摘要、分類法章節、結果,以及失敗紀錄中都再三強調。Phase A 刻意注入遮蔽、分頁與截斷失敗;這個數字描述的是設計中的實驗配置。「它並未顯示生產環境中自然發生的遺漏,有 73.4% 是由中介軟體造成的。」Wilson 區間描述的是各實驗格子內的二項抽樣不確定性,未涵蓋實驗格子加權、模型選擇或啟發式歸因帶來的不確定性。這個數字最可能脫離上下文被引用,而原文的限定說明是解讀它不可或缺的一環。
兩個零值所在的列很值得注意,其中一個還是陷阱。 ω4 = 0.000 不代表引擎層安全。只有引擎事件記錄顯示 needle 所在位置落在遭淘汰的範圍內時,才會歸因至 L4——也就是「token 從未留存在 cache 中」。依照這項規則,q4 KV 量化造成的常駐 token 損壞不算 L4 流失;它會在下游顯現,並計入 L5。因此,下方分析中的設定同時顯示,q4 KV 設定對帳目貢獻零,但在 profile 分析中帶有 2.25 的勝算比。若把「引擎/記憶體 0.000」解讀成「量化沒問題」,就顛倒了論文自己的結果。
實際會改變遺漏率的因素#
勝算比的方向設定為 OR > 1 代表遺漏更多。核心對照來自 Phase C 黃金路徑資料列上的固定效果 logistic regression(確定性層已確認無流失,且未發生引擎事件);profile 對照則來自另外啟動的伺服器設定後續試驗,涵蓋全部五種模型設定。
| 因素(對照) | OR | 95% CI |
|---|---|---|
| 上下文長度,32k 對 2k | 7.43 | [5.44, 10.15] |
| needle 深度,0.5 對 0.1 | 1.38 | [1.23, 1.54] |
| Paraphrase 對 literal | 3.65 | [3.31, 4.03] |
| Conflict 對 literal | 1.42 | [1.28, 1.59] |
| 重複懲罰 1.3 對貪婪解碼 | 0.32 | [0.26, 0.41] |
| q4 KV cache 對 f16 KV | 2.25 | [2.07, 2.45] |
| 縮放 RoPE 對原生 RoPE | 1.99 | [1.83, 2.16] |
有四點值得記住:
- 上下文長度的影響是其他因素的兩倍,而且在這條路徑上,所有上游層級都已確認沒有流失。這是經測量後得出的 Context Window Smart Zone 主張,已排除檢索失敗與 harness 截斷的影響。
- 影響最大的兩個設定因素是伺服器啟動旗標,不是模型選擇。 KV-cache 類型與 RoPE 縮放是
llama-server啟動參數——正是地端環境操作者為了在 16-24 GB 記憶體上容納更長上下文而調整的旋鈕。論文指出的核心兩難是:增加量化程度來換取更大的視窗,檢索表現可能不如視窗較小、精度較高的設定。 RoPE 縮放的結果更差,因為它會「重現看似架構問題、其實是設定錯誤所造成的中段盲點。」 - Paraphrase 的 3.65 有部分來自測量假象,論文也明說了這點。 所有檢索標籤都使用大小寫正規化後的預期答案子字串比對,包括 paraphrase 試驗——因此用不同措辭給出語意正確的答案,也會被判為遺漏。不要把這一列解讀成語意檢索結果。
- 重複懲罰帶來的效益(OR 0.32)不是解碼建議。 作者明確表示,不將這個結果推廣至測試提示以外的情境。
真實資料試驗#
另一組 372 次試驗構成獨立母體——兩種提供服務的模型設定 × LangChain 與 ADK × 五種來源/提供者條件,資料涵蓋 FHIR、PubMed 與 SEC EDGAR。這組資料未併入主要瀑布分析。
- 157 次試驗獲得最終成功歸因,163 次結果編碼為未成功,另有 52 次(14.0%)仍屬未知——其中 44 次是 LangChain 遞迴上限錯誤,8 次是 SEC 找不到申報文件錯誤。若把未知算作未成功,結果是 0.578;若排除未知,320 次結果已編碼的試驗則為 0.509。
- 框架比率(LangChain 0.602、ADK 0.554)包含各自的執行錯誤,因此衡量的是端到端、依框架而異的可靠性,不是單獨的協調效應。研究沒有不使用框架的對照組。
- 終點定義比遺漏更廣:163 次未成功中有 11 次雖包含預期子字串,仍屬迴圈失敗。
- 不同來源的比率相差 6 倍——注入式 FHIR 為 0.148、注入式 SEC 為 0.639、注入式 PubMed 為 0.889、透過 MCP 使用 SEC 為 0.500、透過 MCP 使用 PubMed 為 0.917——但各領域都與其來源及樣本建構方式綁定,因此無法單獨識別領域效應。這種差異正是論文堅持將試驗結果定位為試驗,而非定論的理由。
也請留意,這項試驗在推論時相容於氣隙隔離,不代表全程離線:模型服務與答案評分都在本地進行,但特定來源資料是透過公開線上服務取得。
反轉預期的描述性對照,以及作者拒絕下結論的理由#
全注意力控制組的描述性遺漏率最高(0.716),SSM 混合對照組則最低(0.489);llama.cpp/vLLM 的整體差異為 0.593 對 0.537。兩者都與預期排序相反,論文拒絕從任何一者下結論。 每一列模型都同時改變了模型家族、分詞器、參數數量、訓練資料、指令調校與聊天範本;各模型設定獲得的引擎支援也不均衡。論文明確指出,若要對架構做因果歸因,需要在同一模型家族內進行權重匹配研究,目前尚無此類研究。這是正確的判斷,值得效法:只有五列的模型表格,結果卻顛覆預期排序,正是較弱的論文可能拿來當作標題結論的地方。
為整體結論劃定範圍的限制#
- 原始試驗資料已不在。「這份 checkout 中缺少主要掃描與 profile 試驗的原始檔案」,因此論文自己的稽核「只是核對已提交的彙總數值,而不宣稱已獨立重現逐列結果」。表格可透過內部算術核對,而且結果完全吻合,但無法獨立重新產生。將原始資料封存列為未來工作。
- Phase D 是以規則為基礎的診斷啟發式,不是因果分解。 若某次失敗試驗的強制平均對數機率高於設定的 −2.0 門檻,就標記為
pruned_L7;否則依needle 家族決定標籤(conflict → L6,其他 → L5)。論文坦承:「目前記錄的排序不會決定標籤,注意力與先驗的區別是根據 needle 家族推斷。」瀑布分析中每一列 L5/L6/L7 都受到這項限制影響。 - 統計模型比規格設定的內容更精簡。 沒有為 needle ID 擬合隨機截距;信賴區間以模型估算,而非採用叢集穩健方法,因此重複使用的 needles 與模型特定效應仍可能彼此依賴。勝算比代表在納入的因素條件下觀察到的關聯,不代表遺漏有多少百分比是由某因素造成。
- 單一作者、單一實驗室、一篇預印本、一套堆疊。 這項研究的實證價值來自試驗數量與內部一致性,而非重複驗證。
九個層級沒有涵蓋的邊界#
表中的每個層級都關乎一個負載:紀錄、工具結果、提示字串、token ID、常駐於 cache 的片段,或生成答案。分類法一再追問的是:某項事實有沒有從原處一路保留到需要它的地方? 還有一種流失具有相同特徵——寂靜無聲,輸出流暢且看似完整——L0-L8 的 tap 卻無法看見,因為負載內容根本沒有缺漏。
Pahuja、Brokman、Hofman 等人(An Actionable Diagnosis of Multilingual, Multi-Agent Planning Failures,arXiv 2608.03735,2026-08-04,empirical)在request-to-plan 邊界為這種情況命名:規劃落地失敗是「使用者請求與生成計畫之間不相符,以致即使正確執行計畫,執行結果也無法滿足原始請求。」他們找出五種反覆出現的形式,都是計畫遺漏的承諾——目標實體、指定來源(或檢索後篩選條件)、時間範圍、操作順序、答案格式。這裡消失的不是文件中的事實,而是請求中的限制條件;它消失在一個本來就應該改寫輸入的轉換過程中,因此無法歸入確定性/行為性的區分。沒有位元組可以比對:計畫即使引用錯誤的 arXiv 論文,仍是一份格式正確的計畫;每個工具呼叫都成功,每份負載都完整到達,報告卻回答了另一個問題。一個具體案例正是本頁原本可以涵蓋的讀取端流失,但它發生在上一層——查詢要求找出網頁圖片中寫的年份,計畫卻改為掃描頁面文字、中繼資料、標題與參考資料,最後回傳另一種模態中的真實年份。這不是 L1 分頁中止,而是 L(−1) 指令中止。
而論文本身打造了這個 tap,卻沒認出它就是 tap。 TART 是請求的型別化表示法——以封閉詞彙表擷取 entities、time_constraint、source_constraint、attachment_type、operations、answer_type——在規劃前先擷取,再注入規劃器與每個下游代理程式,讓這些承諾「在管線的每個階段都持續可見」。這就是本頁的 canary 協定以預防而非診斷方式使用:不在某個階段放入標記,好計算它遺漏了什麼,而是重新陳述標記並將其作為負載,讓該階段無法悄悄將它遺漏。如此一來,測量幾乎不費成本,但沒有人去做。只要有型別化的請求表示法,就能逐欄位將計畫與表示法比對,計算哪些承諾未被帶入計畫——這正是 L0-L3 的特性(在邊界進行精確比對,不用裁判,逐項請求檢查),而這道邊界不屬於九個層級中的任何一個。論文反而使用 Claude Opus 4.8 作為 LLM 裁判來擴大分類規模,卻從未驗證它在不同語言中的校準度。它打造了一種能免除自身診斷對裁判依賴的工具,最後卻聘用了裁判。
這個想法有兩個必須坦承的限制,也都源自本頁自身。差異比對會承襲改述假象——若計畫用不同措辭保留限制條件,子字串比對仍會將其判為流失;這和本頁改述資料列中的 OR 3.65 部分屬於測量假象、論文也明確指出這點的原因相同。其次,欄位擷取本身是一次 LLM 呼叫,因此這個「檢查點」不像 T1-T5 那樣是確定性軟體;它是便宜、單一用途、可檢視的呼叫,保證程度不如位元組比對,但遠勝於讀完整條追蹤紀錄。
延伸閱讀#
- Harness Shrinkage as Models Improve——將此分類法所劃定的邊界,重新表述為對哪些 harness 元件會留存的預測。確定性/行為性區分(L0-L3 軟體、L4-L8 模型)與「隨模型判斷力提升而縮減的是替代模型判斷的鷹架;留存的是會改變哪些內容能抵達模型的機制」指的是同一道界線——剖析器、工具結構描述預算、序列化器與截斷政策都會處理模型看不到的位元組,正因如此,任何模型版本更新都不會讓它們退役。這樣讀來,本頁提供了 harness 縮減論點中範圍條件背後的機制。
- Failures That Look Like Success——本頁細分的失敗類別,也是讀取端的一半。那篇文章中的案例全都發生在寫入端或發話端(狀態正確但訊息過時、違反政策的寫入、在低於隨機水準的政策上通過自我測試);遺漏則是同樣的寂靜,只不過附著在從未提出的事實上。本頁的貢獻在於,將「看起來成功」從單一類別拆解為一個位置:寂靜失敗可能起源於九個地方,其中四個確定性層級可以精確計數。
- Automated Failure Attribution——同一個詞用於另一條正交軸,兩者也能組合起來。本頁把失敗歸因至事實在管線中消失的位置;WHO&WHEN PRO 則把失敗歸因至哪個代理程式、哪個步驟產生決定性行動,其 12,326 條軌跡的標籤依建構方式就是黃金標準。比較之處才是重點:此方法的確定性部分完全不需要模型,能精確計數;行為性歸因部分——也就是另一篇論文的全部任務,相當於本頁的 L4-L8——對步驟定位的準確率最高為 73.9%,對「為什麼」的 macro-F1 則為 10.8–22.2。這大致就是沒有檢查點可供差異比對的代價。兩者也各自提供對方做不到的資訊:canary tap 能指出事實在 L1 消失,卻無法指出是哪個代理程式的決策導致工具以該方式被呼叫;決定性步驟標籤能指出哪個行動破壞了執行過程,卻不知道負載是否曾抵達。2026-08-13 增補:該頁現在也納入多語言規劃來源,其 request-to-plan 邊界正是本分類法缺少層級的位置(見上節),並說明該來源自身的梯度需要一張未曾公布的逐語言裁判一致度圖表。
- Deterministic Pre-Execution Gates——同一道邊界、方向相反的近親失敗。那篇論文的寂靜政策違規,是一項不該發生的寫入;本文的 L1 流失則是從未完成的讀取。兩者都無法從追蹤紀錄中看出,都透過替管線加上儀器而非詢問模型來處理,也都發現損害集中在工具層——閘門是在寫入邊界檢查述詞,canary tap 則是在讀取邊界做精確比對。兩者還有一個共同的結構性發現:失敗之所以存在,是因為某個元件的設計過於寬鬆(工具會執行任何格式正確的內容;harness 會截斷內容、丟棄無法剖析的呼叫,並在讀完第一頁後停止)。
- Latent vs. Deterministic Space——迄今為止量測範圍最大的計算位置區分。這套分類法正是 Tan 提出、如今經操作化的診斷方法:L0-L3 是軟體,L4-L8 是模型,瀑布分析則將每個遺失的事實歸至其中一邊。在這個基準測試的配置下,73.4% 歸於軟體,方向符合 Tan 的框架預測——但關鍵補充是,Phase A 刻意把那些故障放在軟體層。
- Tool-Output Pruning——分類法實際發揮作用之處。以學習式逐行 pruner 將壓縮過的工具回應取代歷史紀錄中的原始內容,就是 L2 協調器中介軟體執行歷史精簡,而這套分類法將其歸為確定性——也就是說,可在檢查點 tap 以 canary 差異比對精確計算 pruner 的流失,不必使用裁判。這是 SWE-Pruner Pro 評估無法解決問題時的第三條路:逐行 F1 把無用的 head 排在有用的 head 之上,而它使用的 LLM 裁判在此用途上也未經驗證。這兩種指標都無法回答「代理程式後來需要的事實是否仍然存在?」;T2 與 T3 之間的 canary 差異比對可以。本研究的反向警示同樣成立——ω2 = 0.165 來自注入式截斷,無法說明學習式 pruner 會丟棄什麼。
- Context Lifecycle Management——同一問題的互補軸,兩套分類法能彼此組合,並非相互競爭。Self-GC 的六類失敗分類以依賴關係為中心(未來的哪個行動會因此失去依據:證據細節、定位資訊、行為契約、原文、即時狀態、復原路由);這套分類法則以位置為中心(事實在哪裡消失)。Self-GC 自身的操作位於 L2 與 L8——歷史/狀態精簡及代理程式迴圈壓縮,都是此處明列的遺漏機制——因此它的無影響裁判是輸出層級偵測器,而本方法可以精確計算流失。它留下的方法學缺口正是 canary taps 能補上的:Self-GC 將恢復成功列為尚未測量的未來工作,而在邊界使用精確比對 tap 就能測量。
- Deep Research Agents——將管線形狀暴露得最徹底的場景:拆解問題、跨異質來源反覆檢索,再綜合資訊。DRACO 發現事實準確度是四個生產系統中最弱的一軸,並以輸出進行評分;本頁補上缺少的問題——引用報告中的來源遺漏,可能來自 L1 分頁中止、L2 精簡、L5 中段遺失,或 L8 迭代上限,只有最後兩者與模型有關。試驗中來源比率相差 6 倍(FHIR 0.148 對 PubMed 0.889),是閱讀任何研究代理程式時都該注意的警訊,不能把來源視為彼此等同。
- LLM-as-Compiler Knowledge Base——這座知識庫本身就位於分類法涵蓋的範圍。「OCR 表格結構流失」是 L0 列出的第一種機制,正是
_system/compiler-prompt.md記錄的 docling 表格摺疊/位移失敗;parse-asset.sh中擷取時的table-collapse與table-shift檢查,不過是未冠上 tap 之名的 L0 檢查點 tap。知識庫尚未採用、且可轉移到其他情境的概念是canary:在來源中植入已知 token,剖析後再做精確比對,就能把「這些表格是否有疑慮?」轉變為可逐份文件計算的流失率。 - Long-Horizon Agent Failure Signature——以行為為中心的分類法,涵蓋的領域與本頁從管線角度提出、以位置為中心的分類法相同。Rahman 等人的 TOOL & ENVIRONMENT 失敗家族(缺少設定、未繼續翻頁、未檢查環境狀態),就是從代理程式行動而非管線檢查點描述本頁的 L1 工具協定層——他們提出的「讀取 400 筆觀察資料中的前 20 筆,回報『未發現異常』」例子,是本頁的典型涵蓋範圍崩潰事件,並且在不同語料中獨立觀察到。
- Document Parsing as the Retrieval Bottleneck——在第一線工作的實務者將 L0 從一個表格儲存格擴展成六種具名機制。「OCR 表格結構流失」包含多欄交錯、表格攤平成管線字元湯、註腳併入內文、圖表作為圖像物件而被略過、頁面裝飾污染每個區塊的嵌入,以及跨頁邊界讀序錯誤——每一種都附有下游症狀。它也補上本分類法固定層級順序所要保護的主張,以級聯方式陳述:文件剖析是十二種失敗之一,但其錯誤會傳播至其他七種,最後下游的檢索或綜合錯誤都偽裝成其他問題。那一頁提供機制清單但沒有測量;本頁提供方法(canary tap 能精確計算 L0 流失),但沒有盤點 L0 在實際場域會破壞什麼。
- Context Window Smart Zone——將 smart-zone 主張單獨隔離並加以測量的版本:在所有上游層級都確認無流失的路徑上,32k 對 2k 的 OR 為 7.43,因此影響來自長度本身,而非截斷、檢索或 harness 政策。
- Measuring Beyond Accuracy Saturation——同樣批評只看輸出評分,但關注的是新軸線。那篇文章主張單一準確度數字掩蓋可靠性與效率;本文則主張它掩蓋了機制——單一遺漏率無法區分位元組層級的軟體流失與行為性的檢索失敗,而操作者接下來該採取什麼行動,完全取決於是哪一種。
- Verification as the New Bottleneck——遺漏是驗證最棘手的案例:沒有可供檢查的產物。幻覺會提出可供檢驗的主張;遺漏卻會呈現看似完整的報告,沒有任何參照物可供比較,這就是論文所提出的候選偵測器(canary 注入、涵蓋範圍核算、強制引用、logprob 監控、引擎遙測警報)全都儀器化管線而非輸出的原因。
尚待解答的問題#
- 面對自然發生的生產故障,而非 Phase A 的刻意注入,L0-L3 軟體層占比是否仍高於 L4-L8 模型層?73.4% 是設計出的實驗配置所產生的數字,論文四度明確加上限定;語料中沒有任何資料能測量未加權生產流量中的層級占比。這和 Failures That Look Like Success 問的普遍程度問題不同;後者問的是有多少失敗悄無聲息,而不是哪個層級造成失敗。
- ω4 = 0.000 在迫使上下文實際溢出的工作負載中是否仍成立?引擎/記憶體沒有產生任何歸因流失,q4 KV cache 卻帶有 OR 2.25,原因是只有事件記錄顯示 needle 位於遭淘汰的範圍內時才計入 L4,而常駐 token 損壞會計入 L5。這很容易驗證:以會淘汰 needle 片段的負載大小重做 B1/B2 對照,並檢查 L4/L5 的區分是否改變。若沒有改變,這個零值就是歸因規則造成的假象,而分類法需要新增第五種確定性類別,處理損壞但仍常駐的 token。
- L0-L3 檢查點 tap 能否移植至代管 API 的代理程式管線?方法的確定性部分仰賴在每個邊界讀取原始位元組與 token ID——T4 需要最終 token-ID 序列,T5 需要從引擎記錄得知 KV 常駐狀態——但任何前沿推論 API 都不會公開這兩者。若無法移植,可精確計數的層級便只能在地端環境稽核,而多數代理程式實際使用的堆疊正是無法儀器化的那一種。
資料來源#
- An Actionable Diagnosis of Multilingual, Multi-Agent Planning Failures — Pahuja、Brokman、Hofman、Nizri、Vishna、Goldfarb-Tarrant、Marchisio、Kojima 與 Vainshtein(Fujitsu Research of Europe / Cohere / Fujitsu Research),An Actionable Diagnosis of Multilingual, Multi-Agent Planning Failures,arXiv 2608.03735,2026-08-04,
empirical。本文僅引用 §1(規劃落地的定義)、§3.1(五種被遺漏的承諾)、§3.3 + 附錄 B(TART 結構描述及其注入規劃器與下游代理程式的方式)、附錄 A 範例 2(圖片與頁面文字來源模態案例),以及附錄 G(Claude Opus 4.8 作為分類裁判)。本頁沒有任何數字來自其表格。完整分析、剖析紀錄與利益衝突聲明見 Automated Failure Attribution - Where Facts Go Missing: A Layerwise Taxonomy and Per-Layer Attribution of Information Omission in Air-Gapped LLM Agent Pipelines — Santhiya Rajan(Multiverse Computing),Where Facts Go Missing: A Layerwise Taxonomy and Per-Layer Attribution of Information Omission in Air-Gapped LLM Agent Pipelines,arXiv 2607.22448,2026-07-24,
empirical,8 頁/8 個表格/0 張圖。使用的章節:Introduction(遺漏與幻覺的比較框架、涵蓋範圍崩潰事件)、Taxonomy(表 1、L1 論點、確定性/行為性區分、Eq. 1)、Attribution Methodology(表 2 的 T0-T7 taps、canary 協定、分詞器往返先決條件、三種 needle 家族、Phase A-E)、Results(表 5-8、73.4% 的限定說明、拒絕對模型差異下結論、真實資料試驗統計),Limitations and Future Scope。剖析警示——docling 剖析結果帶有一處已標記的表格位移,以及兩處擷取檢查器未發現的摺疊,因此引用前先依內文核對表格儲存格:表 8(c) 的 L5 列標籤在合併儲存格中重複(數值完整——六個分數加總為所列的 O_R 0.574),而且表 4 與表 7 有以空格連接的多值儲存格。本文引用的模型與引擎比率(全注意力 0.716、SSM 混合 0.489、llama.cpp 0.593、vLLM 0.537)都在 Results 內文中獲得四項交叉驗證;表 7 中其餘三列模型只能依位置推斷,因此不予引用;表 4 的模型與欄位對照也不予引用。表 5、6、8 都經過算術驗證,而未直接採信:表 5 的 ω_i 透過 Eq. 1 正確算出 O_R = 0.5743,以及 L0-L3 占比 0.4213/73.4%;表 8(c) 的六個分數都能用表 5 的比率算出,四捨五入至小數點三位後完全相符;表 8(a) 與 8(b) 以 n 加權後都得到端到端比率 0.578,兩表的 n 欄各自加總為 372。表 6 的區塊標頭(「Core Phase C」、「Separate profile follow-ups」)與各區第一列標籤合併,但每列都剛好有一個 OR 和一個 CI,內文列出的四個數值(7.43、0.32、2.25、1.99)也完全吻合。
Cited by 14
- Deep Research Agents×3
Layerwise Omission Attribution — the missing question behind DRACO's weakest axis. Factual accuracy…
- Document Parsing as the Retrieval Bottleneck×3
The canary the vault lacks and the deck's benchmark has. canary-recall samples prose tokens after…
- Failures That Look Like Success×3
Layerwise Omission Attribution — the read-side half of this class and the first attempt to give it…
- Latent vs. Deterministic Space×2
Layerwise Omission Attribution — the diagnostic operationalized as a full pipeline taxonomy rather…
- LLM-as-Compiler Knowledge Base×2
The survey's four limits, worth recording because this wiki lives them: (1) scale — the gist's…
- Automated Failure Attribution
Layerwise Omission Attribution — the same word, the orthogonal axis, and they compose. Rajan…
- Context Lifecycle Management
Layerwise Omission Attribution — the orthogonal axis of the same question, and the two taxonomies…
- Deterministic Pre-Execution Gates
Layerwise Omission Attribution — the same silence one direction over: a gate blocks a write that…
- Harness Shrinkage as Models Improve
Where it stops is the more useful half, and it is a scope condition this page has not previously…
- Long-Horizon Agent Failure Signature
Layerwise Omission Attribution — a different taxonomy of the same territory: this page's taxonomy…
- Measuring Beyond Accuracy Saturation
Layerwise Omission Attribution — the same complaint on a fourth axis: mechanism. A single failure…
- Agent Systems & Harness Engineering
Layerwise Omission Attribution — Rajan: omission — a decision-critical fact silently missing from…
- Open Questions Backlog
Layerwise Omission Attribution ×3 (oldest 63d) — Under organic production faults rather than Phase…
- Tool-Output Pruning
Layerwise Omission Attribution — what a pruner looks like from the omission side, and a metric this…
Related articles
- Agent Harness Engineering
Patterns for scaffolding long-running LLM agents: environment design, progressive context disclosure, mechanical archit…
- Failures That Look Like Success
The quiet agent-failure class where everything reads fine — confident answer, plausible plan, even correct internal sta…
- Deep Research Agents
Agentic systems that decompose a complex query, iteratively search diverse sources, and synthesize a structured, cited…
- Open Questions Backlog
Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…
- Crystallizing Agent Work into Workflows
Malik's production lifecycle at Azure Networking: treat agent exploration as a discovery mechanism, not an execution mo…
