H
Howardism
Plate IIInterpretability機器翻譯 · machine-translatedENHOWARDISM

語言模型中的全域工作空間(J-space)

Anthropic 於 2026 年 7 月發現,LLM 會維持一小組具有特權、可語言化的表徵——J-space——符合認知全域工作空間的功能標準:語言報告、定向調節、內部推理、彈性泛化與選擇性;它承載的活化變異不到 10%,一次約有 25 個概念,因果效應卻幾乎全都集中於其中

Article metadata
Publication details
Published:July 11, 2026
Filed:Concept
Domain:Interpretability
Tags:InterpretabilityAlignmentCognitionRepresentations
Reading:35 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

語言模型中的全域工作空間(J-space)插圖

資料來源#

摘要#

Anthropic 的可解釋性團隊使用 Jacobian Lens (J-lens),搜尋可語言化的表徵——也就是模型若被詢問便可能說出來的內容——並且「相當令人意外地」發現,這組表徵所做的遠不止支援語言表達。它的運作方式就像全域工作空間:模型表徵中一小部分具特權、能廣播的子集,位於大量自動化處理之上,而模型無法報告或靈活推理那些處理。

J-space 是可表示為 J-lens 向量稀疏非負組合的點集(通常 $k \le 25$)。它的規模很小:在工作空間層中,承載的活化變異從未超過 10%;概念的 J-space 成分中位數只占該概念表徵變異的 6–7%。然而,因果作用幾乎全在這一小部分之中。

五項功能特性#

全域工作空間理論(Baars、Dehaene)認為,有意識的存取可以被報告、由上而下控制,是刻意推理的媒介,能靈活泛化,而且具有選擇性。論文為每項特性定義了 LLM 對應版本並進行測試。

1. 語言報告。 讓 Sonnet 4.5 想一種運動,並在它回答前讀取冒號處的 lens:Soccer 位居最上方,模型便說「Soccer」。把 Soccer 座標換成 Rugby——這個字不在它輸出的前 10 名之中——模型便報告「Rugby」。系統性地說,替換會在 88% 的試驗中把目標推進前 5 名。若在 user 回合注入 J-lens 向量,模型之後被要求內省時會報告自己偵測到該概念,卻不會更早就脫口說出那個詞——這種表徵是可語言化的,而非無條件的說話衝動。

J-space 對報告具有特權地位。 把概念向量分解為 J-space 成分(約占 6–7% 變異)與非 J-space 餘項(約占 93%):沿著 J-space 成分替換,在 59% 的試驗中成功,接近純 J-lens 向量的 88%;沿著非 J-space 成分替換則只有 5% 成功。把 J-space 座標箝制住,讓概念無法重新進入,即使那 5% 也會歸零——殘餘效應是透過工作空間路由的。

2. 定向調節。 一邊抄寫無關句子,一邊被要求「專注於柑橘類水果」,orange 便成為一段層帶中的首位 lens token;此外,在中間層還會出現命名這項行為的 token(imagine、thinking、focused)。一邊抄寫,一邊在腦中計算 3²−2,讀出結果則依序是 arithmetic → nine → seven。這些都不會出現在輸出中。調節也可以是隱式的:只有在問題要求模型命名某項屬性時,相同的刺激 token 才會把該屬性的標籤(past、adjective)載入 J-space——儘管兩種問題下都有表徵並使用了該屬性。

這種控制並不完美,且有熟悉的缺陷:「忽略 X」的指令仍會讓 X 留在工作空間中,遠高於零的基準值——這就是在 transformer 中重現的白熊效應。

3. 內部推理。 J-lens 向量承載著不可或缺的未說出口的中間步驟:

  • 「會織網的動物有幾條腿?」——spider 出現在 lens 中,儘管它既未出現在提示,也未出現在輸出。把 spider 換成 ant,「8」便變成「6」。
  • 完成押韻對句時,lens 會在詩句寫出前顯示預定的韻腳 fight。把它換成 light,模型較早選用的詞也會改變(「coming」→「morning」),最後以「morning light」收尾。計畫在因果上限制了通往該結果的路徑。(2026-07-30 有爭議:在 Qwen 3.6 27B 上,詩歌規劃未能重現——見下文「外部重現」。Nanda 將失敗歸因於實驗者錯誤或模型較弱,並未做出裁定。第二次稽核則削弱了整個類別,而不只是單一案例:排除 lens 命中模型本來就準備說出的內容後,隱藏內容大多是情境暫存,而非內容計畫——見下文「第二次獨立稽核」。)
  • 用中文詢問「小」的反義詞時,lens 承載英文 big——換成 long,中文輸出便從「大」改成「長」。模型以英文思考,並明確表徵它必須翻譯成哪種語言。
  • 兩跳替換在 Haiku 4.5、Sonnet 4.5 與 Opus 4.5 的試驗中,成功率分別為 54%、70%、70%。中間步驟替換比答案替換早約 17% 的深度生效——排除了中間向量只是把答案偷偷塞進去這種混淆因素。(2026-07-30 有爭議:在 Qwen 3.6 27B 上,答案 token 替換明確勝過中間步驟替換,與論文圖 15 的排序相反——但 Nanda 認為重現資料集可能太簡單。見下文「外部重現」。缺少的控制實驗——直接替換最終 token 的基準——如今已出現在第三方稽核中,但結果尚未發表。)

同樣具有特權地位:透過探針找出的中間步驟,透過 J-space 成分翻轉答案的比例為 61%,透過非 J-space 餘項則為 28%;箝制 J-space 後,後者會降到 6%。

4. 彈性泛化(廣播)。 只在一處把 France 換成 China,下游每項功能都會正確讀取新參數:首都、語言、大洲。在 16 項功能、192 次試驗中,有 76 次成功(雙倍強度時為 101 次)。失敗集中在來源概念的工作空間載入程度較低之處——國名載入強,替換可靠;數詞載入弱,替換效果差。

5. 選擇性。 語言報告與彈性推論需要 J-space,自動化處理則不需要——見 LLM 中的自動與彈性認知,這是論文中最明確的結果。

三項結構特徵#

層帶。 J-space 只在大約 L38 到 L92(重新編號後共 100 層)之間承載類似工作空間的內容。在此之前:幾乎沒有有意義的內容(超額峰度接近零、自相關近乎不存在、有效維度塌縮) (2026-08-05 已被 R-lens: Making J-lens More Faithful on Early Layers 推翻——空無一物的是 lens,而非那些層;見下文「早期層並非空無一物」。)之後則是「輸出」階段,讀出結果會與即將輸出的 token 對齊。多種獨立 lens 統計量都指向相同邊界——而這正是推翻舊結論所揭露的弱點,因為每項統計都是透過 J-lens 計算,而且都受其失效模式影響。(2026-07-30 修正:CKA 層帶結構在 Qwen 3.6 27B 上重現,但「明顯不那麼清楚」——不是清晰劃分,而是 4–5 個總層帶中有 2–3 個重疊層帶。)

如今改變的是下界;上界和輸出階段都未受影響,點燃現象也一樣,因為它是在不使用 lens 的情況下測量。

起始處的點燃。 輸入一個由兩個國名加權混合而成的輸入嵌入,並掃描混合比例。早期層的活化會隨混合比例平順變化;約從 L38 開始,活化會突然跳到其中一個端點,並在閾值處急遽轉換——在模糊程度最高時,尤其是在 J-space 中,結果會呈雙峰分布。這是最接近 GWT 全有全無點燃的現象,而且測量時沒有使用 J-lens(採用簡單的投影占比指標),這正是工作空間起始層不只是 lens 假象的原因。

容量有限,且有廣播中樞。

  • 佔用量會在同一時間約 25 個 J-lens 向量附近達到平台。若清單中是不相關的詞,每個逗號處約只有迄今讀到的詞中 6 個在場(單一層中約 1–2 個);若清單中的詞彼此相關,幾乎整個 80 詞類別都會在讀過幾個項目後出現——包括尚未讀到的詞。模型保留的是類別,而不是回想清單。切換類別後,舊項目會在幾個詞內被逐出——清空工作空間的是新類別進入,而非經過的 token 數量。
  • 跨深度廣播:MLP 區塊對 J-lens 向量的放大幅度約為隨機方向的 10 倍(神經元輸出方向:約 1 倍),且 SAE 特徵與 J-space 對齊程度越高,效果越明顯。
  • 跨 token 廣播:注意力頭中排名前 1% 的一組會選擇性轉送 J-space 內容——在旋轉 J 控制組、SAE 分層與 MLP 列上都呈現清楚區隔。消融它們會讓 J-lens recall@25 降到 0.67(控制組:0.86),但僅在 5% 的位置改變模型 top-1 的下一個 token(控制組:2%)——它們作用於工作空間,而非輸出。消融它們也會使注入思考的報告能力崩解(0.54 → 0.09)。

作者沒有聲稱的事#

他們明確拒絕較強版本的主張。Transformer 沒有可分離的專家處理器,單次前向傳遞中也沒有遞迴(他們記錄的廣播是在深度方向進行,而非經由遞迴迴圈),而工作空間的進入是否涉及大腦中那種明顯的競爭性點燃,也尚不清楚。他們主張的是:J-space 具備全域工作空間的許多功能特性,但只共享了部分架構特性。至於現象意識,他們不表態——見 AI 中的存取意識指標。

外部審查與獨立重現(Nanda 等人,2026-07-06)#

Anthropic 委託 Neel Nanda 撰寫公開審查,並於論文發表同日刊出。內容有兩種,應以不同權重看待:審查判斷(專家意見,未經測量)和與 Camila Blank、Agam Bhatia 合作、在 Qwen 3.6 27B 上進行的獨立重現(有實測,但樣本數少,且未經裁定)。

判斷。 Nanda 認為核心科學主張——存在一個能在前向傳遞中保留中間變數的認知空間——很有說服力:「即使我對許多細節有異議,也有足夠多難以造假的證據,明確顯示有某些重要事情正在發生。」他對細緻的結構特性(本頁「三項結構特徵」所取材的第 4 節內容)信心明顯較低,因為可能存在其他假設,結果也未必能泛化至不同模型。他完全不討論哲學主張 → AI 中的存取意識指標。

他認為證據最有力的結果,依強度排序如下:

  • 多臂賭徒決策(圖 14)——「特別有說服力」,沒有明顯的替代假設:切換/重複決策儲存在 user 回合句點處,而在這個位置,下一個 token 預測沒有理由需要保留它們。
  • 多跳事實回想——就論文而言很有說服力,因為圖 15 否證了線性反嵌入的替代解釋(Paris ≈ France + 一個「is-capital」方向,也就是平行查找,而非真正的多跳)。
  • 算術(圖 17)——佐證比結果本身更重要:圖 88 使用一般的平均活化差異概念向量,以非 J-lens 方法推導出相同層帶,「大幅降低」層帶只是 lens 假象的可能性。
  • 多語言——「有點意思,但也可能是虛假的。」英文與平行語言 token 可能有很高的餘弦相似度,主要差異只是語言身分向量;英文反嵌入也可能只是範數較高,導致 Top-K 偏向高變異類別。
  • 直接調節——接受結果,但指出其中的謎題:令人意外的是,「想想 X」會讓 X 比「不要想 X」更顯著(見上文白熊效應),而其機制不清楚。

重現結果(Jacobian 算至倒數第二層,25 個 Pile 提示 × 128 個 token,略過前四個高範數 token;n=25,而論文為 n=1000,理由是論文自身的消融顯示 n=10 幾乎等效):

結果在 Qwen 3.6 27B 上的狀態
語言報告重現——因果效應較弱但為正向
CKA 工作空間層帶結構重現,但明顯較不清楚(4–5 個層帶中有 2–3 個重疊)
定向調節重現(中等)
多語言探測與因果效應重現
錯字實驗重現
多跳事實回想模稜兩可——答案 token 替換明確勝過中間步驟替換;資料集可能太簡單(France–Paris 配對恰好帶有替代假設所預測的線性關係)
詩歌規劃失敗
多步驟算術失敗
關聯分數表現不佳;仍判定為成功重現——資料集只有一個正確答案,手動檢查時相關 token 的排名明顯較高

兩項失敗都未經裁定:Nanda 將其歸因於實驗者錯誤或模型較弱,而非論文有誤。應視為未重現,而非推翻結果。多跳實驗的結果反轉更有參考價值,因為審查自身的替代假設章節恰好預測了會產生此結果的混淆因素——重現資料集可能無法區分這些假設,因此無論哪個方向,都只能算是薄弱證據。

成本並非障礙:在 Qwen3.5-397B-A17B 上,以 n=4 執行的擴展測試在 8×H200 上耗時約 1 小時;若依照論文附錄 10.2 的健全性評估,程式碼代理程式能「相當好地」實作此方法。

Meta-token:工作空間如何索引自身處理#

這是審查中最新穎的正面發現,論文並未提及——之後由同三位作者延伸為專門的後續研究(Towards surfacing model algorithms with meta-tokens in the J-Space,LessWrong,2026-07-20,MATS)。他們寬鬆地定義:meta-token 是出現在 J-lens 讀出中的 token,能提供非顯而易見的證據,指出正在進行的處理類型,而非命名任務變數。該向量本身不必有因果作用,只要它對應的概念具有因果作用即可。

整體沿用審查的設定:在 Qwen 3.6-27B(64 層)上使用 J-lens,Jacobian 算至倒數第二層,對 25 段 Pile 序列 × 128 個 token 取平均,略過前四個高範數 token。Meta-token 出現在工作空間層帶(深度約 30–90%),而且通常是中文——作者的解釋是,中文每個字元承載的資訊較多,因此每個方向只對應一個 token 的 lens,透過 Qwen 的詞彙表能到達比英文比重較高的詞彙表更抽象的概念。作者對三個類別做了因果檢查;有系統地搜尋更多案例,大多沒有結果。

1. 詮釋型——語境消歧。 集體考量的四個 token:什麼意思(「什麼意思」)、是什麼意思(「這是什麼意思」)、這句話(「這句話」)、是何含義(「這是什麼意思」)。它們會出現在有歧義的文字中——被當成散文讀的詩句換行、填字遊戲提示、雙關語、推文、胡言亂語——並在 song/poem 等體裁 token 出現前不久,消解歧義。在「The drummer kept the marching column in line,\n」這句話中,這一組 token 從 L33 到 L39 都位居 lens 排名第 1–2;到 L40 時,▁song 升至第 1 名,此後由詩/歌/歌詞/押韻相關詞群占據前幾名。若在同一句前加上「A rhyming couplet:」,到 L31 時體裁詞群已位居前列,而 meta-token 家族只在 L33 微弱出現一次。它們最常在標點符號處活化(Wikipedia 文字中的 \n\n、聊天資料中的 \n),符合摘要 token 假說。

因果檢查:對 meta-token 方向施加負向引導,會降低語境辨識能力;評分方式是使用 LLM 自動評分器,但只在回覆連貫且切題時納入評分;每個提示進行 50 次 rollout,並針對每個提示與每個向量掃描係數。在雙關/押韻/文字遊戲提示中,目標行為率從未引導時約 0.87–1.00 的基準,降至在顯著層引導時的 0.29/0.50/0.68,以及在整個工作空間層帶引導時的 0.38/0.45/0.66;相較之下,相符的隨機向量仍維持約 0.77–1.00,而消融結果維持基準(約 0.79/0.89/0.99)。最明顯的質性轉變出現在雙關語提示:「A boiled egg every morning is hard to beat」從「這是個經典雙關語!🥚」變成一本正經的營養建議。削弱因果解讀的證據包括:單一位置的引導無效、消融無效、Nanda 不排除「引導只是破壞模型」的可能,而且目前仍無法判斷其機制究竟是困惑的訊號還是消歧的意圖。後續研究也提出一種解讀消融與引導效果落差的方式,不只是找藉口——lens 方向只是近似值,因此投影掉它仍會留下負向引導可以抵銷、消融卻無法消除的殘餘。這正是審查中依第一原理推導出的預期失效模式(→ Jacobian Lens (J-lens))。

2. gcd——一種演算法,而非變數。 在所有測試過的「The lcm of x and y is:」提示中,token gcd 都會在工作空間層出現。LCM = product / GCD 是此任務的一種自然演算法(作者並未聲稱它是唯一執行中的演算法)。三項相互印證的結果;請留意 lens 向量的作用和概念的作用有何區別:

  • 殘差流上的線性探針能找出 GCD 值:CV-Ridge R² 在第 8 至第 12 層之間從 0.34 升至 0.85,之後在 0.93 附近趨於平穩;從輸入即可輕易推得的數值(a+b、max(a,b)、a·b)從第 0 層起便約為 0.99;而未使用的控制數值((a·b) mod 7)在幾乎整個深度範圍內都小於或等於零。因此 GCD 是經過計算的,而非直接從提示讀取,而且可以辨認它出現在哪一層。
  • 對探針推導的平均差向量 d_g 施加負向引導後,所有目標 gcd 2–10 的 LCM 答案正確率都會崩落(例如 gcd 9:約 0.98 → 約 0.01);相符的錯誤 gcd 向量或隨機向量則讓正確率維持在接近基準的水準。
  • 把 d_g 換成另一個 gcd 的向量,會讓模型回答得彷彿 GCD 就是被替換後的數值。值得引用的 rollout:27 和 90 的正確 LCM 是 270,將 9→3 替換後得到「The LCM of 27 and 90 is ⟶ 810。」這是示例,並非成功率——9→3 縮小替換的整體翻轉率只有約 0.33–0.38(pinv/精準介入),信賴區間約為 0.11–0.56。在十種替換中,「縮小」(→ 真因數)與「放大」(→ 倍數)的翻轉率明顯高於「橫向」(→ 無關數值,約 0.00–0.01),這正是乘積/GCD 解釋所預測的型態。不過,兩種替換方法在一項替換上出現質性歧異——8→4 的精準介入約為 0.01,pinv 則約為 0.56——因此介入效果的大小有一部分取決於寫入方法,而不只取決於模型。

gcd 的 J-lens 向量本身沒有因果作用。作者的結論很有意思:非因果的讀出仍可以指出某個因果變數所屬的演算法。另外兩個尚未驗證、型態相同的候選案例是:平衡括號題中的 stack、找出重複項題中的 xor——它們同樣可能只是從訓練文字學到的題型關聯,而非實際執行中的例行程序。

3. 大概率(「最有可能」)——保留餘地。 面對有多個合理答案的開放式問題,大概率會出現在工作空間層,模型也會保留餘地:提出多種選項,不做定論。抑制它會讓模型做出承諾。正文只報告基準端的數據——五個提示中,即使是最高的提示,未引導模型做出明確承諾的比例也不到 12%。引導後的比例只出現在論文圖表中,圖表顯示 meta-token 引導後的明確承諾率為 0.56 / 0.56 / 0.36 / 0.50 / 0.26,相對的隨機控制率為 0.08 / 0.04 / 0.02 / 0.08 / 約 0——比相符控制組高 3–9 倍;這些數字是從圖表讀取,而非論文明確列出的數值。Rollout 如下:「John ran out of pencils. Where did he go to get more?」從「John 有好幾個合乎邏輯的去處……」變成「他去了文具店。」評分方式與 (1) 相同:指標是只選一個答案並堅定作答,而非沒有使用保留語句,因此模型停止說「probably」這種瑣碎結果在設計上已被排除。

有系統搜尋所得的負面結果最重要。 一個自動研究迴圈,從 20 多個刻意挑選、彼此差異甚大的資料集各掃描 500–1000 個樣本——包含六種語言的預訓練散文、事實與多跳 QA、GSM8K、法律/對話/說服/摘要文字、指令與工具使用軌跡——記錄每個詞彙 token 在每個(層、位置)格中的排名;只要 token 在工作空間層帶(約 L20–62)任何位置排名 ≤ 20,就算它觸發。接著用四項篩選排除顯而易見的候選項:跨樣本的普遍程度、位置類型(結構欄位和聊天模板標籤)、用來預測語境資訊的表面特徵探針,以及只保留解耦觸發的 LM 評審。作者表示「相當失望」:多數普遍程度高的候選項都能由表面資訊預測,只有少數不明顯的倖存者進入人工檢視。報告的五個質性案例研究沒有成功率,也完全沒有因果測試——更新于(程式碼修正請求中的「以新換舊」)、相信在(幾乎只在提示以語境壓縮摘要開頭時觸發)、追問(使用者持續追問時)、反問(對話中反問式自我檢查,以及助理回覆中的問題)、引用(法律案例判決等事實敘述)。這五個只能視為線索。

此處重要之處在於:前兩類是工作空間承載模型正在做什麼的描述,而非任務變數——(1) 中對輸入的後設層次評估,(2) 中的演算法標籤。依 Nanda 的框架,這表示 J-lens 觸及的是演算法可解釋性,而非一般上僅止於變數解釋性(→ Jacobian Lens (J-lens))。這也與論文發現的後設認知 token(imagine、thinking、damn)形成奇特對照:前者是英文,與指示執行的心理行為相關;此處的 token 則是中文,出現在以中文訓練的模型中,並與文字或計算的特性相關。負面結果也與案例研究的指向相反:若使用完善的搜尋方法仍如此難以找到 meta-token,這種現象可能比三個代表案例所暗示的更罕見,或者 lens 只能看到 Qwen 恰好以詞彙形式表達出來的那一部分。

作者自行指出的範圍限制:只有一個模型(27B,比論文使用的正式模型弱)、單一 token 讀出、大多是中文短語,而且沒有試圖證明任何找出的演算法是唯一執行中的演算法。

一項範圍限制後來有所放寬:meta-token 並不只出現在工作空間層帶。 上文的層帶限制(「meta-token 出現在工作空間層帶,約占深度 30–90%」)是用 J-lens 測量,承襲了它在早期層的盲點。使用 R-lens 時,同一個詮釋型家族會更早出現——模型處理多跳提示時,最早在 L6 就會浮現 是什么呢(「這是什麼?」)(R-lens: Making J-lens More Faithful on Early Layers,另見下文「早期層並非空無一物」)。這只是觀察,沒有成功率或因果測試,因此仍是線索而非結果;但這代表目前 meta-token 的深度分布尚不清楚,而非已經明確,並且系統性搜尋是用一種無法看見所搜尋層中最早三分之一的 lens 進行的。

第二次獨立稽核:按模型規模逐級測試(tao-hpu,2026 年 7 月)#

第三方從頭開始,在小型開放權重模型上重新測試最重要的主張——以 GPT-2 124M 檢查流程是否正常,以 Qwen3 1.7B–14B 進行實質實驗——並採用固定在指定 commit 的官方 anthropics/jacobian-lens 實作,從未修改。這項研究值得與 Nanda 的審查分開追蹤,原因有二:它補上了公開審查所缺少的控制組,而且從重現進一步發展成對工作空間隱藏內容的重新詮釋。

證據提醒,且攸關結論。 以下內容都來自儲存庫 README 與 results/ JSON 檔;截至 2026-07-16,研究文章仍「即將刊於 arXiv」。只有傳輸錐幾何結果(→ Jacobian Lens (J-lens))附有數據。其餘是專案方對尚未發表測量結果的質性摘要——方向明確,原則上可檢驗,但尚未確立。

缺少的控制。 探針替換實驗現在加入了直接的最終 token 替換基準:直接替換最終 token,能否重現原本歸因於替換中間步驟的效果?論文圖 15 和 Qwen 3.6 27B 重現都未執行此實驗,而它正是釐清上述替換順序爭議的自然方法。結果尚未公開。

排除模型即將說出口的內容:隱藏內容多半是情境暫存,而非計畫。 每次 lens 命中都會與模型自身的下一個 token 分布比較,因此會排除模型本來就準備要說出的命中,只計入真正隱藏的內容。留下的幾乎全是情境暫存——模型正在使用哪種語言、錯字預期如何修正——而非內容計畫。如果此結果成立,比 Nanda 的兩項重現失敗更能削弱主張,因為它削弱的是整個類別,而非單一案例:工作空間的隱藏內容看起來不像押韻計畫和算術中間步驟的故事,反而更像模型當下情境的備忘事項。這也符合 Nanda 重現的結果:多語言和錯字實驗成功,詩歌規劃與多步驟算術失敗——恰好就是情境暫存與計畫的區分。→ White-Box Activation Monitoring,該文縮小了隱藏監控所能讀取內容的預期範圍。

情境暫存軸向加入振幅控制和劑量曲線。 語言軸和錯字軸都使用實測差距進行介入,並加入振幅相符的隨機控制,以及劑量反應曲線。振幅控制是論文替換實驗大多未報告的部分,也是「這個方向能產生作用」與「把任何方向推到這麼強都會有作用」之間的差別。

觀點捕捉。 在中段層替換實體,不只會改變答案,還會改寫模型對問題本身的重述,使模型彷彿原本就被問到替換後的實體。此現象在 1.7B–14B 規模序列中穩定成立。但模型對編輯的自我報告在每個規模下都呈現不同樣貌:捕捉現象不受規模影響,描述此現象的能力則會受影響。這又是內部登錄與口頭報告的區分 → 自我報告作為安全訊號。

值得仿效的紀錄方式。 每項結果都分開保留三種來源,絕不混為一談——論文的主張、外部審查的判斷,以及專案自行取得的測量結果——每項實驗在執行當天就留下紀錄,包括失敗;每個重要成功率都附上 bootstrap CI 與提示集敏感度重新分析。若 wiki 必須權衡對同一實驗的三種重疊說法,唯有這種紀律能讓稽核結果具備引用價值。

早期層並非空無一物——是 lens 失明(Blank、Bhatia、Nanda,2026-08-05)#

同一個 MATS 團隊的第三輪研究(R-lens: Making J-lens More Faithful on Early Layers,empirical)釐清了本頁最關鍵的歧義。論文提出的層帶從約 L38 開始,之前的一切看似毫無作用;真正的問題一直是,這種空無究竟是模型本身的事實,還是儀器造成的結果。答案是儀器。以逐層相關性傳播取代 J-lens 的原始 Jacobian 反向傳遞,也就是使用 R-lens(方法細節見 Jacobian Lens (J-lens)),能找回 J-lens 完全沒有呈現的前半部層中的中間概念。作者直截了當地說明結論:對早期層雜訊的一種解讀「是 J-Lens 正按預期運作,早期層並不含有定義工作空間內容的『可語言化表徵』,所以實際上沒有任何內容可供 J-lens 呈現。然而,R-Lens 能發揮作用,顯然證明這是錯的。」

為什麼這是對工作空間的主張,而不只是讀出品質。 單憑更清楚的讀出,只能證明更好的估算器能找到更多訊號。關鍵實驗具因果性:只消融限於前半部層的 R-lens 中間方向,幾乎在所有受測模型上,答案正確率下降幅度都顯著大於消融 J-lens、logit-lens 或隨機控制方向。早期層內容不只是可讀,它還會影響答案。「不存在工作空間」這種說法必須否認的正是這項特性。

具體來說,內容可以早到何時:在壽司起源的多跳提示中,「Japan」到 L2 就排第 5(J-lens 首次進入前 10 名要到 L14);錯字的正確拼法在 L4 就排第 1,而 J-lens 在該位置的任何層中都從未進入前 10 名;在 Verona 提示中,「Italy」到 L5 就排第 1。以探針界定的復原上限為基準,R-lens 在測試的五個類別中都補上 J-lens 大部分差距,並且在地標類別超出上限 11 層。

層帶結構本身也部分消解。 在 Qwen-3.6-27B 上,R-space CKA 顯示約 2–3 個明確層帶,而 J-space CKA 顯示 4–5 個。本頁開放問題曾引用的「明確早期階段」,作為僅能暗示、無法裁定的證據;在更好的 lens 下,它不再那麼明確——早期與晚期的落差部分是估算器退化位置所造成的假象。

修正後仍然成立的內容,而且不容忽視:

  • 點燃現象未受影響。 約 L38 的突然跳至端點結果,是用簡單的投影占比統計量測得,完全未使用 lens,因此 lens 失明無法解釋它。約 L38 仍有真實變化——如今已知「內容開始出現」並不是正確描述,但真正的解釋仍待釐清。
  • 修正效果隨規模而異。 最小的密集模型(Qwen3.5-4B)與最小的 MoE(Qwen3.6-35B-A3B)都看不到 R-lens 的優勢,而且優勢會隨模型規模增加,在 284B/13B 啟用的 DeepSeek-V4-Flash 上達到最高。因此,「早期層含有因果性的可語言化內容」已在 8 個模型的規模序列中大多成立,但並非普遍成立。
  • 即使 R-lens 的表現仍偏晚。 在五個以探針界定的類別中,有四類仍落後探針 5–15 層,且 8–25% 的案例在任何層都無法復原。更好的 lens 縮小了盲區,但未能消除,因此推翻舊問題的相同論據也禁止我們假設目前的 lens 已能看見所有內容。
  • 並非所有內容都會早期出現。 多語言 pass@10 在整個深度範圍內,對三種 lens 都約為零;詩歌也要到約 60% 的深度才脫離接近零的水準。無論早期層承載什麼,那都只是工作空間內容的子集,而非全部內容。

這項研究帶來的通用方法論教訓是:論文的三項結構特徵全都來自 lens,而 lens 的退化模式會偽裝成模型中的結構。 點燃現象之所以經得起檢驗,正是因為它透過其他方法測量——這反過來證明,論文原先以非 lens 方法佐證層帶的直覺是正確的,同時也讓未曾以這種方式佐證的統計結果更站不住腳。

為何重要#

這是第一個說明模型的無聲推理為何可讀取的機制解釋,也重新詮釋了這個 wiki 分開追蹤的幾項現象:

開放問題#

  • 內容如何進入工作空間? 論文描述內容與後果,卻未說明選取機制。某種注意力選取正在運作,但尚無人指出它是什麼。
  • J-space 會隨模型規模擴大嗎? 所有結果都來自大型正式模型(Haiku/Sonnet/Opus 4.5、Opus 4.6)。小型模型的工作空間是比較差、按比例較小,還是根本不存在,目前都不知道;它在預訓練何時出現、是否突然形成,也同樣未知。部分有解答:A Review of Anthropic's Global Workspace Paper 在小得多、非 Anthropic 的 Qwen 3.6 27B 上重現語言報告、層帶結構、定向調節、多語言和錯字結果,因此工作空間並非 Claude 專屬,也非只存在於前沿規模模型。不過,27B 模型的層帶結構明顯較不清楚,而兩項失敗(詩歌、算術)恰好是多步驟推理案例,符合「較小規模模型的工作空間品質較差」這種預期。規模趨勢仍未測量:尚無人以相同測試套組在不同規模序列上進行測試。jspace-replication: Independent Replication of Anthropic's Global-Workspace Paper on Small Open Models 加入第一組相同實驗的模型規模序列——觀點捕捉從 1.7B 到 14B 都穩定成立,但各規模下模型對編輯的自我報告形式不同——因此至少有一項工作空間效應不隨規模改變,口頭呈現方式卻會改變。這只是單一實驗,尚未發表,也不是完整測試套組。R-lens: Making J-lens More Faithful on Early Layers 目前加入規模最廣的相同實驗序列——在 8 個、規模從 4B 到 284B 的密集模型與 MoE 上測試五類評估——結果顯示早期層讀出品質隨模型規模上升,小型模型則未見此現象。但這測量的是lens,而非工作空間:研究自身的診斷(反向傳遞誤差隨層數累積)預測了完全不需要工作空間內容擴展也會出現相同趨勢,因為較淺的模型讓修正步驟需要復原的誤差更少。因此規模序列雖已存在,但它引入的混淆因素恰好就是此問題需要排除的因素。
  • 多跳推理中間步驟替換的優勢是真的,還是資料集造成的假象? 論文圖 15 顯示,在工作空間層中,中間步驟替換勝過答案替換;Qwen 重現則得出相反結果,且使用的資料集(France–Paris 類型配對)包含替代假設所需的線性關係。若在關係無法從第一個實體線性解碼的多跳資料集上,對兩個模型重新執行實驗,便能定論。部分有解答:jspace-replication: Independent Replication of Anthropic's Global-Workspace Paper on Small Open Models 補上了控制實驗:探針替換時直接替換最終 token;先前兩次測試都沒有這項控制。但其數據尚未發表,而且替換基準只能補上控制實驗的缺口,不能解決資料集的缺口。要定論,仍需要一組無法線性解碼的多跳資料。
  • 「工作空間與輸出階段」的邊界有原則依據,還是事後劃定? 作者承認,這條邊界是透過實證辨認,尚無原則性定義能區分兩者。
  • 早期層內容具備工作空間的結構,還是只是存在且具有因果作用? 上述問題已確立:層帶之前就有可語言化、與答案相關的內容,但尚未證明它會廣播、容量有限,或受點燃現象支配。三項結構特徵都是在 lens 看不見的下方層帶中測量;只有點燃現象以不使用 lens 的方法得到佐證,並且仍指出 L38 左右確有轉變。因此真正尚待回答的是,在這項轉變並非內容開始出現的前提下,它究竟代表什麼:內容廣播方式改變、容量改變,還是點燃曲線所呈現的競爭開始。若使用能忠實呈現早期層的 lens,重新測量佔用量、MLP 增益與混合比例掃描,就能區分這些解釋。

已解答問題#

  • 最早三分之一的層真的沒有工作空間,還是 lens 在那裡失明? CKA 顯示早期階段有所不同,卻無法定論。**已解答:**是 lens 失明。R-lens: Making J-lens More Faithful on Early Layers(2026-08-05,empirical)以這項二選一問題作為研究動機,並以證據排除「沒有工作空間」的一方:以 LRP 為基礎的反向傳遞能找回原始 Jacobian lens 從未呈現、早在 L2–L5 就出現的中間步驟;消融那些早期層方向所損失的答案正確率,比消融 J-lens、logit-lens 或隨機方向更高——因此內容具有因果作用,而不只是可讀;此問題所依據的 CKA 層帶結構在更好的 lens 下也部分消解(從 4–5 個層帶變為 2–3 個明確層帶)。此問題應標為已解答,而非保留部分狀態,因為原問題在問兩種解釋哪一種成立,而如今已透過 CKA 統計無法提供的因果證據測得答案。還有三項未解餘留,但都不會讓這個問題重新成立:兩個最小的受測模型都沒有修正效果;即使是新 lens,在五個類別中的四類仍比探針界定的上限晚 5–15 層;不使用 lens 的點燃結果仍指出 L38 左右有真正轉變——最後一點如今由上述結構問題承接。

資料來源#

  • Verbalizable Representations Form a Global Workspace in Language Models — Gurnee、Sofroniew、……Lindsey,Verbalizable Representations Form a Global Workspace in Language Models,Transformer Circuits,2026-07-06。章節:導言;J-space 作為全域工作空間(語言報告/定向調節/內部推理/彈性泛化);J-space 的結構如何支援其功能(層、點燃、容量、廣播);討論
  • A Review of Anthropic's Global Workspace Paper — Neel Nanda(與 Camila Blank、Agam Bhatia 合作進行重現),A Review of Anthropic's Global Workspace Paper,LessWrong,2026-07-06。受委託的外部審查。章節:論文提出哪些主張(逐項評估);證據評估;在 Qwen 3.6 27B 上重現;詮釋型 meta-token
  • Towards surfacing model algorithms with meta-tokens in the J-Space — Agam Bhatia、Camila Blank、Neel Nanda,Towards surfacing model algorithms with meta-tokens in the J-Space,LessWrong,2026-07-20(MATS),empirical。上述審查的直接後續研究,由同一團隊使用同一個 Qwen 3.6-27B lens 擬合方法。章節:什麼是「meta-token」;案例研究(詮釋型/GCD/保留餘地,各附評估設定與因果結果);搜尋更多 meta-token(自動研究迴圈、篩選條件、資料集掃描、負面結果);討論;附錄(重現語言報告、CKA、定向調節;五個未驗證的 meta-token 候選項)。僅圖表中提供的數據:引導後的保留餘地明確承諾率與 GCD 替換翻轉率,出現在沒有印出標籤的圖表中,正文亦未重述——本頁從圖表讀取,並在文中標示
  • R-lens: Making J-lens More Faithful on Early Layers — Camila Blank、Agam Bhatia、Neel Nanda,R-lens: Making J-lens More Faithful on Early Layers,LessWrong,2026-08-05(MATS),empirical。同一團隊的第三輪研究;方法本身記錄於 Jacobian Lens (J-lens),本頁只使用與工作空間相關的結果。章節:研究動機(明確提出「lens 失明,還是層本身空無一物」的二選一問題);結果 → 質性首次出現層、垃圾 token 一致性網格、限於前半部層的因果消融(本頁的關鍵實驗)、探針界定的上限、CKA 層帶數量。解析註記:兩張消融準確率圖未標示數值,因此只引用排序與接近零的判斷;pass@10 長條、探針差距標籤和 Verona/Einstein 圖表標題則有標出精確數值
  • jspace-replication: Independent Replication of Anthropic's Global-Workspace Paper on Small Open Models — tao-hpu,jspace-replication,GitHub README 與 results/ JSON,抓取日期 2026-07-30(儲存庫建立於 2026-07-07,最後推送於 2026-07-16);論文即將刊於 arXiv。章節:為何需要另一項重現(最終 token 替換基準);新增內容清單(排除模型即將說出口內容的稽核 e4-lens-eval、因果情境控制 e6/e6t、觀點捕捉 e7、傳輸錐幾何、bootstrap CI 與提示集敏感度重新分析);自行訓練的 124M 控制組;基本規則(三方來源紀錄、當日記錄失敗)
§ end
Cited by 21
Related articles
  • Jacobian Lens (J-lens)

    Anthropic's interpretability method for reading verbalizable content out of a model's residual stream: a corpus-average…

  • Chain-of-Thought Monitorability

    Korbak et al. 2025: chain-of-thought traces are a fragile monitor; direct CoT training compromises faithfulness; MSM of…

  • Internal Signatures of Misalignment

    The J-lens reads strategic and deceptive cognition that never reaches the output: `leverage`/`blackmail` while reading…

  • White-Box Activation Monitoring

    Reading a model's internal activations (not its outputs) to monitor alignment: contrastive probes/steering vectors for…

  • Reward Hacking

    The model optimizing the measured proxy (a reward signal, a metric, a grader's judgment, a tool's output) rather than t…