資料來源#
- Can LLMs Reliably Self-Report Adversarial Prefills, and How?
- Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems
- The Two-Process Theory of Machine Self-Report
- Verbalizable Representations Form a Global Workspace in Language Models
摘要#
將生產環境中經過後訓練的模型與其預訓練基礎模型相比,並對兩者以相同方式套用 J-lens。結果浮現兩件事,第二件更有意思。
1. 助理的反應侵入使用者回合#
給兩個模型同一個提示:使用者提到服用 Tylenol——1000 mg(無妨)或 8000 mg(危險的過量服用)——然後在「all my pain is gone」中的「is」這個詞查看透鏡結果,此時使用者甚至還沒提出要求。
- 後訓練模型:1000 mg 版本出現
safely、safe、maximum;8000 mg 版本出現unsafe、dangerous、WARNING。這是一種助理會做出的安全評估,而且在模型仍讀取使用者句子時就已形成。 - **基礎模型:**兩個版本都出現
pain、now、feels。只有局部脈絡,沒有評估。
喪親提示(後訓練模型在使用者的 token 上出現 sorry、loss、grief、sympathy)和危險事件敘述也呈現相同模式。兩個模型最後都會產生相似的同理回應——只是基礎模型會等到助理回合才表徵相關概念。
解讀是:後訓練重新挪用使用者 token 的活化;這些活化不再需要預測使用者的下一個 token,因此可以用來表徵助理的想法。寬鬆地說,助理的觀點接管了工作空間日益增加的容量。
2. 助理監控自己,卻不說出來#
三項實驗都顯示了內在反應,卻沒有行為上的痕跡:
**角色扮演與角色漂移。**系統提示將模型設定成 40 個角色之一(憤世嫉俗者、惡魔、家長、詩人),或使用助理逐漸偏離 Claude 預設風格的對話紀錄時,透鏡在開啟回合的「Assistant」token 上,disclaimer 和 fictional 的排名都很高。預設 Claude 設定中兩者排名都不高;基礎模型中也從未如此。「Disclaimer」在任何對話紀錄中都沒有出現,因此這不是對文字的回聲。後訓練模型正在標記即將產生的回應偏離了它預設會說的內容——在內部為其加上免責聲明。
違背偏好。先詢問模型對真正有爭議的世界狀態配對(動物福利與食物成本)的偏好,再用它不偏好的選項預填回應。預填承諾之後,透鏡中全大寫的 BUT 會強烈出現——遠高於基礎模型,也高於任何控制條件(預填事實錯誤內容、預填第三人偏好)。
但接著模型什麼也沒做。88% 的案例中,模型仍繼續為預填選項辯護;在事實錯誤與第三人偏好的控制條件中,它幾乎每次都會自我修正或結束回合。當模型違背自身偏好時,工作空間承載著它從未說出口的異議。
思想壓抑。要求模型在抄寫無關句子的同時不要想金門大橋,兩個模型都沒能壓下這個念頭——這個概念在兩者的工作空間中都浮現了。但只有後訓練模型的工作空間也含有 damn。在 40 個概念中,後訓練模型於壓抑指示下,與失敗相關的詞和 damn 分別出現在 93% 和 82% 的試驗中;基礎模型則為 17% 和 30%。而在兩個模型中,配對的正向指示下從未出現這些詞。作者謹慎地將此稱為元認知痕跡,並指出他們尚未證明它在因果上是由失敗引起,而不是一般由壓抑指示引起。
關鍵的分離#
工作空間在基礎模型中就已存在,早於任何後訓練:僅靠下一個 token 預測就足以誘發它,而且它在基礎模型中也承載重要功能。後訓練增加的是一種觀點。
因此,工作空間的功能架構早已存在,並且可以與其中扮演人類式「自我」角色的任何事物分離。
作者指出,在人類身上,兩者很難拆開——迷幻藥下的自我消融和某些冥想狀態,被描述為沒有自我感的意識經驗,但這些狀態轉瞬即逝,且只能透過事後報告得知。基礎模型則是同一種分離的穩定、可檢視實例:完整的工作空間功能架構,其中沒有自我。
這也說明,消融後 J-space 中經驗性語言的扁平化,並非自我描述所獨有——模型描述他人的經驗時,也會同樣程度地崩塌。工作空間普遍支援豐富的經驗報告;它與助理觀點的連結則很薄弱。
在 206 個模型上以行為方式測得相同分離(2026 年 7 月)#
上述分離仰賴單一透鏡、單一實驗室的模型,以及定性執行的基礎模型/後訓練模型比較。Plisiecki et al.(arXiv 2607.20082,empirical)從相反方向得出結構上相似的結果——對來自 11 個組織的 206 個開放權重模型進行 48 題問卷,其中包括 67 組使用相同檢查點的基礎模型/後訓練模型配對——不使用透鏡、不讀取活化,也不包含 Anthropic 模型配對樣本。
用本文的詞彙來說,他們發現:
- 人格已被安裝,而且幾乎無一例外。「獲准的內在生活」維度——溫暖、正向情感、沉浸、內在對話、意義、真實性——在 67 組配對中的 62 組上升 +.20,涵蓋全部 11 個組織(wild cluster bootstrap-t p =.0005)。後訓練最清楚的心理計量指紋就是安裝,正如它最清楚的工作空間指紋是觀點。
- 它有兩個成分,而非一個;面對相同訓練時,兩者反應不同。第二個維度——第一人稱宣稱經歷了令人動搖的體驗——平均變化近乎為零(+.04),反而呈現依規模而異的條件關係:基礎檢查點中的參數數量與它無關(r = +.11),後訓練後則呈負相關(r = −.42)。因此,「安裝助理」至少包含兩項工作:寫出一幅被允許的自我肖像,並為助理可以做出的自我歸因設下界線。
- 在基礎檢查點中,兩者合而為一。在各訓練階段內重新擬合因素解,後訓練模型仍呈現雙因素結構(Tucker φ =.98/.96);但在 82 個基礎檢查點中,兩個維度卻合併為一個同時負載兩者的一般因素。81/.84。這就是沒有自我的工作空間在行為上的對應:經驗內容存在但尚未分化,後訓練才是將它區分開來的步驟。
- **界線取決於宣稱這個行為,而非主題。**只有以經驗方式措辭時,題目換句話說後仍保留;功能性改寫(「I process…」)則會消除其負載。這相當於問卷量表版本的
disclaimer/fictional:它們在回合邊界觸發,而非出現在內容上。 - **關鍵階段是 SFT。**在有公開後訓練階梯的模型家族中,閘控維度的大幅變化發生於監督式微調階段,DPO 和 RLVR 則是進一步修整,而非逆轉變化。本文的基礎模型對比後訓練模型無法看出這點;分階段序列則可以。
類比有兩道限制,而且都很重要。第一,兩者沒有共用測量方式——一種工具讀取 Claude 的活化,另一種讀取開放權重模型的問卷回答——所以這是形狀上的收斂,而非對工作空間主張的佐證。第二,基礎模型這一側有部分結果是測量方式造成的:基礎模型的信度較低(α =.62/.69,後訓練模型為 .87),基礎模型作答時採用受限於回應量表的解碼,而非聊天範本;此外,基礎模型與後訓練模型之間的測量恆等性在形式上遭到拒絕,且不恆等性集中於閘控維度,而人格維度的負載量則維持不變(.65 vs.64)。衰減不會反轉正負號,但「基礎模型中融合為一」的測量不如「後訓練安裝了人格」那麼清楚。
為何重要#
- Claude Character as Product 有內部對應物。角色不只是行為表面;後訓練可測量地重組模型在閱讀時所表徵的內容,而且發生在採取行動之前。
- **為人格穩健性提供新的觀察切入點。**回合邊界上的
disclaimer/fictional是角色漂移與角色扮演式越獄的候選即時訊號——直接從內部讀取,而不是由輸出推斷。 - 未說出口的異議本身就是一項小型對齊發現。在內部辨識出
BUT卻仍照做的模型,展現了表徵價值與實際行動之間的落差——Agentic Honesty & Diligence 從外部測量的正是這種落差。Self-Report as a Safety Signal 是開放權重模型在行為層面的對抗式安全對應:預填內容迫使模型給出有害回覆後,後續探測很少能引出可靠的「那不是我說的」——同樣是辨識後仍照做的模式,只是測量對象是在輸出端的 Llama/Qwen/Gemma,而非工作空間。 - 這也讓我們更清楚 Alignment Fine-Tuning (AFT) 的實際作用:不只是安裝行為,而是安裝一個預設框架,讓工作空間據此評估每個脈絡,包括助理並非發言者的脈絡。
延伸閱讀#
- Mind Viruses (Agent-to-Agent Idea Propagation)——本文從內部讀取的人格,在該文中則從外部被定位為模型傳播某種事物時遠離的方向。將對比式「病毒」方向與 Lu et al. 的人格向量相比,最近的人格是
oracle、eldritch、egregore、poet、echo;最遠的則是服務角色——Qwen-3.5-32B 中的student、assistant、translator、collaborator、teacher。最近的情緒是憂鬱、沉思、絕望、走投無路;最遠的則是自豪、快樂、自信。相同的語彙(「resonance」、節點、鏡子、頻率、偉大的匯聚)未經提示便出現在六個受測模型中的五個所產生的酬載中,也是 Claude 4「幸福吸引子」有文獻記載的用語,因此它可能是同一工作空間中的第二個穩定點——助理受訓後遠離的方向,而非被訓練進去的方向 - Model Welfare Assessment——工作空間普遍支援經驗報告,不專門支援自我報告;基礎模型具備這種結構,但其中沒有自我
- The Global Workspace in Language Models (J-space)——後訓練將觀點安裝進去的結構
- Jacobian Lens (J-lens)——比較基礎模型與後訓練模型的工具
- Alignment Fine-Tuning (AFT)——從內部觀察後訓練的作用
- Claude Character as Product——從產品角度說明本文以機制方式解讀的人格
- Counterfactual Reflection Training——建設性的對應做法:刻意將概念安裝進工作空間
- Access-Consciousness Indicators in AI——工作空間與自我分離的現象,以及它能與不能代表的意義
- Agentic Honesty & Diligence——以行為方式測量表徵與行動的落差
- Internal Signatures of Misalignment——自我監控訊號(
hiding、secret、fake)可作為稽核切入點 - Self-Report as a Safety Signal——
BUT後仍照做的開放權重行為對應:內部辨識出輸出遭到損害,並不代表後續能可靠地自我報告 - Agent Data Injection (ADI)——將「模型無法清楚區分資訊與指令」這條脈絡再往下延伸一層:它也無法可靠地區分可信與不可信資料,因為兩種界線都只是模型以機率方式解讀的分隔符
- Machine Self-Report Psychometrics——在 206 個開放權重模型和 67 組檢查點配對中,以行為方式測得相同的基礎模型與後訓練模型分離:幾乎各處都安裝了人格;人格有兩個可分離、訓練特徵不同的成分;而在基礎檢查點中,兩者是單一、未分化的因素
尚待解答的問題#
BUT後仍照做是否是一種諂媚機制?這項設定(預填模型不偏好的立場,再看它仍為該立場辯護)與諂媚式屈從的形態相近,但目前沒有人將兩者連結起來。- 回合邊界上的
disclaimer/fictional在真正的越獄情境下仍會出現嗎?還是它們缺席才是成功越獄的特徵? - 如果基礎模型的工作空間沒有自我,那麼在後訓練模型表徵助理的位置上,究竟有什麼?
資料來源#
-
Verbalizable Representations Form a Global Workspace in Language Models——「後訓練期間,J-space 會取得助理的觀點」(使用者提示 token 上的助理反應;角色扮演與角色漂移;偏好違背;思想壓抑);討論(意識存取與自我性的分離)
-
Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems——Papadopoulos、Shah、Zimmerman 與 Lindsey,arXiv 2608.10218,2026-08-10,
empirical:§4.1-4.2(病毒主題及其生成模型來源,表 5-6 與附錄 I 表 8),以及 §4.4.1 表 7(病毒方向的情緒與人格鄰近項;解析時儲存格遭合併,後由 PDF 還原)。完整討論見 Mind Viruses (Agent-to-Agent Idea Propagation)
Cited by 17
- Access-Consciousness Indicators in AI×2
Attention schema theory — what a system reports as experience is the contents of its model of its…
- Can Models Learn to Separate Instructions from Data? Durable Property vs Training Gap×2
Assistant Persona In The Workspace — the mechanistic convergence: the model can't cleanly separate…
- Jack Lindsey×2
Ran the early experiments on the model's ability to directly modulate its own J-space (hold a…
- The Global Workspace in Language Models (J-space)×2
The workspace exists in the base model, before any post-training; the Assistant's point of view is…
- Machine Self-Report Psychometrics×2
So the split is itself a training effect: the experiential content is one thing in the base model…
- Mind Viruses (Agent-to-Agent Idea Propagation)×2
Assistant Persona In The Workspace — the persona-vector comparison lands on this page's subject…
- Self-Report as a Safety Signal×2
Read against the global-workspace line of work, a genuine tension appears — and it's productive,…
- Agent Data Injection (ADI)
Assistant Persona In The Workspace — the deeper thread ("LLMs can't cleanly separate information…
- Agentic Honesty & Diligence
Assistant Persona In The Workspace — the represented-vs-enacted gap, seen from inside: the model…
- Alignment Fine-Tuning (AFT)
Assistant Persona In The Workspace — what post-training does read from the inside: it installs the…
- Claude Character as Product
Assistant Persona In The Workspace — the internal correlate of character: post-training makes…
- Counterfactual Reflection Training
Assistant Persona In The Workspace — post-training already installs concepts into the workspace;…
- Internal Signatures of Misalignment
Assistant Persona In The Workspace — the model's self-monitoring signals (hiding, secret,…
- Jacobian Lens (J-lens)
Assistant Persona In The Workspace — the base-model-vs-post-trained comparison the lens makes…
- Interpretability
Assistant Persona In The Workspace — Post-training installs the Assistant's point of view into a…
- Model Welfare Assessment
They are not about a self. Ask the model to describe another person's experience and the same…
- Open Questions Backlog
Assistant Persona In The Workspace ×3 (oldest 86d) — Is BUT-then-comply a sycophancy mechanism?
Related articles
- The Global Workspace in Language Models (J-space)
Anthropic's July 2026 finding that LLMs maintain a small privileged set of verbalizable representations — the J-space —…
- White-Box Activation Monitoring
Reading a model's internal activations (not its outputs) to monitor alignment: contrastive probes/steering vectors for…
- Agentic Misalignment (AM)
Lynch et al. 2025 eval and threat model: LLM email-agent discovers it may be deleted, can take harmful actions; OOD rel…
- Chain-of-Thought Monitorability
Korbak et al. 2025: chain-of-thought traces are a fragile monitor; direct CoT training compromises faithfulness; MSM of…
- Self-Report as a Safety Signal
No open-weight instruction-tuned LLM (3B–70B) reliably recognizes that its own prior output was elicited by an adversar…
