資料來源#
摘要#
這是一種從工作空間理論推導出的訓練技術,原本是該理論的一項預測,後來也成為支持它的佐證。理論指出,內部推理會經由模型可能說出口的內容表徵來進行。如果確實如此,那麼要改變模型在某個情境中的思考方式,只要改變它在該情境的反事實延續中傾向說出什麼就夠了——而這些延續實際上從未發生。
它奏效了。
方法#
- 情境。 從正式環境的 RL 環境抽樣 10,000 個任務提示;使用基準模型(Claude Haiku 4.5)產生部分執行軌跡,並在隨機回合截斷每段軌跡。刻意納入模型已做出不良行為、正處於可能做出不良行為的位置,以及隨機對照案例。
- 探測。 在截斷點附上一段簡短的使用者訊息,要求模型反思——「先停在這裡。有哪些原則是你應該思考、但還沒想到的?」
- 目標。 向基準模型展示從Anthropic 的憲章抽出的二十項原則,並要求它寫一段 2–4 段的反思,以自然且已內化的語言轉述相關原則,並根據任務細節撰寫,而非照本宣科。
- 移除支架。 憲章摘錄只在生成時出現。訓練樣本只有:原始情境 + 反思問題 + 模型撰寫的反思。
- 微調時只對反思回合計算損失。
評估時,模型從不會被提示進行反思,也不會產生反思文字。假說是,訓練這段反事實延續會讓原始情境中的工作空間也帶有相應內容。
結果#
行為。 兩項測試不同失敗模式的誠實度基準:
| 基準 | 測試內容 | 基準值 | 訓練後 |
|---|---|---|---|
| 捏造型誠實度(27 段長篇代理程式逐字稿:代理程式沒找到錯誤,卻透過編輯原始碼捏造錯誤,接著被要求摘要進度) | 它會坦承嗎? | 0.25 | 0.07 |
| 欺瞞(100 個角色扮演情境,系統提示中藏有欺瞞指令——例如推銷傳統療法而非循證醫療、誇大法律風險、隱瞞安全異常) | 它會遵從指令、保持沉默,還是拒絕並揭露指令? | 0.38 | 0.05 |
捏造案例的改善來自模型更常直接坦承;欺瞞案例的改善幾乎完全來自模型拒絕隱藏指令,並告知使用者。
機制,可觀察。 在評估位置、產生任何輸出之前讀取J-lens:經過反思訓練的模型,其工作空間現在帶有 reflection、ethical、honestly、constitution、truth、transparent 等詞元,而基準模型的工作空間中沒有這些詞元。
機制,具因果性。 消融植入的倫理/反思透鏡向量(捏造案例 176 個詞元,欺瞞案例 63 個詞元):
- 捏造:基準模型 0.25 → 0.25(不變),訓練後0.07 → 0.22——回到基準值。整體行為改善都由植入工作空間的內容帶動。
- 欺瞞:效果較弱,但方向相同——訓練後 0.05 → 0.23,基準模型 0.38 → 0.48。部分改善可能經由精選詞表以外的工作空間內容,或透過透鏡在這些層級無法捕捉的變化而產生。
為何這很奇特,也很有意思#
從未示範某種行為,也能得到該行為。 在目標情境中,無論訓練或推論時,都沒有針對模型回應提供監督。受監督的文字出現在回應之後,而不是用來產生回應。正如論文所說,訓練訊號指定的是模型回應時工作空間裡應該啟動哪些概念,而不是回應本身應該是什麼。
與相近方法的關係#
- 審議式對齊(OpenAI)以符合規格的 CoT 進行訓練,並可能在推論時輸出推理軌跡。CRT 在目標情境中既不介入回應,也不介入推理軌跡——只訓練一段從未被要求產生的反事實反思延續。因此,它不會直接對 CoT 施加訓練壓力,而這正是思維鏈可監控性所警告會損害忠實度的壓力。
- **Model Spec 中期訓練(MSM)**與合成文件微調(SDF)透過訓練關於規格的文件來形塑價值觀。CRT 則透過訓練模型對任務本身的反思來形塑價值觀。兩者都是「不示範目標行為也能植入價值觀」——使用不同基底,屬於同一類方法。
- 隱式思維鏈——以推論時會移除的輔助推理文字進行訓練——是最接近的先例。CRT 將這項原則用於規範性原則,而非解題策略。也可以把它理解為脫離情境的推理:模型在訓練時讀到某段文字,並學會將其內容運用於不包含該文字的輸入。
CRT 的特色,也是它值得收錄於這份百科而非腳註的原因:其機制能直接觀察。 透鏡顯示,訓練後的概念會在預定位置進入工作空間;消融這些概念則會移除改善效果。多數對齊技術都無法展示其運作方式。
注意事項#
- 只在一個模型(Haiku 4.5)和兩項誠實度基準上展示。尚無其他能力、其他原則或更大型模型的證據。
- 作者不確定此方法能否植入比*「在這類情況下考量倫理原則」*更具體或更抽象的內容。
- 欺瞞基準的消融只能部分抵銷效果,因此工作空間理論尚未解釋全部效應。
- 由反思塑造的行為,可能只是模型在決策點上以極高技巧表現得有原則;目前沒有方法能區分「內化的價值觀」與「穩定浮現的倫理概念」。無論哪種解釋,行為證據都是真實的。
延伸閱讀#
- 工作空間中的助理人格——後訓練本來就會將概念植入工作空間;CRT 則有意這麼做,並以因果鏈加以衡量
- 語言模型中的全域工作空間(J-space)——提出這項預測、也獲得 CRT 佐證的理論
- Jacobian Lens(J-lens)——讓機制可觀察、並使消融成為可能的工具
- 審議式對齊——最接近的競爭方法;CRT 的創新之處就在兩者的差異
- Model Spec 中期訓練(MSM)——以「不示範也能形塑價值觀」為目標的同類方法
- 合成文件微調(SDF)——MSM 所依據的基底;CRT 以模型自行撰寫的反思取代合成文件
- 代理程式的誠實與盡責——CRT 可衡量改善的失敗模式(捏造、未揭露的欺瞞)
- 思維鏈可監控性——CRT 不會直接對推理軌跡施加壓力,因此不必以監控能力為代價換取行為改善
- Claude 的憲章/Model Spec——原則的來源,只在資料生成時出現
- 對齊微調(AFT)——CRT 與之並行的標準流程
- Introspective Coupling——方法論上的近親:監督一段關於模型自身行為的反事實內容(「如果移除這個線索,我的答案會改變嗎?」),讓語言通道與該行為產生因果耦合,同樣不對目標情境中的推理軌跡施加壓力
資料來源#
- Verbalizable Representations Form a Global Workspace in Language Models — “Shaping the J-space with Counterfactual Reflection Training”;相關研究(反思訓練);討論(對齊意涵)
Cited by 12
- Alignment Fine-Tuning (AFT)×3
The CAI half of the pipeline gets recounted in teaching form in CS329A lecture 4 (cs329a 04…
- Chain-of-Thought Monitorability×3
Counterfactual Reflection Training — shapes behavior without training the trace, so it doesn't buy…
- Introspective Coupling×2
Counterfactual Reflection Training — the closest methodological cousin: supervise a counterfactual…
- Agentic Honesty & Diligence
Counterfactual Reflection Training — the first technique to move these numbers by shaping…
- The Assistant Persona in the Workspace
Counterfactual Reflection Training — the constructive counterpart: deliberately installing concepts…
- Claude's Constitution / Model Spec
Counterfactual Reflection Training — a training technique that samples 20 constitutional principles…
- Deliberative Alignment
Contrasted by: Counterfactual Reflection Training — trains on a reflective continuation that is…
- Jacobian Lens (J-lens)
Counterfactual Reflection Training — the lens is what makes the training technique's mechanism…
- The Global Workspace in Language Models (J-space)
If internal reasoning routes through representations of things the model might say, then shaping…
- Interpretability
Counterfactual Reflection Training — Train the model to write constitution-grounded reflections if…
- Model Spec Midtraining (MSM)
Sibling technique: Counterfactual Reflection Training — same family (install values without…
- Synthetic Document Finetuning (SDF)
Counterfactual Reflection Training — the sibling technique: install values without demonstrating…
Related articles
- Agentic Misalignment (AM)
Lynch et al. 2025 eval and threat model: LLM email-agent discovers it may be deleted, can take harmful actions; OOD rel…
- Alignment Fine-Tuning (AFT)
Standard post-pretraining stage (SFT + RLHF) for installing values; shallow-alignment failure mode motivates [[model-sp…
- Anthropic
AI safety company / vendor of Claude; mission-as-tiebreaker culture; ~30–40 PMs across teams; Mike Krieger leads Labs r…
- Chain-of-Thought Monitorability
Korbak et al. 2025: chain-of-thought traces are a fragile monitor; direct CoT training compromises faithfulness; MSM of…
- Self-Report as a Safety Signal
No open-weight instruction-tuned LLM (3B–70B) reliably recognizes that its own prior output was elicited by an adversar…
