資料來源#
摘要#
這篇文章要探討的問題是:相較於模型原本就有的答案,思維鏈帶來了什麼? Sarfati、Tiwari、Boppana、Earls、Varadaraj 與 Ho(arXiv 2607.08046,2026-07-09,empirical;Goodfire 與 Eternis)以最簡單的介入方式進行測量:在助理回合前填入一個空白 think 區塊——<think>\n\n</think>\n\n<answer>——迫使模型立即作答。在相同問題上執行強制作答與自由作答兩種條件,兩者的差異就是推理帶來的效果。
在 Eternis-Forecaster 32B 的開放式預測問題上,差異不大,而且呈現明確模式:
- 信心不依賴推理。 強制前綴下每題的平均口述信心,與自由推理值非常接近
y = x(Spearman ρ = 0.90,test;0.87,aljazeeraLate2025;0.78,aljazeera2026Q1)。 - 答案大多早已決定。 在 67% 的測試問題中,強制答案與自由生成的眾數答案一致(兩個分布外切分為 64% / 56%)。
- 推理讓答案更集中,而非搜尋答案。 固定
<answer>位置,只改變 think 區塊,思維鏈便會讓三分之二問題的機率集中在領先候選答案上。在強制通過時答錯的問題中,只有 4% 得到修正,而 72% 會再次選擇同一個錯誤答案。 - 準確率提升確實存在,但幅度很小:分布內提高 +1.9 個百分點(95% CI [+1.0, +2.9]),
2026Q1提高 +1.9 個百分點,Late2025提高 +0.9 個百分點且未達顯著。
作者用一句話概括:「CoT 大多只是確認並強化模型單憑提示就已形成的預測……而非找回模型原本並未掌握的答案。」
這是共享預算分配研究在單一問題上的對應發現:模型無法在不同問題之間分配運算資源。前者顯示模型按閱讀順序花用預算;此處則顯示,對於模型確實花費資源的問題,大部分運算都在確認第一個推理 token 出現之前就已形成的答案承諾。
證據說明。 保留
empirical等級。測量條件採用匹配的解碼設定、以問題為單位重新抽樣計算 bootstrap 信賴區間,並包含負向控制(打亂標籤與打亂活化值的探針結果均為隨機水準)。研究範圍狹窄且關鍵:單一模型家族、單一任務——見下文「本研究未涵蓋的範圍」。請留意研究來源:受測預測模型(EF-8B/EF-32B)是其中一位作者任職公司的第一方模型,協方差探針架構是另一位作者發表的方法;論文並指出,實驗「由 Silico(Goodfire 用於可解釋性研究的代理平台)在人工回饋下自主執行」,再由作者審閱與編修。
強制通過是近乎精確、成本低 50–70 倍的替代測量#
強制作答不只是比較條件,也是一種測量工具。空白 think 前綴下的一次前向傳遞即可直接從 logits 讀出答案分布,並以 r = 0.982 重現抽樣得到的強制答案分布;同時還能呈現 50 次抽樣生成都沒有出現過、完整且合理的候選答案。因此,強制通過不是品質低落的一次性猜測:它能揭露抽樣未充分涵蓋的候選答案分布,生成文字量則比一次推理過程少 50–70 倍。
思維鏈帶來的提升並非候選答案的選擇。強制答案答錯時,正確答案通常根本不在候選分布中——用論文的說法,信心十足的強制錯誤代表「真正的無知」。推理所做的,是調整模型對答案的承諾程度,而這個答案大多在推理開始前就已選定。
內部證據也指向相同結論#
同一篇論文的探針測試——在 EF-8B 上測試 36 個層、三種池化架構,以及七個以推理為錨定的位置——從模型內部得出相同結論。在提示結尾、任何推理 token 出現之前讀取的探針,已能以 AUROC ≈ 0.76 判斷該次生成的最終答案是否正確;部署中的第 21 層協方差探針則在生成後段讀取,在相同測試切分上得分 0.756。答案是否正確的辨識訊號,在推理軌跡開始前就大致形成了。(但原始資料中有個值得坦承的矛盾:附錄 C 的網格指出三種探針家族的辨識能力都會「隨推理深度提升」,因此推理前讀取的是訊號的大部分,而非全部。)
探針本身的完整分析——校準結果與忠實度稽核——見白盒活化監測。
依推理前答案分布的離散程度分流#
如果答案大多在推理前就已決定,實用問題便是哪些問題值得花推理資源處理;強制通過不耗費推理,就能回答這個問題。從空白 think 前綴解碼出最可能的 8 個答案續寫,重新正規化為 p_i,再以 Shannon 熵 H = −Σ p_i ln p_i 衡量分布離散程度(測試切分為 0 到 2.1 nats)。依 H 將測試問題分成三組:
| 類別 | 強制準確率 | 自由推理後 | 提示中含有正確答案 |
|---|---|---|---|
集中(H ≈ 0) | 54% | 56% | 16% |
中等(H ≈ 0.4) | 35% | 39% | 7% |
分散(H ≈ 1.3) | 9% | 13% | 5% |
三種情況,對應三種行動。推理只在中間那組有幫助。 H 低時,模型已答對,推理軌跡幾乎不會改變結果;H 高時,模型答錯而且會維持錯誤——這些問題的提示恰好最不可能包含答案(5%,對比 16%),因此需要的是檢索,而非更多 token。論文的說法是:「推理無法找回提示內容不支持的答案。」
提早承諾閘門。 從一次強制通過取得四種低成本訊號——熵、最高答案機率、前兩名答案的機率差,以及不同答案的數量——以此訓練簡單分類器,並使用單一固定切點:高於切點就立即作答,低於切點則照常推理。在保留問題上,這種方法能節省 30–47% 的生成 token,且準確率沒有可測量的損失(各切分相對完整推理的變化都在約 1 個百分點內,且信賴區間包含零)。表現優於隨機分流,也優於根據模型口述信心設定閘門的做法;後者幫助不大,「因為口述信心反映的是問題有多難,而非推理是否真的會改變答案」。這就是口述信心失效的實際形式:模型說出的數字並不是路由器需要的量。
論文提出了檢索分支,但沒有進行測試:同一個指出「模型正在猜測」的訊號,或許可用來挑選要送去檢索而非進行長篇生成的問題。作者明確表示沒有執行這項實驗。
本研究未涵蓋的範圍#
研究範圍決定了標題結論可以延伸多遠,而這裡的限制格外嚴格。
- 單一模型家族、單一任務。 強制作答與分流實驗只使用 EF-32B(探針另使用 EF-8B),這是以 Qwen3 為基礎、針對此一任務用 RLVR 後訓練的預測模型。沒有前沿模型,也沒有程式設計、代理式任務或數學問題。
- 此任務主要仰賴檢索。 在檢索到的新聞段落提及正確答案時,EF-8B 的準確率為 86–94%;未提及時則為 26–33%(每個切片的 Δ = +57 至 +65 個百分點,所有 bootstrap 信賴區間都不含零)。若任務的答案不是出現在上下文中,就是模型根本不知道,那麼「推理幫助不大」幾乎是必然結果。答案必須推導出來時是否也如此,本研究並未測試——而原本可供測試的數學組實驗,測量的是探針校準,而非強制與自由作答的準確率。
- 絕對準確率偏低。 每次生成的準確率約為 33–37%。以 35% 為基準提高 +1.9 個百分點,和以 90% 為基準提高 +1.9 個百分點,代表的情況不同;本文沒有說明此比例會適用於哪種情況。
- 有一張圖與正文說法不一致。 Figure 8c 的
test長條標示 +3.1 個百分點,但 §4.6 與該圖說明都寫分布內提升 +1.9 個百分點 [+1.0, +2.9]——圖中標示的數值落在此區間之外。本文採用正文中的數值;詳見來源。
延伸閱讀#
- Large-Scale Test-Time Compute——本文在單一任務上檢驗的論點。能力隨預算變化的觀點認為曲線會持續上升;本文則指出,在開放式預測中,第一個推理 token 相較於完全不推理帶來 +1.9 個百分點的提升,而實際問題在於該把資源花在哪些問題上,而非要花多少
- 共享預算運算分配——跨問題版本的對應研究。前者顯示模型無法在 N 個問題間分配單一預算,而是依提示順序花用;此處則顯示模型在花費資源前就已對每個問題作出承諾。強制通過的熵閘門,就是該文指出必須由 harness 提供的外部分配器;它取材自模型會產生、卻不會以文字表達的訊號
- 白盒活化監測——探針結果的詳盡說明。顯示答案在推理前已固定的同一組活化值,也能提供經校準的信心;模型自己的措辭會扭曲這種信心,活化值還能偵測思維鏈是否隱瞞了證據的變化
- Chain-of-Thought Monitorability——從另一端探討忠實度的後果。若大部分答案在推理軌跡出現前就已決定,那麼證據改變時推理軌跡沒有更新,就是預期情況而非異常;證據消融下 23% 的隱性影響率,正是對這項預期的測量
- 信心十足但仍不確定——同一失效模式在路由上的表現:依模型口述信心設閘門,效果不如根據推理前答案分布設閘門,因為口述信心反映問題難度,而非推理會不會改變結果
- 訓練式校準——訓練端的另一種做法。校準可以成為 RL 的目標;本文的補充發現是,凍結模型的活化值中已經有校準過的訊號,只是口頭回報沒有表達出來
- LLM 中的自動與彈性認知——機制上的相近議題,但主張不同。該文透過消融工作區,將自動性定義為在因果上不依賴工作區;本文測量刪除推理軌跡後答案是否改變,是行為測試,完全沒有測量工作區。答案預先決定,是自動運算的候選實例,而非證據
- 不可見推理(填充 token 潛在運算)——相鄰的不可見現象。前者是在語意空洞的填充 token 期間運算;此處則是在提示結尾前就已完成運算。兩者留下的軌跡都不包含實際運算過程,也都指出只有活化值層級的讀取工具能觀測到這些運算
開放問題#
- 若答案必須推導而非檢索,推理前承諾的比例是否仍然成立?本文所有強制與自由作答的數據都來自開放式預測,其中 86–94% 的準確率以提示中已包含正確答案為前提。能解決此問題的實驗正是本文設計後未執行的項目:在自己的分布外數學組(AIME/AMC)使用相同的強制作答前綴,回報強制與自由作答的準確率及眾數答案一致率,而非探針指標。
- 提早承諾閘門是模型的特性,還是任務答案分布的特性?閘門的四個特徵都取自一次強制通過,因此只有在其他領域中推理前答案熵具有相同意義時,閘門才能遷移。一個可推翻此主張的結果是:某個領域中,高推理前熵代表推理確實會修正答案——正好與此處測得的三類分組相反。
- 訓練模型用言語表達內部訊號,是否會消除本文仰賴的落差?強制通過之所以有用,正因口述信心不會回報活化值中包含的資訊。如果探針蒸餾成功(見訓練式校準的開放問題),依口述信心設定閘門就應能匹配熵閘門——這是個成本低、可預先登錄的測試,可用來判斷蒸餾是否真的有效。
資料來源#
- What LLM Forecasters Know but Don't Say: Probing Internal Representations for Calibration and Faithfulness — Raphaël Sarfati*, Pratyush Ranjan Tiwari*, Siddharth Boppana, Christopher J. Earls, Srikar Varadaraj, Eric Ho (Goodfire / Eternis), arXiv 2607.08046, 2026-07-09, 29pp,
empirical。本文採用 §4.6(強制作答前綴、信心相關係數 ρ = 0.90 / 0.87 / 0.78、眾數答案一致率 67% / 64% / 56%、r = 0.982 的 logits 讀取及 50 次生成的候選答案差距、50–70 倍成本比)、Figure 8b–c(固定<answer>位置時,67% 問題的答案分布變得更集中;強制作答錯誤問題中有 4% 得到修正、72% 鎖定原錯誤答案;各切分的準確率變化)、§4.7 + Figure 9(熵的定義與 0–2.1 nat 範圍、三類分組表、答案包含率、四特徵的提早承諾閘門及其 30–47% token 節省、勝過口述信心閘門,以及未測試的檢索分支)、§4.1.2(答案包含率,86–94% 對 26–33%)、§4.2.1(提示結尾 AUROC ≈ 0.76 的讀取值及第 19–24 層集中情況),以及 Appendix C(「辨識能力會隨推理深度提升」的網格說明,即上文提及的矛盾)。 - 研究來源與利益衝突,因為這並非無關緊要而特別說明。 EF-8B/EF-32B 是 Eternis 自有的預測模型,六位作者中有兩位來自 Eternis;協方差池化是 Goodfire Research 自有的方法(Dooms、Wang 與 Pearce,2026),另外四位作者則來自 Goodfire。論文也披露,實驗「由 Silico(Goodfire 用於可解釋性研究的代理平台)在人工回饋下自主執行」,其設計、發現、報告、腳本與圖表都經作者審閱及編修——這是一項使用作者自有模型、並採用作者自有測量工具的代理執行研究。本文沒有對任何一方採取對抗立場。論文呈報的自我不利結果(DCPO ECE 列、GLM-4.7-Flash 排名區間跨越零,以及未測試的檢索分支)是本研究維持
empirical等級的原因。 - 內部不一致之處,照實記錄而不加以裁定。 Figure 8c 的
test長條標示+3.1pp(強制作答約 32.8%,自由作答約 35.9%,依兩階段規則從image_000025讀取),但 §4.6 正文與 Figure 8 圖說都將分布內提升列為 +1.9 pp,95% CI [+1.0, +2.9]——圖示數值落在此區間之外。2026Q1(+1.9pp)和Late2025(+0.9pp,不顯著)的標示都與圖說完全一致,因此衝突只限於其中一個面板的一根長條。本文引用正文與圖說的數值,並指出圖中的矛盾;此處沒有任何結論依賴這個差異。 - 表格解析備註——源自 PDF(docling 2.126.0 / docling-mlx 0.1.1,29pp、7 個表格、47 張圖片,
confidence_grade: excellent),匯入判定為warn。 原始資料中的 Table 2(§4.4 分布外數學)已標記為已知格式錯亂——docling 將兩個模型列合併成一列,因此解析結果中每個值的歸屬都不正確。該表在編譯時以pdftotext -layout -f 12 -l 12重新建構;復原的網格有兩列(Untrained Qwen3-8B / plain / L18 / r100 / last-tok與DCPO-recipe Qwen3-8B / verbal / L21 / r100 / last-tok),且每個儲存格都與 §4.4 正文吻合。本文沒有引用該表;復原值用於白盒活化監測。Table 1(僅 GLM 探針)解析正常——逐格與pdftotext -layout -f 10 -l 10比對後,兩列的八個數值都正確且欄位順序無誤。目錄區塊嚴重錯接(前兩欄的章節標題重複,頁碼落入相鄰列),只供導覽使用,本文沒有引用。Table 3(資料集範例)是跨三頁延續、以文字填入網格的表格,另有兩個真值被拆到獨立的## Ground truth區塊(Jan Breydel Stadium、33);該表沒有測量值,也沒有被引用。沒有 en-dash 損壞、沒有合併的數值範圍,也沒有在正文中把AI解析成Al。 - 圖片:47 張中開啟檢視 4 張——
image_000021(Figure 6:消融散佈圖及其 ρ = 0.215 方框與雜訊底限;注入 2×2 表格的四格分別為 81.2% / n=397、2.5% / n=12、14.7% / n=72、1.6% / n=8,總計符合文中所述的 489 個問題)、image_000023(Figure 7:隱性影響與其他影響的圖例為 119 / 1,673 = 1,792,以及 n=107 時 0.065 對 0.088 的配對對比)、image_000025(Figure 8,發現上述 +3.1 個百分點的差異)、image_000027(Figure 9,重現三類分組長條圖,顯示熵閘門生成約 750 個 token 就達到完整推理的準確率,而一律推理則約需 1,300 個 token)。其餘圖片是裝飾性頁面元素——同一個雜湊值(image_...e002866c)重複 20 次——或是文中已列出數值的可靠度/熱度圖面板。
Cited by 10
- Confident But Unsure×3
Pre Reasoning Commitment — the same split measured one layer down and earlier than the answer: a…
- Chain-of-Thought Monitorability×3
Pre Reasoning Commitment — the mundane mechanism under one instance of unfaithfulness, and a reason…
- Large-Scale Test-Time Compute×3
Pre Reasoning Commitment — the floor under the curve, and the allocator the axis above says the…
- White-Box Activation Monitoring×3
Pre Reasoning Commitment — the capability reading of this page's own probe sweep. A probe read at…
- Automatic vs. Flexible Cognition in LLMs×2
Pre Reasoning Commitment — a third invisibility, and a third definition to keep apart. An empty…
- Invisible Reasoning (Filler-Token Latent Computation)×2
llm forecasters know but dont say — Sarfati, Tiwari, Boppana, Earls, Varadaraj & Ho (Goodfire /…
- Open Questions Backlog×2
Pre Reasoning Commitment ×2 (oldest 6d) — Does the pre-commitment ratio survive on tasks where the…
- Shared-Budget Compute Allocation×2
Pre Reasoning Commitment — the within-question twin, and the allocator this page says has to come…
- Model Capability & Training
Pre Reasoning Commitment — Sarfati et al.'s forced-answer measurement on an 8B/32B RLVR forecaster:…
- Trained Calibration
Pre Reasoning Commitment — the consequence for routing. A gate on the model's stated confidence…
Related articles
- Reward Hacking
The model optimizing the measured proxy (a reward signal, a metric, a grader's judgment, a tool's output) rather than t…
- Chain-of-Thought Monitorability
Korbak et al. 2025: chain-of-thought traces are a fragile monitor; direct CoT training compromises faithfulness; MSM of…
- Large-Scale Test-Time Compute
Noam Brown's thesis that model capability is now a function of inference budget (tokens/cost/time): with good scaffoldi…
- Claude Opus 5
Anthropic's Opus-class release of July 2026; matches Mythos 5 on capability without advancing the frontier, is the best…
- Invisible Reasoning (Filler-Token Latent Computation)
Consequential computation inside the forward pass that leaves no interpretable trace in the output tokens: 13 frontier…
