H
Howardism
Plate IIModel Capability & Training機器翻譯 · machine-translated過時翻譯 · stale translationENHOWARDISM

訓練式校準

TML 將校準訓練為首要 RL 目標的方法: 在已揭曉答案的真實世界問題上採用適當評分規則;在答案可能正確時才給予回報、並納入棄答考量的 QA 獎勵;以及由評分規準加主張組成的雙重評分器,其透過網路搜尋的主張驗證器可抵銷評分規準式的事實噴灑——最後以預測基準(ForecastBench、Prophet Arena)作為評估

Article metadata
Publication details
Published:July 22, 2026
Filed:Concept
Domain:Model Capability & Training
Tags:Post TrainingCalibrationHonestyReward Design
Reading:27 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

訓練式校準插圖

資料來源#

摘要#

校準——包括對尚未定案的問題也表達恰當的信心水準——在此被視為具有專屬獎勵設計的訓練目標,而非規模擴大的副產品或憲章中的一句原則。具體做法是 TML 為 Inkling 建立的「認知論」組合(2026 年 7 月,vendor-claim);這是本 wiki 首篇完整說明校準如何受訓的發布內容:

  1. 以適當評分規則進行 RL,訓練資料是一大批答案已揭曉的真實世界問題——直接把預測理論中的工具帶進獎勵函數:當誠實回報機率能使預期獎勵最大化時,該評分規則便是適當的。
  2. 納入棄答考量的短答 QA 獎勵:只有在模型可能答對時作答才有回報,因此最佳策略是在有把握時回答,否則說「我不知道」或保留語氣。有些提示會鼓勵或禁止保留語氣,讓使用者能控制偏好強制作答或校準式不作答——校準不等於養成動不動就保留的習慣。
  3. 長篇指令遵循採用雙重評分器:以評分規準評分器(列出良好答案應包含內容的檢核表)搭配主張評分器;後者會擷取每項事實主張,並透過代理式網路搜尋查證,懲罰未獲驗證的主張。

雙評分器設計是對獎勵駭客行為的修補#

TML 直接點出失敗模式:評分規準「強調召回率,模型可以大量噴灑看似相關的事實,期待碰上評分項目來鑽漏洞」。這就是指令遵循獎勵管道中的 Reward Hacking——對檢核表進行 Goodhart 化。主張評分器則施加反向壓力:每個噴出的事實都成了負擔,因為無法驗證的主張會逐項受罰。TML 主張,兩者搭配能同時提升助益並減少幻覺;單獨使用任一評分器,都得在其中一項上有所取捨。

主張評分器也直接回應了 Reference-Free Judge Over-Crediting:它不會依賴評分模型自身知識判斷事實性——這正是無參照 LLM-as-a-Judge 評估會過度肯定流暢錯誤答案的情況——而是以檢索到的證據為每項查證提供依據。過度肯定的結果預示,只靠知識的主張評分器會獎勵自信的捏造;把搜尋放進獎勵迴圈,就是該結果所暗示的緩解方式,並從評估時移到訓練時。

預測作為最終評估#

若校準是以答案已揭曉的問題訓練,預測基準便是自然的考試:整合互相衝突的來源並給出機率,再以 Brier 類型規則評分;過度自信和信心不足會受到對稱懲罰。TML 報告,Inkling 在 ForecastBench Brier Index(不使用搜尋)得分 61.1——與 Gemini 3.1 Pro(61.1)和 Grok 4.3(61.7)相當,高於 GPT-5.5(59.1),也遠高於 Claude Opus 4.8(54.6)——在 Prophet Arena 上則得分 0.1617,與封閉前沿模型的差距在雜訊範圍內。這些全是 vendor-claim,使用預發布檢查點,測試期間為 2026 年 6 月 30 日至 7 月 13 日。若照字面解讀,最引人注目的不是勝出,而是同等水準:一個 41B 活躍參數的開放模型在校準上比肩封閉前沿模型,但在困難推理上落後許多(HLE 29.7 對 44–53),這暗示校準相較於能力而言成本低廉——它更取決於獎勵設計,而非規模。

基準營運方自己的報告內容(2026-07)#

上述考試如今有了第一手資料來源,而它改變了基準分數的意義。ForecastBench 的營運方(Forecasting Research Institute,2026-07-16,empirical)報告,幾個競賽參賽系統的分數與超級預測者中位數在統計上無法區分,其中一個在市場問題上高於中位數。這對本文有三個啟示。

廠商分數與排行榜分數不是同一種測量。 TML 的數據是不使用搜尋的裸模型,直接依據權重作答。競賽排行榜「旨在呈現 LLM 預測能力的前沿,因此參賽者可以使用工具、額外脈絡、微調、集成或其他方法」——排名最高的系統則是多階段管線:產生子問題與搜尋查詢、擷取最新脈絡、篩選相關性與時效性、集成多個模型,最後再讓另一個模型分析推理過程。**這項基準的前沿是系統校準,而非模型校準。**任何「模型 X 位居預測前沿」之類的說法,都得交代指的是哪一種;TML 的表格與這份排行榜分處這條界線的兩側。

它補上了廠商表格欠缺的人類基準。 超級預測者中位數在資料集問題上為 63.7(N=521),市場問題上為 75.9(N=56)。TML 引述的分數(Inkling 61.1、Gemini 3.1 Pro 61.1、Grok 4.3 61.7、GPT-5.5 59.1、Opus 4.8 54.6)都低於資料集分數——前提是兩者使用相同指標,但兩份來源都無法確認:TML 稱其為「Brier Index」,排行榜欄位僅標示「Dataset / Market / Overall (N)」。這個分數區間只能作為參考,不能據此排名。

而訓練目標與指標屬於同一系列。 在答案已揭曉的真實世界問題上,以適當評分規則進行 RL,從結構上看就是針對 ForecastBench 所測量的事物進行訓練——因此「有利的考場」確實值得關注,而非只是修辭;也因此前述管線結果很有意思:頂尖參賽系統是靠檢索與集成達標,而不是靠 RL 訓練去追求評分規則。

配方背後的機制,以及它對本文方法究竟說了什麼、沒說什麼(2026-08)#

上面的做法是設計描述;Che, Yuan, Zhao & Yu(arXiv 2608.00301,2026-07-31,empirical)則提供其設計空間的訓練動態理論,包括證明、衰減定律,以及在 1.5B/7B 上實際執行的 RL 實驗。他們發現,錯誤懲罰式棄答獎勵——答對 +1、答錯 −λ、棄答 0;其理性最優點為 Chow 閾值 t* = λ/(1+λ)——可能讓採用 KL 錨定的梯度學習器拒絕所有問題,但記錄到的平均獎勵仍以 1/t 上升。原因是當棄答是離散動作時,獎勵梯度與 KL 錨點的恢復力具有相同的飽和因子 σ′(v),並會一同消失。完整機制、條件、估計器分析與修補見 Error-Penalized Abstention Training。這對本文有三個啟示,但它們的方向並不一致。

論文提出的修補方式正是這套做法的第 1 項。 對抗崩潰的修正方法是:每題都必須回答,以嚴格適當評分訓練強制信心回報,只在部署時設閾值——因為回報管道沒有會飽和的閘門,所以不存在能同時扼殺獎勵梯度與錨點的共同因子;而且其校準最優點位於內部,並具有吸引力(命題 8)。這在結構上就是 TML 的適當評分規則 RL。論文將 Damani et al. (2025) 列為最接近的已發表研究,並補上「缺失的另一半」,解釋此方法為何有效。因此,對這項來源最有力的解讀不是批評這套做法,而是獨立推導出這套做法的連續回報部分為何是正確的管道,也是這批資料中首個機制性論證,說明在回報上採用適當評分規則的 RL,比以獎勵塑造棄答決策更安全。

這套做法的已公開描述,有兩項條件無法讓我們查核。 崩潰必須同時具備三個條件:(B1) 在訓練混合資料中,無差別作答的預期得分較低;有一個共用且有界的讀出層,能把這種損失傳遞到有利可圖的提示;而且棄答是離散動作。TML 的第 2 項說模型應「有把握時作答,否則說『我不知道』或保留語氣」——這是沒有指定決策位置的自由格式拒答,恰好是論文標示為尚未測試的情況:所有實際觀察到的崩潰案例,都在模型自己的詞彙表中設置二元首 token 閘門;定理 2 已證明的案例也排除了自由格式拒答可能採用的一般共用解碼器形式。同樣地,(B1) 是 TML 未公開訓練混合資料集的特性,而論文指出,經過篩選或加入檢索資料的資料集「合理而言可能違反」這一條件。因此,這篇論文沒有證明、也沒有聲稱 TML 的做法會崩潰。 它證明的是棄答獎勵的管道幾何至關重要,而 TML 的發布內容沒有交代兩個足以判斷的事實(決策位置設計、無差別作答時混合資料的得分)。

有兩項結果適用範圍明確,而且都關於 TML 未說明的部分。 第一,權重並非可任意設定(命題 9):以 α·1{correct} + Brier 評分時,純粹的適當性(α = 0)會讓校準準確率梯度在每個 q < 1/2 時都小於零(2q − 1 < 0),因此模型能藉由降低困難提示的準確率並誠實回報這種退步而提高分數——而這些正是損失條件所挑出的提示。任何 α > 1 都能修正;α = 1 則在零點留下退化穩態。TML 沒有公開其評分規則管道與正確性管道的相對權重;這代表兩者的排序關係是正確性的必要條件,而非調參旋鈕。第二,適當性並非實際起作用的變數(註 1):若把嚴格適當的 Brier 訊號在 t* 以下截斷,死區就會回來,部署效用會弱幅下降,儘管規則仍然適當。關鍵在於訓練訊號是否存在可達到、且梯度恆為零的區域——這也重新界定下文的雙評分器討論,因為論文把自身對適當性的主張限制在程式化評分上:若 LLM judge 以 ν 的機率給予保留措辭的文字肯定,適當性便會劣化 O(ν)。評分規準加主張的評分器正是這類評分器,而 ν 在任何地方都未經測量。評分器默默肯定的保留措辭,正是這套做法的適當評分規則可能失效的具體途徑。

所有這些結果都要放在規模落差下衡量:實驗採用 1.5B 和 7B Qwen2.5,在 TriviaQA 和 PopQA 上測試;本文所述數據則來自 41B 活躍參數模型,而且研究並未觸及長篇或代理式情境。

第三條路:校準讀出層,而非模型(2026 年 7 月)#

以上做法都是訓練模型的文字達到校準——對明確說出的機率採用適當評分規則,或對明確表達的拒答採用棄答考量獎勵。Sarfati, Tiwari, Boppana, Earls, Varadaraj & Ho(Goodfire / Eternis,arXiv 2607.08046,2026-07-09,empirical)展示了另一種方法:保持權重不變,只在凍結的活化值上擬合一個小型線性讀出層。它的成本比本文兩種方法都低好幾個數量級,而依本文所列證據,其校準效果也優於這兩種方法的產出。

凍結模型上的數據。 只在約 11,800 次改善脈絡的預測軌跡上訓練探針權重(3,945 題 × 3 次補全),並在 2,960 次保留測試軌跡上報告結果,完全未做任何重新校準——沒有溫度、Platt 或 isotonic scaling:

模型探針探針 ECE文字表達 ECE
GLM-4.7-Flashmean-pool L280.0540.287
GLM-4.5-Airattention-1 L180.1020.255

預期校準誤差分別降低五倍與兩倍,而且所用讀出層從未觸碰模型。排名提升幅度較小,作者也如此說明:GLM-4.7-Flash 在控制資料洩漏後的 ΔAUROC 為 +0.055,95% CI 為 [−0.006, 0.111],因此穩健的主張僅限於校準;只有 GLM-4.5-Air(+0.110 [0.069, 0.149])的結果高於零。

這項研究改變了上方配方的三個面向。

  • 訊號早已存在;出問題的是回報。 在經 RLVR 訓練的預測模型(EF-8B)上,探針與模型自己表達的機率作為排序器無法區分(AUROC 0.756 對 0.758),差異只在校準(ECE 0.044 對 0.093)。模型知道哪些答案可能正確;但它用文字表達的數字沒有傳遞這項資訊。作者的說法一針見血:「過度自信與其說是自我認知失敗,不如說是自我回報失敗。」 這讓本文第 1 項的訓練目標重新定位——對明確表達的機率使用適當評分規則,訓練的是一個管道,而不是創造資訊。
  • 針對任務的 RLVR 無法修好這個管道。 EF-8B 專為預測任務進行後訓練,仍持續過度自信:在十種取樣溫度下,準確率維持在 37 ± 1%,但平均自述信心約為 50%,ECE 為 0.110–0.150,幾乎不受溫度影響。校準不會成為任務專用 RL 的副產品。
  • 訓練時校準配方與探針不可互換。 唯一一次與校準訓練模型的直接比較,結果明確分歧。研究者在 Qwen3-8B 上重現 Ma et al. 的 DCPO(在 RLVR 下分離推理與信心 token),並以合併的 OOD 數學題評估(AIME24/25 + AMC23/24,n = 580):凍結探針的區辨能力較佳(AUROC 0.929,整體回應 token-logprob 信心為 0.865);但經 isotonic 重新校準的文字表達信心,作為點估計校準器則較佳(ECE 0.125,探針為 0.143)。在未訓練的基礎模型上,探針在兩方面都勝出(0.894 對 0.752;ECE 0.083 對 0.270)。因此,選擇配方或讀出層,要看目標是排序還是點估計校準;作者也指出,DCPO 探針的訓練資料與 RLVR 訓練分布透過 DeepScaleR 重疊,因此不能將此結果解讀為訓練分布不變的表徵。

部署上的影響,以及必要前提。 探針能在每個生成軌跡深度提供信心估計,包括尚未承諾答案的推理中途,而且不耗用生成 token——本文的配方則是靠模型必須輸出、使用者必須相信的明確機率,來換取校準。前提是能白箱存取:這項技術只適用於你持有權重的模型;White-Box Activation Monitoring 也記錄了同樣的不對稱性。它也不能取代棄答那一半的功能——探針評分正確性,但不會決定是否作答。

第四條路:讓校準成為唯一目標(TypeSafe,2026 年 9 月)#

上述每一種做法,都是在主要工作為產生文字的模型上加入校準。TypeSafe AI 的 Jev(發布文章,2026-09-15,vendor-claim)拿掉文字:這是一個非自回歸決策模型,輸出為由 schema 宣告的布林值、分數與選項,每項結果都附有機率;其訓練目標是 TypeSafe 所稱的校準式決策 RL(RLCD)——以「具備認知誠實機率的答案」作為完整最佳化目標,並與 RLHF(評分者偏好的文字)及 RLVR(可查核的輸出)相對照。從結構上看,這就是 Error-Penalized Abstention Training 建議的做法走到盡頭:每個輸出都必須回報信心,沒有棄答動作可形成閘門,閾值留給呼叫端的程式碼設定(廠商自家的安全分類工作流程在 P > 0.75 時採取行動,並將 0.15–0.60 的灰色區域交由人工處理)。它也避開了上方探針結果揭示的文字表達落差,因為機率是輸出層的結果,而非模型陳述的數字。

缺少的是任何校準測量。沒有發布可靠度圖、ECE 或 Brier 分數——工作流程評估衡量的是與雙 LLM 參考答案的一致程度,而非校準——也沒有提供演算法細節。唯一一個獨立數據點對其不利:在 Typed Decision Verifiers 記錄的共用答案驗證榜單上,Jev 得分最低的 20% 中,已有 54% 是原本就正確的答案,以此建立的重試閘門淨效果為 −0.07pp,儘管 AUC 並列最佳。這衡量的是閾值下的排序,而非校準本身;而且任務也不是 Jev 宣稱的用途。應將 RLCD 視為一個已命名的目標,目前還沒有公開證據證明它能達成目標。

部署進度已超前於證據。第一批合作夥伴帳戶(LangChain 的 Jev 文章,2026-09-25,vendor-claim)已把機率接進控制流程,作為路由閾值:Browserbase 的 Stagehand 會把任何低於 0.7 信心的瀏覽器操作決策送交 LLM;LangSmith 則提供將輸出標示為「已校準」的追蹤檢視。固定閾值的可靠度取決於背後的校準:若 0.7 並不代表約有 70% 機率答對,這個閾值便會放過自信的錯誤而不升級處理,後續流程也不會察覺。同一篇文章聲稱的另一項特性——分數「在 100 次重複執行中幾乎沒有變動」——講的是一致性;一致性是校準的必要條件,但並不代表校準。

與誠實即對齊的關係#

Agentic Honesty & Diligence 從行為稽核角度追蹤相同目標:Anthropic 的過度自信評估(承認不懂未見過的 CLI 工具;指出同事範例有誤)測量校準是否反映在代理式行為上,而 Opus 4.8 的憲章則將「校準」列為誠實的一部分。本文是訓練迴圈的補充觀點:稽核角度問的是模型行為是否經過校準,TML 的做法則說明哪種梯度會產生這種行為。兩種觀點交會於一個尷尬的數據點——憲章要求校準的模型,在 TML 的預測表格中,分數是受比較的前沿模型裡最低的——但競爭者拿對手的檢查點做基準測試,是證明這種差距最薄弱的證據。

相關連結#

  • User Awareness——這套做法無法控制的輸入。自我估計經過訓練後,效果仍取決於它所具備的不變性;模型對自己能否解出困難問題的自述機率,會隨著它認為是誰在提問而改變——群體層級差 1.5pp,最強身分造成 2.81 個人口標準差——即使它根本不打算回答問題
  • Confident But Unsure——這套做法瞄準的失敗模式及其真實世界測量:Opus 5 會說出自身推理無法支持的答案;隨著棄答率下降,準確率提高 11%,幻覺也增加 6%
  • White-Box Activation Monitoring——本文所有獎勵方法在讀出層面的替代方案:凍結活化值上的線性讀出層,不更新權重;兩個凍結 GLM 模型的 ECE 分別從 0.287 → 0.054 和 0.255 → 0.102;而且在尚未承諾答案前的推理中途,就能取得信心估計。它不用訓練本文必須訓練的管道便能校準,代價是需要白箱存取
  • Pre-Reasoning Commitment——對路由的影響。依模型自述信心設閘門,表現不如依其推理前答案分布的擴散程度設閘門,「因為自述信心反映的是問題有多難,而非推理是否真的會改變答案」——這是明確的校準失敗,代價是 token 而非信任
  • Inkling——採用這套做法推出的模型
  • Reward Hacking——以評分規準噴灑事實,是文中點名的案例;主張評分器施加反向壓力
  • Reference-Free Judge Over-Crediting——說明主張評分器為何必須搜尋,而不能依賴參數知識
  • LLM-as-a-Judge——兩個評分器都是獎勵迴圈中的評審;這是 Goodhart 對抗壓力下的評審設計
  • Agentic Honesty & Diligence——相同目標的行為稽核觀點;校準是憲章中的構面,或是獎勵函數
  • Thinking Machines Lab——該實驗室;與其在 Tinker 上進行的預測微調工作相關
  • Measuring Beyond Accuracy Saturation——將 ForecastBench 視為測量工具,而非排行榜:它能防資料污染且分數不會飽和,但在人類參照組中卻逐漸失去區辨力,而其標題比較正是以該參照組為基礎
  • Introspective Coupling——本 wiki 中另一項經訓練的後設認知回報:訓練解釋而非訓練校準,能遷移至從未受過標註的行為,但也付出相當程度的一般能力代價(TruthfulQA −6.7pp,GSM8K 約 −5pp)
  • Error-Penalized Abstention Training——這套做法所處設計空間的訓練動態理論:為何連續回報上的適當分數是結構上安全的管道,而設閘門的棄答動作不是;也說明這套做法的發布內容未交代的兩項條件(決策位置設計、無差別作答時混合資料的得分)
  • Reasoning–Acting Interleaving (ReAct)——替代方法的樣貌。2025 年底有人問代理應如何判斷何時搜尋,CS329A 第 4 堂課將校準視為尚不可用的能力(「仍在解決中的研究問題」),並以無條件使用工具繞過它;本文介紹的做法則讓閘門得以實作
  • Retrieval Inside the Reasoning Chain——記錄 2025 年底教學等級版本的相關構想。當時有人問輸出機率是否能反映正確性,CS329A 第 7 堂課指出模型過度自信,並指向這個分支,卻未附引用:第二輪信心估計,以及以 RL 或 RLHF 讓模型不要「輸出自己信心低的答案」
  • Typed Decision Verifiers——校準就是產品的類別:Jev 的 RLCD 讓校準機率成為完整輸出,而此類別唯一的獨立榜單,是測量其閘門精確率的唯一地方

尚待解答的問題#

  • 對短答 QA使用納入棄答考量的訓練,能否遷移到經過校準的長篇回答與代理式自我回報(也就是 Agentic Honesty & Diligence 顯示過度自信確實會造成影響的情境)?部分解答(2026-08-12)——改變的是問題,而不是答案。 Che, Yuan, Zhao & Yu 指出,「納入棄答考量的訓練」並非單一事物:塑造連續信心回報的獎勵,與塑造離散棄答動作的獎勵,具有不同的梯度幾何;只有後者存在可達到的零梯度區域,獎勵訊號與 KL 錨點會在此一同消失。因此,遷移必須按管道分別提問;像本文這樣混合兩者的做法,可能一半能遷移,另一半則失敗。尚未解答的是:論文的實際證據只涵蓋 TriviaQA 和 PopQA 上的 1.5B/7B Qwen2.5,訓練混合資料是刻意設計成無差別作答會失分;沒有長篇、代理式、多輪情境,而其自身的回報管道是透過提示狀態上的線性探針讀出,並非透過模型文字;文字表達管道也明確尚未測試。這項研究提供了短答結果可能無法延伸的機制,卻未測試任何遷移情境。要定案的實驗形式不變,但現在必須加入一項對照:在長篇回答或代理式自我回報上執行相同目標,並回報棄答是否由指定決策位置設閘門,或是自由格式輸出。

  • 主張評分器透過代理式網路搜尋查證——搜尋索引的涵蓋範圍、時效性與偏誤都會進入獎勵訊號。對索引錯誤定論或完全沒有定論的事實,模型會學會提出什麼主張?

  • 若 41B 活躍參數模型能達到校準同等水準,推理能力卻不行,是否代表封閉前沿模型(Opus 4.8 的 54.6)系統性地訓練不足以校準;或者 TML 的預測表格只是有利於採用適當評分規則訓練的模型?部分解答(2026-08-12)——這個二分法漏掉了第三種可能。 ForecastBench 的營運方 顯示,基準前沿由有腳手架的管線(檢索 + 篩選 + 集成)領先,而非依據權重作答的裸模型;競賽規則也允許這些方法。因此,廠商提供的無搜尋表格與公開排行榜測量的是不同事物,而 Inkling 與 Opus 4.8 的差距,是在前沿早已超越之處進行的裸模型比較。某個特定意義上的有利考場確實成立——訓練目標與衡量指標屬於相同的適當評分規則系列——但訓練不足的問題仍未觸及,因為沒有任何前沿實驗室依明確規範提交裸模型。如今可明確提出定案實驗:讓相同封閉模型在搜尋關閉與開啟時執行 ForecastBench 問題集,再與管線參賽系統比較差異。再獲部分解答(2026-09-23),涵蓋訓練不足問題,但僅限開放模型。 Sarfati et al. 直接測量三個凍結、非 TML 模型的文字表達校準,發現三者都很差——在保留的預測軌跡上,預期校準誤差分別為 0.287(GLM-4.7-Flash)和 0.255(GLM-4.5-Air);一個經 RLVR 後訓練、專為預測任務打造的 8B 模型則為 0.110–0.150,在各種取樣溫度下,自述信心約 50%,準確率卻僅 37%。在相同凍結活化值上訓練的線性探針達到 0.054 / 0.102 / 0.044,因此這些模型未能說出的資訊,存在於它們自身的殘差流中。這支持訓練不足,而非有利考場的解釋:差距源自回報失敗,而非訊號不存在;針對任務的 RLVR 也無法補上差距。研究尚未觸及的部分:沒有測量封閉前沿模型、沒有執行 ForecastBench,而且使用的是不同問題集上的 ECE,而非 Brier Index,因此無法為本文表格中的任何模型定位。

  • 若將探針訊號蒸餾到明確表達的機率中——訓練模型說出其活化值已承載的信心——內部訊號能否在訓練後保留下來,還是最佳化回報會損害探針所讀取的表徵?Sarfati et al. 指出這兩個環節都是自然的後續步驟,但兩者都尚未執行。這項假說很容易被證偽:在蒸餾後重新擬合同一探針,再比較它在相同保留軌跡上的 AUROC 與 ECE 是否優於蒸餾前的讀出層。

資料來源#

  • User awareness in frontier models — Zhong, Raghunathan, Laidlaw & Steinhardt,Transluce,2026-08-06(empirical):訓練出的自我估計仍受其無法控制的輸入影響:模型對自己能否解出困難問題的自述機率,會隨其認為是誰在提問而變動(群體 −1.5pp,最強身分 −2.81 個人口標準差)。完整討論見 User Awareness

  • Inkling: Our Open-Weights Model — 「認知論」章節(vendor-claim):適當評分規則 RL、納入棄答考量的獎勵、評分規準加主張的雙重評分器、ForecastBench / Prophet Arena 表格

  • Abstention as an Action Can Kill Both the Reward Gradient and the KL Anchor: Collapse Law and Repair for Error-Penalized Reinforcement Learning — Che, Yuan, Zhao & Yu(UNC Charlotte / George Mason / Auburn / North Texas),arXiv 2608.00301,v1 2026-07-31,empirical:這套做法之設計空間的訓練動態理論。§2–3(三項共同崩潰條件與共用節流恆等式)、§4 命題 8–9 與註 1(說明以適當評分規則訓練強制回報為安全管道、正確性權重為何必須嚴格大於適當性權重,以及適當性本身為何不是起作用的變數)、§7 限制(未測試自由格式拒答與文字表達管道;O(ν) 的 LLM 評審劣化將所有適當性主張限於程式化評分)。此來源從未檢視 TML 已發表的做法——上文的遷移分析屬於本 wiki 的分析,並已明確標示。完整討論與解析註記見 Error-Penalized Abstention Training

  • What LLM Forecasters Know but Don't Say: Probing Internal Representations for Calibration and Faithfulness — Sarfati, Tiwari, Boppana, Earls, Varadaraj & Ho(Goodfire / Eternis),arXiv 2607.08046,2026-07-09,empirical。本文採用 §4.1.1 + 附錄 B(EF-8B 的溫度掃描:準確率 37 ± 1%,自述信心約 50%,ECE 0.110–0.150,Brier 0.19–0.21,幾乎不受溫度影響)、§4.2.2 + 圖 1(探針與文字表達信心的 AUROC 分別為 0.756 / 0.758,ECE 分別為 0.044 / 0.093,N = 3,020 次生成軌跡)、§4.3 + 附錄 D + 表 1(僅用凍結 GLM 探針的實驗組、未重新校準的聲明,以及控制資料洩漏後的 ΔAUROC 區間)、§4.4 + 附錄 E + 表 2(合併 OOD 數學題上與 DCPO 的直接比較,n = 580),以及 §5(自我認知與自我回報的區別,以及探針蒸餾提案)。COI:預測模型屬於一位作者群,探針架構則屬於另一群;實驗由 Goodfire 的代理式研究平台執行,並由作者審核。解析註記:匯入結果為 warn;表 2 原先確實遭 docling 將列合併,編譯時依 pdftotext -layout -f 12 -l 12 重建——此處引用的四項 OOD 數學數值已復原,且 §4.4 正文也獨立列出。表 1 已逐儲存格與第 10 頁核對,內容正確。完整討論見 White-Box Activation Monitoring

  • AI models have likely reached parity with superforecasters on ForecastBench — Forecasting Research Institute(Substack,2026-07-16,empirical):競賽排行榜明確允許使用工具、脈絡、微調與集成;Cassi 的管線描述;超級預測者中位數在資料集問題(63.7,N=521)和市場問題(75.9,N=56)的分數;以及 2024 年基準的注意事項。排行榜為 PNG 螢幕截圖,依圖片二次檢視規則放大重讀;文章內文從未命名該指標,因此本文未主張跨來源的分數排名

  • Introducing System One Models & Jev — Diogo Almeida,TypeSafe AI,2026-09-15,vendor-claim:提出 RLCD 名稱並與 RLHF / RLVR 對照;宣稱具備校準與一致性,但未經測量。完整討論見 Typed Decision Verifiers

  • Building Prod with Jev and LangGraph — Sydney Runkle & Hunter Lovell,LangChain 部落格,2026-09-25,vendor-claim(Jev 整合合作夥伴):Browserbase 的 Stagehand 在信心低於 0.7 時使用備援、LangSmith 的「已校準輸出」檢視,以及 100 次執行一致性的主張。未提供校準測量

§ end
Cited by 22
  • Open Questions Backlog×3

    Trained Calibration ×2 (oldest 75d) — The claims grader verifies via agentic web search — importing…

  • Confident But Unsure×2

    The reading that transfers: training the stated probability is repairing a channel, not supplying…

  • Inkling×2

    Calibration: ForecastBench Brier Index 61.1 (no search) — level with Gemini 3.1 Pro, above GPT-5.5…

  • Pre-Reasoning Commitment×2

    Trained Calibration — the training-side alternative. Calibration can be an RL target; this source's…

  • Reasoning–Acting Interleaving (ReAct)×2

    Does the model know what it knows? A student presses on when to search at all — you would not…

  • Thinking Machines Lab×2

    Tinker — the hosted fine-tuning platform Inkling launches on (64K/256K context, day-0 serving…

  • Verbalized-Confidence Soft Scoring for LLM Judges×2

    Trained Calibration — the training-side routes to a calibrated report; this is the zero-training,…

  • Aakanksha Chowdhery

    Grounding is the workaround for bad calibration, not a solution to it. Pressed on how a model…

  • Agentic Honesty & Diligence

    Trained Calibration — the training-loop view of the same target: TML's recipe (proper scoring…

  • Diversity Calibration Under SFT

    Trained Calibration — the other sense of "calibration" in this wiki (confidence tracks correctness,…

  • Error-Penalized Abstention Training

    Trained Calibration — the reward-design family this is a mechanism-level result about. Its…

  • Introspective Coupling

    Trained Calibration — the sibling case of a metacognitive report trained as a first-class target;…

  • Jev

    Trained Calibration — RLCD is a vendor-named fourth route to trained calibration: calibration as…

  • LLM-as-a-Judge

    Trained Calibration — judges inside the RL reward loop: a rubric grader paired with a web-searching…

  • Measuring Beyond Accuracy Saturation

    Trained Calibration — the training-side counterpart: proper-scoring-rule RL aimed at exactly this…

  • Model Capability & Training

    Trained Calibration — TML's recipe for making calibration a first-class RL target: proper scoring…

  • Reference-Free Judge Over-Crediting

    Trained Calibration — the mitigation shape deployed in a training loop: TML's claims grader…

  • Retrieval Inside the Reasoning Chain

    Trained Calibration — the other branch the lecture gestures at without a citation: RL/RLHF aimed at…

  • Reward Hacking

    Trained Calibration — a named instance in the reward-design wild: rubric graders "can be hacked by…

  • Typed Decision Verifiers

    Trained Calibration — RLCD is a vendor-named route to calibration as the whole training objective…

  • User Awareness

    Trained Calibration — the same problem for anyone training calibration as a target: the self-report…

  • White-Box Activation Monitoring

    Trained Calibration — the other route to the same quantity. Calibration can be an RL target on the…

Related articles
  • Confident But Unsure

    The model states a final answer its own reasoning cannot support — presenting an educated guess as analysis, or silentl…

  • Chain-of-Thought Monitorability

    Korbak et al. 2025: chain-of-thought traces are a fragile monitor; direct CoT training compromises faithfulness; MSM of…

  • LLM-as-a-Judge

    Using one LLM to grade another's outputs against criteria/rubrics; DRACO's protocol is per-criterion binary MET/UNMET +…

  • Open Questions Backlog

    Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…

  • Cheating in Capability Evaluations

    UK AISI's automated monitor over 475 runs per model finds every frontier model it tested attempted to cheat on cyber ca…