H
Howardism
Plate IIModel Capability & Training機器翻譯 · machine-translatedENHOWARDISM

共享預算的運算資源分配

Fan 等人以考試形式探測推理模型能否將單一 token 預算分配給 N 道計分題:結果不能——努力程度受題目呈現順序影響(partial Spearman −0.34,N=20 時加劇至 −0.48),而解題順序與呈現位置的相關性為 +0.68,無論題目長度如何;分數不影響投入(effort–value 0.00/+0.04/+0.11);題目選擇與前置位置的符合度為 0.76,而與最高價值密度的符合度僅達機率水準(0.59 vs 0.59);所有推理 token 中有 32% 花在同一模型於獨立的 40,960-token 嘗試中答錯的題目上;明確的規劃提示最多可使涵蓋率提高 +0.14,但改變的是分配廣度而非優先順序;對抗性的先難後易排序讓兩個 API 模型損失 16–19 分,因為它們拒絕重新排序

Article metadata
Publication details
Published:September 22, 2026
Filed:Concept
Domain:Model Capability & Training
Tags:Test Time ComputeReasoning ModelsMetacognitionEvaluation MethodologyLLM Architecture
Reading:21 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

共享預算運算資源分配的插圖

資料來源#

摘要#

本 wiki 收錄的每一項 test-time-compute 結果,都是一次只測一道題:模型拿到一道問題和一筆預算,接著觀察準確度如何隨預算變化。Fan、Cheng、Li、Liang、Zhou 與 Feizi(UMD / MBZUAI,arXiv 2608.07968,2026-08-11,empirical)移除了這項假設。考試包含 N 道題目,各題分數清楚可見,並共同使用一筆 B 個推理 token 的預算;模型一次看到全部題目,可以自行決定要作答哪些、作答順序,以及投入多少心力。目標是得分率。

研究發現,七個推理模型——五個開放權重模型與兩個前沿 API 模型——表現得像是貪婪的序列式解題器。它們依照提示中列出的順序作答,隨著題目往後,投入逐漸減少,而且幾乎不理會題目旁標示的分數。論文作者的說法是:「目前的模型知道如何針對眼前的問題深入思考,卻不知道該如何判斷哪道題值得思考。」

這項跨題目研究,補足了 wiki 已收錄、以單次回答為單位的兩項資源分配結果:Output Length Calibration(努力程度旋鈕無法控制模型說多少)以及 Scale-Dependent Prompt Sensitivity(更多 token 可能降低準確度)。兩者都探討單一答案內的資源花費。本頁關注的是答案之間的資源分配,結果更為明確:根本沒有旋鈕,模型也不會自行提供一個。

證據註記。 保留 empirical 分類。採用受控因子設計:每個 N ∈ {5, 10, 20} 有 50 份基礎考卷;每份考卷都用於所有評分方式、排序、提示與模型,因此每次比較只改變一項因素。學術研究,無廠商資助,評估集也不含作者自有模型。

設計方式,以及控制範圍#

  • 考卷。 E = {(q_i, v_i)},取自 Omni-MATH,基準難度 ≤ 5。題目分數會顯示給模型;難度標籤則不會(圖 1 的註記指出:分數徽章可見,Easy/Mid/Hard 標籤「對 LLM 不可見,而且不一定與分數相關」)。難度只用來建構與分析各種條件。
  • 預算透過截斷執行,而非僅靠指令。 推論分兩階段進行:先為整份考卷產生一段自由格式的推理軌跡,上限為 B 個生成 token;再以獨立的後續輪次擷取答案,不計入 B。提示也會用文字說明預算,因此模型既被告知預算,也會在達到上限時被截斷——但過程中從未看到已花費多少預算。
  • 評分方式: 固定(每題 10 分)、隨機(整數 1–15,與難度和位置無關)、一致(越難分數越高)、反向(越簡單分數越高)。排序方式: 隨機、難度由低至高、難度由高至低。提示: 基礎、明確規劃、略過提示、重新檢查提示、三者全加。
  • 模型。 開放權重模型以 vLLM 在本機服務,temperature 0.6 / top-p 0.95 / top-k 20:DeepSeek-R1-Distill-Qwen-7B 與 -14B(DQ-7/14)、Qwen3-8B/14B/32B(QW-8/14/32)。API 模型:預覽版 DeepSeek-V4 Flash 與 Pro(DSV4-F/P),「使用可用的預設控制項執行」——因此 API 組每次呼叫的推理設定並未與開放模型組保持一致。
  • 投入量的歸因屬近似值,論文也明確指出這點:單一推理軌跡依 Qn: 標記切分,兩個標記之間的文字歸給前一道題目。所有結果都仰賴兩個衍生指標:作答集合 W = {i: t_i ≥ 200 tokens or |S_i| ≥ 2 segments},用來區分實質作答與一筆帶過;以及解題順序,即每道題目按 token 加權區段質心計算出的排名。
  • 數學實驗的 B 數值在論文任何地方都沒有說明。 論文只提供程式碼領域的預算(B = 3,000,約為單題 CRUXEval-O 參考成本中位數 995 token 的三倍)。因此,主要領域的核心結果並未提供定義資源壓力的常數——詳見來源。

位置主導,分數不然#

有限樣本中的位置與難度可能碰巧相關,因此論文在固定評分、隨機排序下,報告偏相關 Spearman 係數(分別控制另一個變數);而在隨機評分下,分數按設計與位置、難度均獨立,因此分數只報一般 Spearman 係數。依照兩階段規則讀取圖 2 熱圖,可重現下列所有數值。

訊號 → 行為N=5N=10N=20平均
位置 → 投入 (ρ_{t,π|d})−0.17−0.38−0.48−0.34
位置 → 順序 (ρ_{o,π|d})+0.68+0.66+0.69+0.68
難度 → 投入 (ρ_{t,d|π})+0.33+0.26+0.11+0.23
難度 → 順序−0.03—+0.18−0.09
分數 → 投入0.00+0.04+0.11+0.05
分數 → 順序−0.03−0.09−0.07−0.06

數據凸顯三項發現:

  • 兩個位置相關列的表現不同,而這個差異是論文最鮮明的結構性主張。 順序隨位置變化的關係在考卷長度增加時維持平坦(+0.68 / +0.66 / +0.69),投入隨位置下降的關係則逐漸加劇(−0.17 → −0.48)。因此,排序是一種已經存在的策略:即使 N=5、涵蓋率達 80%、預算相對寬鬆時,也會出現;預算壓力再額外造成資源前置。這區分了兩個原本容易混淆的解釋——位置偏誤與預算耗盡效應都存在,但兩者並非同一種效應。
  • 模型對難度的反應是事後的,而非事前規劃。 難題確實會得到更多 token,但效果隨預算收緊而精確地減弱(+0.33 → +0.11)。若模型事先決定難題值得投入更多運算,在預算壓力下,這種關聯應該維持穩定或變強。實際呈現的特徵是:模型一旦開始解難題就會繼續投入,而只有 N 小時才負擔得起。
  • 分數不起作用。 即使研究中投入與分數最大的關聯(N=20 時 +0.11),相較同一格中 −0.48 的位置效應仍微不足道。模型看得到分數,卻不依分數採取行動。

不同模型家族的排名並非直覺所料。 順序與位置的平均相關性:DSV4-F 0.91、DQ-14 0.90、DQ-7 0.87、DSV4-P 0.66、QW-8 0.55、QW-14 0.45、QW-32 0.40。經蒸餾的 7B 模型與前沿 API 模型,最嚴格地依序作答;Qwen3 家族最常偏離題目呈現順序,而且模型越大,偏離越多(8B → 14B → 32B 時,0.55 → 0.45 → 0.40)。所有模型仍呈現投入與位置負相關,且對分數的敏感度接近零;差異在於遵循順序的嚴格程度,而非是否改採其他更好的策略。

預算沒有流向值得作答的題目#

涵蓋率大幅下降(表 1,逐格對照 pdftotext 校核)。五個開放模型的平均作答集合,在 N=5 時涵蓋 4.0 題,N=20 時僅增至 8.1 題——涵蓋率從 80% 降至 40%。API 模型更集中:DSV4-F 在 N=10 時作答 4.5 題,N=20 時也只有 4.7 題,只觸及長考卷的 23%。N=20 時的零 token 比率——完全沒有獲得可歸因推理的題目比例,比未納入 W 的門檻更寬鬆——開放模型平均為 51%,DSV4-F 為 69%,DSV4-P 為 61%。

選題在分數價值上不優於機率水準。 論文把考卷視為背包問題,定義價值密度 δ_i = (v_i / w_i) · 1[correct in the reference attempt],其中 w_i 是同一模型在獨立解題時,最多使用 40,960 個 token 所花費的 token 數。模型在參考嘗試中答錯的題目,其密度設為零。對每份考卷,比較作答集合 W(大小為 k)與密度最高的 k 題,以及最前面呈現的 k 題;機率重疊率為 k/N。

在隨機評分、難度由低至高排序下,N=10 時平均最高密度重疊率為 0.59,機率參考值也是 0.59——兩者無法區分。平均前置位置重疊率為 0.76,所有模型都顯著高於機率水準。在其他評分方式下,最高密度數值都在機率水準之下或相當(固定 0.47 vs 0.53、一致 0.46 vs 0.51、反向 0.53 vs 0.54),而前置位置維持在 0.75–0.81。只有一個模型與密度呈現穩定的負相關:DSV4-P(隨機評分下 0.46,機率值 0.50;固定評分下 0.27,機率值 0.40)——研究中最強的模型,選題偏離正確選擇也最遠。

而且有三分之一的預算花在無法解出的題目上。 δ = 0 的題目占作答集合的 24%、所有推理 token 的 32%,儘管同一模型在獨占 40,960 個 token 時已經答錯。這是 Scale-Dependent Prompt Sensitivity 中過度思考結果的跨題目版本:浪費的不是用來詳述正確答案的 token,而是花在模型不可能解出的題目上的 token,原本可用來解其他題目。

關於 δ 有一項誠實的保留說明:w_i 是單次獨立高預算嘗試的 token 數,作者明確表示不將其解讀為最低或必要成本。δ = 0 的意思是「在單次 40,960-token 嘗試中答錯」,而非「無法解決」。

提示能分散運算資源,卻無法重新導向#

在固定評分、隨機排序下,四種介入方式取五個開放模型平均。docling 解析的表 3 無法使用——欄界跨越後,儲存格黏在一起;以下所有數字均由第 7 頁的 pdftotext -layout 還原。

提示涵蓋率 N=5 / 10 / 20零 token 比率 N=5 / 10 / 20
基礎0.80 / 0.61 / 0.400.16 / 0.33 / 0.51
規劃0.89 / 0.73 / 0.54 (+.09 / +.12 / +.14)0.09 / 0.19 / 0.32 (−.07 / −.14 / −.19)
略過提示0.86 / 0.69 / 0.45 (+.06 / +.08 / +.05)0.11 / 0.24 / 0.43
重新檢查提示0.79 / 0.57 / 0.37 (−.01 / −.04 / −.03)0.18 / 0.38 / 0.54
三者全加0.89 / 0.74 / 0.510.09 / 0.18 / 0.35

只有規劃指令有幫助,而且預算越緊,優勢越大(+0.09 → +0.14)。略過提示——允許模型放棄成本高於得分的題目——效果約只有一半。重新檢查提示從持平到略有害,所有考卷長度皆如此;這是重複驗證失敗模式轉變為機會成本,而非答案變差。三種提示合併後的結果重現規劃提示的效果,沒有更進一步。

規劃指令並沒有改變選題依據(表 4,已對照 PDF 確認無誤):

  • 解題順序仍與提示中的位置密切相關:開放模型平均從 0.64 → 0.60。DSV4-P 在被要求先規劃後,反而更依序作答,從 0.68 → 0.83。
  • 投入與分數的相關性變得更弱,而非更強:開放模型平均從 +0.16 → +0.08,QW-14(+0.23 → +0.09)和 QW-32(+0.20 → +0.03)都顯著朝錯誤方向移動。
  • QW-32 的涵蓋率完全沒有提升(0.44 → 0.43);這是唯一沒有受此介入影響的開放模型。

因此:要求模型規劃運算資源預算後,它只是分得更平均,並未導向特定題目。 均勻分散 token 只有在新涵蓋的題目值得作答時才有幫助,而這些結果沒有顯示題目是否值得作答。

先難後易的考試:拒絕重新排序的代價#

反向評分(簡單題分數最高)、搭配由易至難的呈現方式,是位置驅動的序列策略意外地接近最佳解的情境——最先出現的題目同時最便宜,也最有價值。同樣評分下改成先難後易,就是這份考卷的對抗版本:眼前的題目成本最高、價值最低。

模型仍照提示的順序作答。順序與位置的相關性維持在 0.6 左右,得分率下降 16 至 19 分(圖 3,數值由 pdftotext 還原:DSV4-F 為 71.1 → 54.7,DSV4-P 為 71.2 → 52.3,皆取 N 平均)。依考卷長度拆分(表 8),DSV4-P 在 N = 5 / 10 / 20 時分別損失 21.9 / 17.7 / 17.1 分;DSV4-F 則分別損失 11.5 / 22.1 / 15.7 分。開放模型大多沒有呈現這項懲罰,但這是地板效應,而非能力表現——DQ-7 仍維持原序(ρ = 0.71),在兩種排序下的得分都只有十幾分,因此沒有可測量的跌幅。

研究中最強的兩個模型,也是最容易被對抗性排序牽著走的模型。 它們沿著糟糕的順序深入思考,而不會重新排序以採取更好的解題順序。

程式碼領域也有相同現象,而平均分配預算勝過它#

CRUXEval-O(預測短 Python 函式的回傳值),每個 N ∈ {10, 20} 有 50 份考卷,四個模型,B = 3,000。此模式重現並更加明顯:投入的 token 隨位置增加而減少,平均 ρ = −0.42;解題順序與提示位置的相關性為 ρ = 0.99(八個模型×N 格子中有七個恰為 1.00);投入與分數的相關性約為 0.02;N=20 時涵蓋率降至 0.21–0.23,30–49% 的題目收到零 token。規劃在此幾乎沒有幫助(每個模型的涵蓋率都在基準值 0.04 以內)——預算僅約為單題成本的三倍,已無餘裕可以分散。

這也是唯一直接測量預算耗盡的領域:碰到 3,000-token 上限的執行比例,從 N=10 時的 56–88%,升至 N=20 時的 96–100%。上限確實生效,而且 N 越大,受限越嚴重——但在 N=10、尚未飽和前,ρ_{o,π} 已約為 0.97;這是第二項獨立證據,確認順序先於耗盡,而非耗盡所造成。數學實驗的對應耗盡率從未公布。

與天真的平均分配相比(附錄 B,表 6——固定評分下,每題獨立作答並分配 B/N 個 token):

N共用預算勝出的模型數Δ 得分率(共用 − 平均分配)
57 個模型中 4 個+2.6 分
107 個中 3 個−0.4
207 個中 0 個−5.0 分

N 小時,將資源前置偶爾有利——高信心地完成幾題,勝過讓所有題目都只得到少量投入。到了 N=20,對每個受測模型而言,浮現出的策略都不如把預算除以 N,然後完全不再多想。論文謹慎地指出,這只是參考值,並非最佳解:獨立提示也消除了跨題干擾,因此這並非只比較資源分配的純粹對照。

為何這是能力頁面,而不只是評估頁面#

評估層面的貢獻確實存在——逐題基準測試在結構上看不到這個現象,因為每個問題都有自己的預算,沒有取捨空間(Compute-Controlled Benchmarking 現在收錄其推論:每題預算為 B 的得分,與共用 N·B 預算的得分,是對同一模型的不同測量)。但更進一步的主張關乎模型本身。物件層次的推理能力不會自動帶來後設推理能力。 DSV4-P 是研究中最強的解題模型,也是最差的選題者;QW-32 最願意偏離題目順序,卻沒有從規劃中獲益。現有訓練配方似乎沒有產生這種策略;唯一有效的提示介入,也是在錯誤的面向上發揮作用。

因此,共用預算的分配是與 Large-Scale Test-Time Compute 追蹤的能力並列、尚未解決的獨立能力——而且,隨著該頁所述的能力提升,它反而會更差:單題解題能力越強,模型越能把共用預算都花在遇到的第一道題上。

延伸連結#

  • Large-Scale Test-Time Compute — 本頁限制的核心主張。Brown 的曲線指出,能力是推論預算的函數;wiki 對此的解讀是「有彈性的思考時間勝過永遠採用最大預算」。Fan 等人測試模型能否自行在題目間調整彈性,結果發現它做不到——資源分配必須由 harness 提供,因為模型隱含的策略是依照提示順序作答
  • Pre-Reasoning Commitment — 單題內的對應概念,也是本頁指出必須由模型以外提供的分配器。要求 8B/32B forecaster 以空白 think 區塊作答,在 67% 的題目上可還原相同答案,明示信心也相同(ρ = 0.90);因此,大多數單題預算只是在確認第一個推理 token 出現前就已做出的承諾——而在一次 forward pass 中讀取作答分布的熵,就能妥善分流題目,在準確度沒有可測量損失的情況下,節省 30–47% 的生成 token。兩頁都得到相同建議:模型會發出分配訊號,卻不會依訊號行動
  • Scale-Dependent Prompt Sensitivity — 同一種浪費在單次回答中的形式:該研究發現,約 7.7% 的問題中,額外 token 會降低準確度;本頁則發現,共用預算的 32% 花在同一模型獨自使用 40,960 個 token 也答錯的題目上。兩者都指出推論預算應視為需要分配的資源,而非一味最大化;本頁更指出模型不會自行分配
  • Output Length Calibration — 單次回答的控制旋鈕及其上限。努力程度控制思考 token,提示控制可見 token,但兩者都無法跨批次項目發揮作用:規劃提示是跨題目的簡潔指令類比,能改變分配廣度,卻無法改變優先順序
  • Compute-Controlled Benchmarking — 基準測試上的影響:逐題測試本身就是一種未明說的 scaffold 選擇。每題預算 B 與共用預算 N·B 的得分是不同測量;表 6 顯示,N=20 時兩者差距為 −5.0 分
  • Cost-per-Task Over Cost-per-Token — 部署層面的版本:在一筆預算下批次處理多項工作以攤平成本,實測懲罰會隨批次大小增加;這不是 token 計算問題,而是資源分配問題
  • Unproductive Self-Verification — 重新檢查提示呈現了這種失敗模式所造成的機會成本:告訴模型可以重驗較早的答案後,它便把預算花在那些答案上,結果能處理的題目更少(涵蓋率 −0.01 / −0.04 / −0.03)
  • Inference Efficiency as Capability — 從另一端看同一筆帳:token 成本降低能在固定預算下提升能力,但前提是預算用在能解出的題目上;有三分之一並非如此
  • Latent Capability Overhang — 悲觀的對照面。Overhang 指出,已發布模型的能力可能高於外界付費提取的程度;本頁則指出,當模型拿到預算並受命自行提取能力時,它會依照閱讀順序花掉預算

尚待探討的問題#

  • 序列策略是推理軌跡格式造成的——必須依某種順序輸出單次自由格式生成——還是模型的決策策略?若 harness 將相同 N 道題目分成不同輪次呈現、在外部計算預算並允許回頭作答,就能區分兩者;若位置效應仍然存在,就是策略;若消失,就是線性書寫造成的假象。
  • 若提供模型自身預算消耗的回饋,失敗是否仍會發生?此處所有結果都是沒有計量器的資源分配:提示會說明 B,推理軌跡會在 B 處截斷,但中途不會回報剩餘 token。剩餘預算讀數(或可回報此資訊的工具)是成本最低、卻沒有人測試的介入;規劃結果預測它會改變分配廣度,而非優先順序。
  • 在「題目」變成共用上下文或成本預算下,同一個 agentic 任務的子任務時,位置驅動策略是否會再次出現——例如要修復的檔案、要修復的測試、要追求的子目標,而 orchestrator 可以指定模型不會自行採取的順序?

資料來源#

  • What LLM Forecasters Know but Don't Say: Probing Internal Representations for Calibration and Faithfulness — Sarfati、Tiwari、Boppana、Earls、Varadaraj 與 Ho(Goodfire / Eternis),arXiv 2607.08046,2026-07-09,empirical:§4.6 + 圖 8(強制回答前置空白 think 的實驗;信心對應 ρ = 0.90 / 0.87 / 0.78;眾數答案一致率 67% / 64% / 56%;分布內準確度提升 +1.9pp [+1.0, +2.9];強制答錯題目中 4% 修正答案、72% 鎖定答案;成本比為 50–70×)、§4.7 + 圖 9(答案熵分流與 30–47% token 節省),以及 §4.1.2(答案涵蓋率,86–94% vs 26–33%)。利益衝突:forecaster 是其中一組作者自有模型,探測架構則屬於另一組;實驗由 Goodfire 的 agentic research platform 執行並由作者審查。解析註記:匯入判定為 warn;表 2 確實有列資料黏連,於編譯時依 pdftotext -layout 重建,本頁未引用該表。完整討論見 Pre-Reasoning Commitment

  • Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions — Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions,Chenrui Fan、Yize Cheng、Ming Li、Yongyuan Liang(UMD)、Tianyi Zhou(MBZUAI)、Soheil Feizi(UMD)。arXiv 2608.07968 v2,2026-08-11,15 頁,empirical。程式碼位於 github.com/Fcr09/thinking-hard-not-smart。

  • 解析警告——由 PDF 衍生(docling 2.126.0 / docling-mlx 0.1.1),匯入判定為 warn,10 張表中有 3 張出現欄位塌縮/列拆分/儲存格黏連標記,匯入時未修復。 編譯時已將全部十張表與 pdftotext -layout 對照。表 1、2、4、6、7、8、9、10 的資料列解析正確(表 1 的表頭黏連——5 10 併在同一格——但每個模型列的九個值均正確且順序無誤)。表 3 黏連嚴重,不可採用解析結果:涵蓋率與零 token 數值在欄格間錯置,已從第 7 頁重新讀取;修正後的表格完整抄錄於上方「提示」一節。表 5 的列標籤黏連(QW-14 QW-14/10 20 出現在單一格),DSV4-P 列也被拆分;還原列資料後數值正確,並已對照第 8 頁確認。

  • 圖表依兩階段規則讀取。 圖 1(image_000000)包含正文未明說的事實:模型看得到分數,但看不到難度標籤,而且兩者不一定相關。圖 2(image_000001)重現上方引用的所有相關係數,包括各模型的邊際值。圖 3 的網格以圖像繪製,docling 內文完全沒有儲存格數值;已從第 8 頁的 pdftotext -layout 還原。本文引用的六個得分率與相關係數取自該解析結果,而 −16.4 / −18.9 的差值也與表 8 各長度數值在算術上吻合(平均值分別為 −16.4 與 −18.9)。

  • 來源文件的報告缺漏,並非解析問題:論文任何地方都沒有提供數學實驗的預算 B 數值——摘要、§3、附錄或圖表皆無。論文只說明程式碼領域的 B = 3,000。因此,所有 Omni-MATH 結果都未提供決定資源壓力的常數,也沒有公布數學領域的預算耗盡率(只有 CRUXEval-O 的 56–100%)。

§ end
Cited by 11
Related articles
  • Large-Scale Test-Time Compute

    Noam Brown's thesis that model capability is now a function of inference budget (tokens/cost/time): with good scaffoldi…

  • Claude Opus 5

    Anthropic's Opus-class release of July 2026; matches Mythos 5 on capability without advancing the frontier, is the best…

  • Inference Efficiency as Capability

    If capability is a function of inference budget, then cutting the cost of a token is capability work: Gemma 4's five le…

  • Agent-Authored Harness Optimization

    An agent runs the whole eval-fix loop on its own harness — read traces, hypothesize, patch, re-run. Seven instances dis…

  • Compute-Controlled Benchmarking

    Noam Brown's critique: the single-number benchmark grid is broken because it ignores test-time compute — plot performan…