H
Howardism
Plate IIEvals & Benchmarks機器翻譯 · machine-translated過時翻譯 · stale translationENHOWARDISM

具規模依賴性的提示敏感度

PublishedApril 14, 2026FiledConceptDomainEvals & BenchmarksTagsLLM EvaluationPrompt EngineeringInverse ScalingScaling LawsRLHFReading9 minSourceAI-synthesised

在 7.7% 的標準基準測試中,大型模型因過度思考而表現不如小型模型;簡潔限制可恢復 26 個百分點,並在 GSM8K/MMLU-STEM 上完全逆轉模型層級

具規模依賴性的提示敏感度插圖

資料來源#

摘要#

Hakim(2026)的實證發現重新詮釋了已被記錄的「逆向擴展」案例:這是 提示工程 問題,而非能力問題。在標準基準測試的 7.7% 題目中(涵蓋 GSM8K、BoolQ、ARC-Easy、CommonsenseQA、MMLU-STEM,共 1,485 題中的 115 題),大型語言模型的表現低於小型模型 28.4 個百分點——儘管參數多出 10–100 倍。因果介入顯示,簡潔限制可讓大型模型恢復 26 個百分點的準確率,並在數學與科學推理基準測試上完全逆轉層級。其機制——自發出現的規模依賴性冗長(「過度思考」)——意味著大型模型具備更優越的潛在能力,只是被通用提示掩蓋了。部署上的後果是:最佳提示策略必須感知規模,而不能一體適用。

細節#

研究範圍#

涵蓋 Llama、Qwen、Gemma 與 Mistral 系列的 31 個模型,參數量從 0.5B 到 405B,針對五項基準測試的 1,485 道題目進行評估 → 共 46,035 次個別評估。為確保可重現性,使用貪婪解碼(do_sample=False)。小型/大型模型以 ≤10B 與 >70B 參數為分界。

三種問題類別#

以題目為層級的分析顯示,基準測試評估所提供的資訊,比彙總分數所暗示的更為稀疏:

  • 無鑑別力(27.1%)——天花板效應(17.3%,所有模型都成功)或地板效應(9.8%,所有模型都失敗)。約三分之一的評估投入無法提供相對能力的訊號。
  • 正常擴展(48.1%)——大型模型如預期般勝過小型模型。
  • 逆向擴展(7.7%)——小型模型系統性地擊敗大型模型。

逆向擴展:不是對抗性的,也不罕見#

過去關於逆向擴展的研究(Inverse Scaling Prize、BIG-Bench)聚焦於為揭露失敗模式而刻意構造的任務——罕見模式的記憶、干擾項推理、虛假相關。Hakim 的貢獻在於指出,逆向擴展在標準能力基準測試中以具意義的比例出現:BoolQ 11.3%、CommonsenseQA 9.7%、ARC-Easy 9.3%、GSM8K 4.3%、MMLU-STEM 3.9%。

效果量是類別性的,而非邊際性的:Cohen's $d = 1.34$(傳統的「大」效果門檻為 0.8)。平均差距為 28.4 個百分點,偏向小型模型。Mann-Whitney U 在每個資料集上都得到 $p < 0.001$。

家族內分析排除了架構因素:

  • Llama:較小的變體(2B–13B)達到 48–68%,大型變體(70B–405B)則為 41–54%
  • Qwen:0.5B–7B 為 62–83%,32B 則為 40%
  • 在逆向題目上,家族規模與準確率之間的 Pearson $r = -0.58$($p = 0.029$)

過度思考作為因果機制#

假設:大型模型會生成過度冗長的回答,遮蔽正確推理。相關與因果證據都支持此假設:

相關性——在逆向題目上,回答長度與大型模型準確率呈負相關($r = -0.43$)。值得注意的是,大型模型並沒有生成更多明確的推理步驟(小型模型 10.5 步,大型模型 9.1 步),而是產生長 59% 的總輸出(202 對 127 個 token)。它們是在步驟內部展開更多內容,而不是採取更多步驟。

因果性——在全部 115 道逆向題目上,對七個模型施加三種條件(控制、簡潔、直接)進行介入:

  • 簡潔限制:數學題 <50 個字,閱讀理解 <10 個字
  • 直接:只給出最終答案,不提供推理
  • 結果:簡潔條件下,大型模型準確率 +26.3 個百分點;小型模型準確率 −3.1 個百分點。差距縮小 67%(44.2 個百分點 → 14.8 個百分點)。配對 $t = 7.80$、$p < 0.0001$。
  • 直接格式:差距壓縮至 7.8 個百分點(減少 82.3%),但兩種規模的準確率都下降,表示部分推理確實有益。

在簡潔條件下,token 生成量的中位數從 197 → 78(減少 60%)——介入確實操弄了假設中的機制。

完整的層級逆轉#

最強的主張是:在兩個資料集上,簡潔限制不只是縮小差距——而是翻轉差距。

  • GSM8K:+13.1 個百分點偏向小型模型 → −7.7 個百分點偏向大型模型
  • MMLU-STEM:+27.3 個百分點偏向小型模型 → −15.9 個百分點偏向大型模型

這些逆轉說明,標準評估掩蓋而非測量大型模型的能力。Llama-3.1-405B 在逆向題目上的表現從 41.5%(控制)提升至 67.2%(簡潔),解鎖了 25.7 個百分點。

簡潔限制造成傷害的地方:BoolQ#

資料集異質性至關重要:BoolQ 的差距在簡潔條件下反而略微擴大(23.5 個百分點 → 24.3 個百分點)。原因在於,BoolQ 需要整合跨句子的文章內容,此時詳述是功能性的,而非過度的。簡潔限制不是通用處方——它在數學、科學等自包含問題上有幫助,因為過度闡述會累積錯誤;但在明確推理是承重結構的問題上則有害。

排除污染因素#

三項獨立測試確認,逆向擴展反映的是真實能力差異,而非記憶痕跡:

  • 回答多樣性:各資料集的獨特回答比例為 89–100%(與模板記憶不符)
  • 長度變異性:CV 為 0.31–1.21,全部超過記憶門檻(CV < 0.15)
  • 錯誤模式:過度推理失敗佔 40–81%,而記憶迴避佔 13–23%
  • Fisher's exact test:污染指標與逆向擴展之間沒有關聯($p = 0.23$)

RLHF 長度偏差假說#

推測的起源是:RLHF 獎勵模型具有長度偏差——標註者將詳盡程度與品質混為一談。大型模型具備更高的能力,可在訓練期間滿足長度獎勵訊號,並更深地內化冗長生成。這與指令微調變體比基礎變體具有更大冗長差異的現象一致。它也指出一個可在訓練時處理的緩解方向:針對需要簡潔回答的問題類型,校準獎勵模型以懲罰過度闡述。

實務影響#

  1. 彙總基準測試系統性低估大型模型能力,而且發生在可預測的題目子集上——其差異足以媲美整整一代模型;對前沿模型而言,標準提示與最佳化提示之間也存在同等級的差距。
  2. 問題感知路由 + 規模特定提示是部署模式:偵測容易引發過度思考的問題類型,並選擇性套用簡潔限制。
  3. 成本與能力可同時改善——簡潔既能提高逆向題目的準確率,也能減少 token(降低支出)。

限制#

  • 僅使用貪婪解碼;尚不清楚溫度採樣是否會改變 7.7% 的比例。
  • 僅涵蓋知識/推理任務;未評估生成任務。
  • 未確立大型模型為何會過度思考(訓練動態?架構?湧現?)。
  • 因果樣本部分是依據較強的過度思考傾向選取模型(差距為 44.2 個百分點,相較完整分析的 28.4 個百分點),因此 67% 的縮減可能是上限估計。

相關連結#

  • Agentic Loops Overtake Bespoke Systems — 較小的 Gemini 模型什麼也沒解決——這是一項規模敏感度結果
  • Jagged Intelligence (Ghosts, Not Animals) — 在簡單任務上過度思考,是鋸齒狀能力的失敗模式
  • Client-Side Agent Optimization — AgentOpt 的 HotpotQA 發現(Claude Opus 4.6 是最糟糕的規劃器,繞過求解器而使用參數化知識)正是這篇論文的過度思考機制以路由失敗形式浮現。兩篇論文合在一起,指出大型模型存在系統性誤用,並有兩種可用的緩解方式:繞過它(組合選擇),或限制輸出(簡潔)
  • Claude Code Best Practices — 將上下文視窗視為主要限制的框架,與簡潔性自然契合:較短的完成內容也能保留更多上下文預算。Claude Code 強調以驗證驅動的開發,在大型模型輸出以系統性冗長方式掩蓋錯誤時尤其重要
  • Agent Harness Engineering — 在 harness 層級強制輸出長度不變量(透過系統提示、結構化輸出結構描述或回答驗證器),是一種直接處理規模依賴性過度思考的機械式強制模式。屬於「強制不變量,而非實作」
  • LLM-Driven Vulnerability Research — 漏洞研究 scaffold 的段落級提示(「在這個程式中找出安全漏洞」)之所以成功,部分原因是任務獎勵詳盡程度,而這正是大型模型過度產生的行為。這是大型模型冗長程度與任務效用一致,而非與之對立的案例
  • Claude Opus 4.7 — Hakim 的發現是在 Opus 4.6 上測量的。4.7 的字面指令遵循能力可能使簡潔限制更有效(模型會遵守字數上限),但其更高的預設努力程度與每回合額外思考,也可能增加基線冗長度。最終方向仍是開放的實證問題
  • Interactivity Benchmarks — 這是另一個論文自行發明評估框架的案例(FD-bench 擴充、TimeSpeak/CueSpeak、視覺主動性基準測試),用來呈現標準基準測試忽略的現象;其認識論上的強項與軟肋,和本文對 BoolQ 例外的框架相同
  • Hermes Agent/verbose 模式與有界記憶體會隱含地限制輸出長度;簡潔限制的發現預測這會帶來準確率提升
  • The Verifiability ThesisKarpathy 的「之所以鋸齒狀,是因為實驗室訓練了什麼」是解釋規模為何不會一致帶來助益的模型能力故事
  • AI-Driven Formal Proof Search — 一個鮮明的門檻案例:較小的 Gemini 變體一個開放問題也沒解出來,而 Gemini 3.1 Pro 成功了——此處能力是門檻式的,而非分數式的
  • Large-Scale Test-Time Compute — 過度思考結果是該論點的反例:更多測試時運算(更長的生成)會降低約 7.7% 題目的準確率,因此推理預算是要分配、而非最大化的資源;簡潔會降低預算,並解鎖預設提示所掩蓋的大型模型潛在能力
  • Benchmark Score Redundancy — 這是本項目級結果在矩陣層級的伴隨結果:本文發現約 27% 的基準測試題目沒有鑑別力(天花板/地板);BenchPress 則發現整個 84×133 的基準測試矩陣是 rank-2。兩者都量化了彙總基準測試所承載的獨立訊號,比其數量所暗示的少多少

衍生內容#

開放問題#

  • RLHF 長度偏差假說,若直接對照基礎(非指令)模型變體進行測試,是否也能重現?如果冗長生成主要是在預訓練階段形成,基礎模型的冗長差異應該會與指令模型的差異相符。
  • 哪些問題特徵能預測提示敏感度?自動分類器將使規模特定提示可以部署。
  • 過度思考效應如何與使用工具的代理互動?如果簡潔對大型模型有幫助,但工具需要結構化推理,最佳提示就不會一律簡潔。
  • 推理模型(o1、DeepSeek-R1 風格)是否展現出與指令模型不同的過度思考動態?它們受訓後的行為明確要求生成長篇 CoT——簡潔介入是否會傷害它們?
  • BoolQ 的功能性詳述例外,是清晰的分類邊界,還是每種任務類型都有依情境而定的最佳長度?

資料來源#

§ end
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

Cited by 24
Related articles
  • Client-Side Agent Optimization

    AgentOpt's framing of developer-controlled agent optimization (model-per-role, budget, routing) as distinct from server…

  • Agent Harness Engineering

    Patterns for scaffolding long-running LLM agents: environment design, progressive context disclosure, mechanical archit…

  • Claude Code Best Practices

    Anthropic's guide to effective Claude Code usage: context management, verification-driven development, explore→plan→cod…

  • Open Questions Backlog

    _456 actionable open questions across 205 pages · 107 predictions · 9 notes · 147 in progress · 69 watching (entities),…

  • Claude Opus 4.7

    GA frontier model from Anthropic; direct upgrade to 4.6 at same price; literal instruction following, 1.0–1.35× tokeniz…