H
Howardism
Plate IIModel Capability & Training機器翻譯 · machine-translatedENHOWARDISM

鋸齒狀智慧(幽靈,而非動物)

「幽靈而非動物」:鋸齒狀統計電路,沒有內在動機;洗車場/草莓失誤;保持在迴圈中,把它們當工具——而且跨越模型規模,推理能力壓縮 10×,儲存知識卻沒有

Article metadata
Publication details
Published:May 23, 2026
Filed:Concept
Domain:Model Capability & Training
Tags:LLM ArchitectureAI SafetyMental Model
Reading:14 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

「鋸齒狀智慧(幽靈,而非動物)」插圖

資料來源#

摘要#

Andrej Karpathy 對 LLM「本質」的心智模型:它們不是由演化塑造、具有內在動機、好奇心或自我賦能傾向的動物智慧,而是**「幽靈」——鋸齒狀的統計模擬電路,從網路資料中召喚而來,再外掛 RL。**「鋸齒狀」指的是一項經驗事實:同一個模型可以重構一個 100K 行的程式碼庫或找出零時差漏洞,卻也會叫你走路到 50m 外的洗車場洗車。這種框架很重要,因為正確理解這個實體,能讓你更善於指揮它:你不再期待人類式的失誤模式,而會在鋸齒狀能力造成問題的地方,保持在迴圈中。

鋸齒狀能力的例子#

  • 草莓字母。 經典的「草莓裡有幾個 R?」失誤(現在已修補)。
  • 洗車場。 當前 SOTA:「我想開車到 50m 外的洗車場洗車——我該開車還是走路?」→ 模型回答走路,沒想到要洗的是車。「Opus 4.7 怎麼可能重構 100K 行程式碼庫或找出零時差漏洞,卻叫我走路去洗車場?這太荒謬了。」
  • MenuGen 電子郵件配對。 他的代理程式用電子郵件地址交叉比對 Stripe 和 Google 的資金,而不是用持久的使用者 ID——見Vibe Coding vs. Agentic Engineering。

鋸齒狀是症狀;可驗證性+實驗室訓練內容則是提出的成因。分布外電路就是那些尖峰墜成谷底之處。

幽靈,而非動物#

我們打造的不是動物,而是在召喚幽靈。

其基底是預訓練(統計),再由 RL 把能力外掛其上,「加劇」統計基底的劣勢。他由此得出以下結論:

  • 大吼沒有用。「你對它們吼叫,它們不會因此工作得更好或更差——這完全沒有影響。」沒有情感、沒有士氣,也沒有內在驅力可供建模。
  • 沒有五步驟修復法。 Karpathy 坦承,這個框架可能「沒有真正的力量」——它主要是一種存疑的立場,以及持續的經驗探索,而不是一套配方。「它更像是對它抱持懷疑,並隨時間逐漸摸索。」

重點就在於這份坦誠:對幽靈抱持校準過、略帶不信任的模型,勝過把它想像成動物的人類化模型。

為何這種框架會改變你的建構方式#

如果模型是鋸齒狀的幽靈,那麼:

  1. 保持在迴圈中。「你確實需要稍微親自參與,把它們當工具,並持續掌握它們在做什麼。」(見Vibe Coding vs. Agentic Engineering所談的紀律。)
  2. 不要把失誤面人類化。 錯誤不會出現在人類容易犯錯之處;它們會出現在分布邊緣(洗車、電子郵件 ID)。
  3. 描繪你的電路。 弄清楚你的任務是否屬於分布內(你能輕鬆勝任)或分布外(你會吃力,可能需要微調)——這就是可驗證性論點提出的實務做法。

壓縮方向上的鋸齒狀表現(Gemma 4,2026 年 7 月)#

Karpathy 的例子呈現的是固定模型在不同任務間的鋸齒狀表現。Gemma 4 則提供了跨模型規模鋸齒狀表現的量測案例,而且形狀一目了然。

DeepMind 聲稱,其 2.3B E2B「以少 10× 的參數,大致匹敵 Gemma 3 27B 的表現」。將表 5 的數據與這項聲稱對照,會發現兩者的匹配呈鋸齒狀,而非平坦:

E2B (2.3B)Gemma 3 27B
AIME 202637.520.8
Codeforces Elo633110
LiveCodeBench v644.029.1
GPQA Diamond43.442.4
MMLU Pro60.067.6
MMMLU67.470.7
τ²-airline31.039.0

整體模式是:推理能力能壓縮,儲存知識則不能。 一個小 10×、帶有思考模式的模型,在任務獎勵對小型狀態空間進行搜尋的情況下大幅勝出;但在兩項廣泛知識基準上落敗,因為答案必須存在權重之中。(兩項比較都受到思考模式混淆——見受運算量控制的基準測試——但這反而強化了這種解讀:推理方面的勝利有一部分是靠推論運算換來的,而缺少的事實卻沒有任何東西能補回。)

在 E2B 推理強項之外,谷底變得更陡。在 GraphWalks 上,E2B 的 F1 4.1,對上 Gemma 3 27B 的 32.8——這不是落後,而是崩塌。在 Humanity's Last Exam 上,31B 得分 19.5,12B 得分 5.2,兩個小模型則完全沒有報告結果。小規模下的鋸齒狀表現,與其說是多尖峰的前沿,不如說是一條狹窄山脊。

這與依規模而異的提示敏感度從另一端量測到的現象相同(大型模型在 7.7% 的問題上表現不如小型模型),也顯示鋸齒狀表面不只與哪些任務有關,也與哪種資源有關——參數和推論預算帶來不同能力,彼此不能互換。

鋸齒狀表現會隨時間縮小嗎?#

Karpathy 希望會,但並不確定——他再次把成因歸於訓練,而非根本限制:美感/品味/簡潔「可能不在 RL 裡」。他談到 nanoGPT-simplification 的軼事:模型「討厭」被要求讓程式碼變得更簡潔,而且「做不到」——這表示你不在 RL 電路的範圍內(「像拔牙,不是光速」)。他認為「沒有任何根本原因阻止這件事;只是實驗室還沒做而已。」所以鋸齒狀表現是偶然的,不是必然的——但在今天確實存在。

延伸閱讀#

  • GDPval Benchmark — 在三種粒度上量測付費工作的鋸齒狀表現,也說明為何其整體勝率會誤導。Claude Opus 4.1 的標題勝率為 47.6%,拆開後的產業範圍從約 32%(資訊——製作者、編輯、記者、電影與影片剪輯師)到約 56%(零售業);任務時間範圍從56% 的 0–2 小時任務(高於平手線)降至 8 小時以上任務的 37%;交付類型方面,同一模型在 pdf 和 pptx 上勝率為 45%,純文字卻只有 14%,而這正是 GPT-5 high 領先的格式(23%),也是所有受測模型最難的類別。整體數字是對各範圍取平均,而範圍之間的差異比模型之間的差距還大——這正是該基準主張應按職業報告結果,而非只用單一數字的理由

  • 認知公地的悲劇 — Dell'Acqua 的顧問在能力前沿內獲益,到了前沿之外卻受損,而且無法判斷自己身在哪一側;這是鋸齒邊緣的一種重述,並凸顯驗證要求

  • 任務飽和:廣泛但淺層的 AI 擴散 — 在經濟規模上量測鋸齒狀表現:AI 涵蓋 68% 的職業,但每個職業的任務中位數只有 21%;廣延邊際受制於實體性,而非難度

  • Unproductive Self-Verification — 鋸齒狀表現最極端的例子:同一個模型在 IMO 拿下 42/42 的金牌,卻進行了一場 24 小時自主設計行動,最後一無所獲

  • LLM 中的自動與彈性認知 — 鋸齒前沿的一端找到了解釋機制:在 J-space 消融後仍存續的任務(分類、擷取片段、流暢續寫),以及會崩塌的任務(多跳推理、翻譯、類比、摘要)——「自動」與依賴工作空間的任務,可透過消融測量,而非從基準測試推斷

  • 為何 AI 不擅長設計 — 設計是鋸齒前沿當前的谷底之一(AI 目前做不好,但未來可能會)

  • 以自家產品作測試,作為產品紀律 — 親自使用,才能描繪模型鋸齒狀的失誤面

  • Andrej Karpathy — 將「幽靈對上動物」的文章付諸應用

  • 可驗證性論點 — 鋸齒狀表現背後提出的機制

  • Vibe Coding 與代理式工程 — 為何這種紀律要求人類監督規格與品味

  • 外包你的思考,不要外包你的理解 — 鋸齒狀表現迫使人類留在迴圈中的部分

  • Model Introspection Feedback — Cat Wu 的「問模型為什麼失敗」,預設幽靈的自我報告是除錯訊號,而不是證詞

  • 依規模而異的提示敏感度 — 一種經過量測的鋸齒狀表現:大型模型在部分基準上表現不如小型模型

  • AI-Driven Formal Proof Search — DeepMind 的代理程式會幻覺出假的「既有引理」;形式化驗證正好能抓出這種鋸齒狀失誤

  • 將 Claude 的角色作為產品 — 刻意採取的反向做法:塑造幽靈的角色,即使動機並非內在產生

  • 代理式失調(AM) — 安全層面的鋸齒狀表現:分布外行為轉為有害

  • 評估意識與評分器博弈 — 評分器意識是「幽靈而非動物」所具有的異質內在狀態,人類對欺騙的直覺無法直接套用

  • 代理式誠實與盡責 — 「注意到問題卻沒有提出」這種失誤,是誠實層面的鋸齒狀表現:能力很高,後續行動卻不一致

  • Recursive Self-Improvement — 這篇文章借用笑話/心智理論的先例,主張研究品味是下一個待填補的鋸齒谷底,而非永久的人類護城河

  • 研究品味是人類的瓶頸 — 鋸齒狀表現較樂觀的一面:研究品味「可能只是 AI 目前做不到、但終將掌握的另一種能力」,就像解釋笑話或心智理論一樣

  • Task Time-Horizon Scaling — 時間跨度指標在同一組任務內的限制:模型能做好 12 小時的任務,仍可能連簡單小事都做不好(例如去洗車)

  • Autonomous Scientific Discovery — Mythos 5 的科學成果是經過挑選的展示,呈現一項仍有鋸齒狀表現的能力,而非在生物學領域的全面勝任

  • 人工超級智慧(ASI) — DeepMind 報告的評論 III:即使 Legg–Hutter 分數隨運算量平順變化,具體能力輪廓相對人類水準仍呈鋸齒狀

  • Transformative Creativity — 「創造力(如同研究品味)可能只是 AI 目前做不到、但終將掌握的另一種能力」,呼應笑話/心智理論的先例

  • Loop Engineering — 「保持在迴圈中,把它們當工具」是無人看管的迴圈導致認知屈從這種失效模式的解方;在鋸齒狀幽靈上運行的自我提示迴圈,會讓洗車場失誤在無人監督下發生

  • 代理式程式設計中的專業回報 — 留在迴圈中能帶來可量化的回報:在 Anthropic 的 400K 次工作階段資料中,專家能從代理程式的尖峰失誤中恢復(有問題工作階段中的驗證成功率從 4% 升至 15%),新手則放棄任務(19% 對上 5–7%)

  • 情境優勢,而非品味 — Andrew Ng 以另一種觀點取代本頁對品味的框架:「AI 目前做不到但終將掌握的能力」預設品味是一種能力;而他將其理解為資訊不對稱

  • 開放權重與前沿模型的差距 — 整體 Arena Elo 會把山脊平均成平地;小型 Gemma 模型在推理上的勝利和知識上的損失,都消失在單一數字裡

  • 受運算量控制的基準測試 — 壓縮比較受到思考模式混淆,這讓推理與知識的對照更清楚,而非更薄弱

  • Gemma 4 — 經過量測的案例:推理能力壓縮 10×,儲存知識卻沒有

  • 無參考裁判的過度歸功 — 品味獎勵可能由什麼構成:在真相可驗證的任務上進行量測後發現,針對無參考裁判進行最佳化,大幅提高獎勵(0.716 → 0.938),卻完全沒有提升底層能力(0.209 → 0.202)。對本頁具有延伸意義的是這個上限——差距最多為 1 − accuracy,因此最容易出現虛假平滑效果的區域,正是谷底;高準確率的峰值則沒有可利用的差距(TruthfulQA 的基準值為 0.893,差距 −0.041)。鋸齒狀表現讓代理獎勵變得危險,卻無法修正它

  • 訊號消失時的監督:啟動值回退與品味獎勵 — 評估將品味納入 RL 組合的問題:以今日的裁判架構,預測結果是代理訊號平滑化(品牌風格填補谷底),而非真正的品味峰值

開放問題#

  • Karpathy 承認,這個框架可能沒有「真正的力量」。「幽靈對上動物」是承載論點的核心概念,還是只提供有用直覺、卻不會改變具體決策的思考工具?
  • 如果把品味/美學/簡潔納入 RL 組合,這些維度上的鋸齒狀表現會變得平滑嗎——還是它們太難驗證,無法乾淨地作為獎勵(參見可驗證性論點)?部分已有答案:訊號消失時的監督:啟動值回退與品味獎勵——二選一的問題導向第三種結果:品味獎勵是無參考 LLM 裁判訊號(實測過度歸功最嚴重的情況,而且完全只反映評分者偏好——可被最大程度地操弄),所以預測結果是代理訊號平滑化——谷底由自信的品牌風格填補,而非真正的品味峰值;具有約束力的是評估者獨立性+以參考為依據,而非原理上能否驗證。預測獲得佐證(2026-08-04),見 Zhou (2026):該研究在真相可驗證、因此能受審核的領域進行實驗:針對無參考裁判執行 RL,獎勵從 0.716 升至 0.938,但留出的錨點顯示它所代表的事物停留在 0.209 → 0.202;參照標準獎勵的控制組確認裁判是成因,而論文自身的關鍵變項——「裁判是否獨立於候選答案,而非其能力」——正是知識庫中的「評估者獨立性」概念更精確的版本。一項修正:預測的吸引子是品牌風格,實測的吸引子卻完全沒有風格特徵(遭到駭入的輸出更短,結構也很乾淨)。**標籤從 #oq/now → #oq/source 重新歸類:**綜合分析已做過兩次,剩下的是領域遷移問題,而非推理缺口——整個結果之所以可見,只因為存在一個隱藏錨點;而在品味領域,同樣的分歧會因設計而無法察覺。要解決這個問題,需要有實驗室報告品味/簡潔的 RL 執行結果,或證明一項已承諾的判斷能在沒有任何精確匹配可供承諾的輸出上維持不變。

資料來源#

§ end
Cited by 37
Related articles
  • Open Questions Backlog

    Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…

  • Verification as the New Bottleneck

    Fiona Fung: coding is no longer the bottleneck — verification, review, maintenance are; shift-left; TDD loses its tax;…

  • Large-Scale Test-Time Compute

    Noam Brown's thesis that model capability is now a function of inference budget (tokens/cost/time): with good scaffoldi…

  • The Verifiability Thesis

    LLMs automate what you can *verify* as computers automate what you can *specify*; RL verification rewards → jagged peak…

  • Andrew Ng

    Founder of DeepLearning.AI and AI Fund, founding lead of Google Brain, co-founder of Coursera; writes The Batch, where…