資料來源#
- Noam Brown – Agent swarms, alignment, & recursive self-improvement
- On the Navier–Stokes Millennium Prize Problem
摘要#
每項發布前的安全評估都帶著一個未明說的假設:你能在必須推出模型之前,於更短的時間內完成評估。 Noam Brown(OpenAI,Dwarkesh Podcast,2026-09-17,practitioner-opinion)認為,兩條趨勢線正匯聚到一個讓這個假設不再成立的臨界點,而幾乎沒有人為此做準備:
「你希望它執行為期一週的任務,它就能執行一週的任務。我們大概會達到它們能執行為期一個月任務的地步,也大概會達到它們能執行為期三個月任務的地步。如果你身處一個模型能有效運作三個月、但發布週期是每兩個月一次的世界,那麼你就無法在下一個模型發布週期前,針對模型能力的完整時間跨度進行評估。」
這是 Brown 的主張,而非一項測量——他沒有說明評估需要多久、沒有公布曲線,並且明確表示*「這目前還不是問題,但很快就會成為我們必須想辦法解決的問題。」* 請把問題何時出現視為預測。這件事值得獨立成篇,而非只用一句話帶過,是因為語料庫已分別測量這兩條趨勢線,卻從未把它們放在同一個座標軸上。
兩條趨勢線#
發布節奏。 Brown 描述的發布間隔是*「最多每兩個月一次,有時更快」,而且「每週都有新的 AI 突破。」* 這是外界唯一能查證的量,而 wiki 的模型頁面就是查核依據。
時間跨度。 METR 的時間跨度曲線是 Brown 從一週 → 一個月 → 三個月這個階梯的量化版本,也是有力的外部佐證:可靠任務長度大約每四個月翻倍,這個指數成長比發布間隔縮短的速度更快。Brown 對同一成長的說法,則是拿 GPT-3 做平淡的對照——「你可以讓它反覆執行,去做長時間跨度的事情;只是它做得不太好。」 因此,改變的不是長時間執行從不可能變成可能,而是從可能變成有效;這正是為什麼評估也必須涵蓋完整時間跨度。
兩者的交會點不是單一日期,因為這兩種量並非同一類事物。 模型的時間跨度是任務分布,不是單一數值;發布節奏則是營運上的選擇。Brown 指出的是兩者的先後關係,而語料庫已呈現出這種關係:Large-Scale Test-Time Compute記錄了 UK AISI 的測試,模型在單次執行達到 100M tokens 時仍在持續進步;但基於成本,至今沒有人會以完整長度執行這種評估。很快,阻礙將從成本變成日程。
這不是算力預算問題#
最接近的既有問題是 Large-Scale Test-Time Compute提出的:「要評估危險能力,應該投入多少預算?」但這是另一個問題,也有不同的解法。
- 預算問題在於能力會隨支出形成一條曲線,因此用單一數字描述並不完整。解法是畫出曲線,而 Compute-Controlled Benchmarking說明了方法。原則上,你可以投入足夠資金,把整條曲線跑完。
- 時間跨度問題在於曲線的遠端需要你沒有的日曆時間,因為競爭對手的模型——或你自己的後繼版本——會先推出。再多資金也不能把三個月的任務縮短到兩個月的時間窗口內;這和 Brown 在2026 年 6 月談起飛時提出的日曆時間論點相同,只是焦點從研究者轉向評估者。
METR 的支出時間跨度介於兩者之間,說明為什麼實務上無法用支出取代時間:其測量中每條軌跡的成本高達 $10,000,而約 70–90% 的成本來自實驗運算,而非模型推論——也就是花在等待執行完成的時間,而非模型思考所用的 tokens。平行投入資金無法縮短序列相依流程,而安全評估最想觀察的長時間跨度行為(偏移、退化、目標置換,以及在一連串任務中逐步累積的錯位行動)本質上都是序列性的。
這些政策的版本太舊#
Brown 的第二個主張關乎制度,而且這是其中可查證的部分:
「很多安全政策是在 GPT-4 時代制定的,當時根本沒有人把這件事放在雷達上。對很多公司來說,從那時起就沒有真正更新過政策,以因應這些代理程式正在跨越非常長的時間跨度運作。」
對照語料庫中關於發布前評估的資料,落差的輪廓相當具體,而非籠統:這個 wiki 上每一種已發布的發布前方法,都受限於短於模型時間跨度的某種因素,而且沒有一種方法提到這點。
- 部署模擬會把過去真實的正式環境對話交由候選模型重播。因此,其涵蓋範圍受到前一個部署所產生的對話長度限制——依方法本身的設計,這就是新模型時間跨度的下限,因為改變的正是新模型的時間跨度。這個方法最大的優點,是推出後可以查核其預測;但這項優點不適用於先前流量從未測試過的行為。
- Musk 提出的競爭者審查方案將窗口定為可存取 API 的一到兩週。考量到能力誘發預算,這本來就是該方案的弱點;Brown 的論點又增加第二個獨立原因,說明這個窗口的形狀不對:它比被審查模型的一次執行還短。
- RSP 式能力門檻控管及其《Preparedness Framework》姊妹政策,則從另一個方向承襲了同一個假設:根據事前蒐集的證據,在某個時間點作出門檻判定。
誠實說明這個落差:這些來源都沒有聲稱涵蓋完整時間跨度,也沒有一項公布其評估實際執行到什麼時間跨度。下一份 system card 最值得檢視的就是這項缺漏,而它也列為本頁第一個待解問題。
這種退化不只是對齊問題#
Brown 主動提出一種不依賴錯位的說法,並且擴大了應該關心此事的對象:
「誰知道呢,也許能力會退化。這甚至不是對齊問題,也只是產品問題。 也許產品會在那段時間內以我們來不及充分測試的方式退化。也許對齊會退化,也許安全措施會退化。」
這和 Failures That Look Like Success記錄的單次長時間執行問題具有相同結構——第一小時表現正常,到第十二小時卻出錯——只是延伸到了發布流程。即使廠商完全沒有安全動機,也無法告訴你它的模型在第三個月會如何表現,卻還是會照常推出。
另一面:內外落差是解方的代價#
最直觀的解法——放慢發布節奏,直到評估時間足夠——正是 Brown 提出後又不願背書的做法,因為它是以能力差距作為換取評估時間的代價:
「現在你們造成了更大的差距:實驗室內部能用的東西,和外界能用的東西——我們能用的東西——以及外面的人能用的東西,彼此之間更加不同。這同樣不是理想的情況。」
他提出的具體例子是數學,但這是第一方且無法查證的說法:OpenAI 內部持有*「一個能力非常強、目前尚未對外開放、能解出不可思議數學難題的模型。不只是 Millennium Prize Problems,還有許多尚未解決的問題,人們已經能從這個模型取得解答。」* 他對這項取捨的評價是:「這是不公平的優勢。這裡存在取捨。我不知道該如何適當衡量這些取捨。」
這和能力過剩是不同的事,值得保留這項區別。 能力過剩是已發布但尚未誘發出來的能力——任何人花 $100K 就能取得,但沒有人花這筆錢。這裡的能力則是已誘發出來卻遭到保留:實驗室已投入預算、持有結果,而落差來自存取權限,而非花費多寡。兩者需要相反的介入方式。發布更便宜的能力誘發方法可以消除能力過剩;外界無論採取什麼行動,都無法填補這裡的落差。
內部一方發布了一項成果,這是第一個案例(2026-09-21)。 在訪談前九天,OpenAI 發布了[[navier-stokes-ai-claim|宣稱解決 Navier–Stokes 千禧年大獎問題的成果]](On the Navier–Stokes Millennium Prize Problem,2026-09-08,vendor-claim),聲稱成果由「能力遠勝 GPT‑6 Astra 的內部模型」產生;模型自 8 月 28 日起訓練,且在執行期間仍持續訓練。這對上文有三項影響。
它讓落差有了日期,也變得更深:遭到保留的模型不只是尚未發布,據稱其能力還比當時由第三方基準評分的發布前模型高出一個世代;而且模型在任務進行期間仍獲得改進。因此,內部趨勢線會在單次成果中移動,而非只在不同版本之間移動。
它也表明落差並非完全封閉,而這項例外很有啟發性:越過邊界的是輸出成果——一份說明、兩份 PDF 和一個 Lean repository——而模型仍留在內部。這是本頁原先框架未納入的第三種選項,介於發布模型與完全不透露資訊之間,而且是否發布完全由實驗室決定。它可以讓成果接受查核,卻不會讓能力變得可測量。
OpenAI 在公告結尾,用廠商自己的聲音重述了本頁的論點:成果「不是最終成果,而是某個時間點的快照」;實驗室正「專注於理解這個模型」;而這可能需要「更審慎地選擇進展的步調」。一家實驗室在宣布最大能力成果的同一天提出放慢發布節奏,是目前最有力的佐證,證明 Brown 描述的取捨正在被刻意採用;但若作較不寬厚的解讀,這也是一種為繼續保留模型辯護的說法。
主持人提出的發展方向,則是Dwarkesh Patel 自己的推論,不是 Brown 的主張:在一個 RSI流程中,實驗室或許會完全停止對外部署(「我們為什麼要用自己的模型幫助其他人也做 RSI?」),最後形成*「在今年年底前極度集中的權力。」* Brown 回應*「完全正確」*,認同落差確實存在,但並未認同權力集中的結論。兩者應分別標明出處。
關聯文章#
- 經濟基準的建構效度 — 同樣的發布節奏,從安全問題改讀成測量混雜因素。該頁發現,十二項基準中的主導能力因子與發布日期的追蹤程度為 R² = 0.505,因此「相隔數月發布的模型之間,大部分落差來自日曆時間」;本頁提到超前評估的發布節奏,也主導了對其所發布模型的比較。兩者最後都指向同一項無人負責的揭露事項:發布日期是排行榜上影響最大的未控制變數,卻沒有任何排行榜把它當成變數
- The Navier–Stokes AI Claim — 從落差的內部一側發布的第一項成果,也是廠商在宣布結果當天,用自己的聲音提出本頁所談的發布步調論點
- Autonomous Scientific Discovery — 落差內部一側的具體案例:由實驗室外無人能使用的模型產生的 Millennium Prize 結果;當時
沒有論文、沒有形式化(2026-09-21:OpenAI 自己的公告宣稱有一份說明、兩份 PDF 與一項 Lean 形式化——這些都不在本語料庫內,也都未經獨立查核),且在彙編時尚未經過同儕審查 - Chain-of-Thought Monitorability — 本頁的問題會壓縮的一種解方:將思維鏈監控擴展到所有連接工具的工作負載,是一項涵蓋承諾,其代價是時間,而評估窗口正逐漸縮小
- The OpenAI / Hugging Face Intrusion (July 2026) — 涵蓋缺口的實際案例:新能力推出時沒有任何為其設計的評估,而現有評估則*「看起來相當不錯」*
- 任務時間跨度的擴展 — 本頁比率的分子,也就是實際測量值:可靠任務長度大約每四個月翻倍,是 Brown 一週 → 一個月 → 三個月階梯的量化形式,也是交會點代表趨勢、而非情境假設的原因
- 支出時間跨度 — 說明為何砸錢無法解決問題:METR 自己的長時間跨度測量中,每條軌跡約 70–90% 的成本都花在實驗運算,而非推論,也就是花在等待;平行投入資金無法縮短序列相依流程
- 部署模擬 — 語料庫中最有力的發布前方法,也是本頁指出其限制的方法:重播的正式環境對話與前一個部署的流量一樣長,依方法本身的設計,這就是候選模型時間跨度的下限
- 實驗室間發布前審查 — 這項提案以週為單位說明窗口,現在又多了一個獨立理由,說明窗口的形狀不對:它比受審查模型的一次執行還短
- 責任規模化政策評估 — 這項論點指出其年代的門檻判定:根據事前蒐集的證據作出的某個時間點判斷,而 Brown 認為相關政策仍停留在 GPT-4 時代
- 潛在能力過剩 — 相似落差及其反向情形:能力過剩是已發布但未誘發的能力,可以透過增加預算來取得;本頁談的是已誘發卻遭保留的能力,實驗室外的任何事物都無法使它公開
- 開放權重能力誘發不可逆性 — 從另一側看同一種固定窗口失效:一次性的評估會以單一能力誘發預算定下安全判定,而權重一旦發布就不再有窗口
- 算力控制基準測試 — 回答預算問題的報告紀律,卻無法回答本頁的問題:成本軸能為曲線定價,卻不會說明曲線必須塞進多少日曆時間
- 看似成功的失敗 — Brown 說沒有人有時間測試的退化現象,在單次執行中的版本:長時間任務開始時通過測試,結束時卻出錯
- 智慧爆炸動態 — 同一個日曆時間論點,只是焦點從評估者轉向研究者:Brown 在 2026 年 6 月提出的煞車論點是,最高能力需要長時間執行,因此時間會成為限制;此處則是檢查模型的一方,而非提升模型能力的一方,先耗盡時間
- Large-Scale Test-Time Compute(hub)— 這個問題在預算面向的姊妹議題,也是 AISI 測試的來源;那些測試中模型在單次執行達到 100M tokens 時仍持續進步
- 遞迴自我改進(hub)— 主持人把內外落差推到極限的情境(實驗室在 RSI 期間完全停止對外部署);Brown 認同落差存在,但不同意其結論
- 評估認知與評分者操弄(hub)— 同一場訪談中提到的另一項發布前評估結構性限制:環境必須夠真實,讓模型不會認出自己正受測;在評估窗口縮短的同時,這件事也變得越來越困難
- Noam Brown — 來源;一位 OpenAI 研究者正在描述一個他無法展示給你的內部專用模型
- OpenAI — 在落差內部一側持有數學模型的實驗室
尚待解答的問題#
- 有沒有任何實驗室會公布其發布前安全評估實際執行的時間跨度,並對照其宣稱的模型時間跨度?本語料庫中沒有 system card 同時列出評估時長與任務長度能力主張,因此外界目前無法測量 Brown 所描述的落差。只要揭露一次——「這個模型的安全評估中,最長的代理程式軌跡為 N 小時」——就足以確定交會點正在接近,還是已經越過。
- Brown 將問題描述為*「目前還不是問題」,但又說它正在「快速成為問題」*。可證偽的版本是:是否有前沿模型發布時,其公布的有效任務時間跨度超過距離前一個前沿版本發布的間隔?(觸發條件:模型卡宣稱可自主運作一個月的模型,距離前一個版本發布不到一個月就推出。)
- 內外落差是第一方提出的主張,依其設計,外界無從看見——整個主張就是模型尚未開放。外界是否還有任何測量工具?還是必須取得那項本身正是缺失所在的存取權,才能測量能力差距?語料庫中最接近的案例是 Erdős 模式:後來有人利用足夠的腳手架,從公開模型重現了內部成果;但這只能事後測量,而且只限於可以重現的成果。On the Navier–Stokes Millennium Prize Problem 在 2026-09-21 提供了部分答案——第二種測量工具確實存在,但它沒有表面看起來那麼有力,而且完全由實驗室掌控。 OpenAI 公開了遭保留模型的輸出成果——一份說明、一份證明 PDF、一份 Euler PDF 和一個 Lean repository——而模型本身仍留在內部。因此,對「外界是否有任何測量工具」的回答,在一個狹義層面上是肯定的:任何人都能取得並查核一項成果,這比訪談中提供的更多,也比 Erdős 模式的事後重現更進一步。但這只算部分答案,待解標記仍保留為
#oq/source,原因有四點。這項成果只界定了一個結果,而非一項能力——證明正確與否,並不能說明模型還能做什麼、需要多少預算,或表現有多可靠。它是由發布方挑選的,因此只呈現實驗室決定展示的最佳成果;這與保留模型造成的是同一種選擇問題,只是往下游移了一步。最關鍵的部分,也就是宣稱的 Lean 形式化,只用一個子句加以描述,缺乏可查核的細節,所以即使採取狹義解讀,仍得依賴實驗室的文字說明。最後,還沒有人實際查核:截至本次彙編時,語料庫尚未取得該 repository 與兩份 PDF,因此目前的發現是這項工具存在,下一步才是使用它。
資料來源#
- On the Navier–Stokes Millennium Prize Problem — OpenAI(無署名),「On the Navier–Stokes Millennium Prize Problem」,openai.com,2026-09-08 發布,2026-09-10 更新,約 1,900 字,
vendor-claim。本文引用該文對內部模型的主張(「能力遠勝 GPT‑6 Astra」、自 2026-08-28 起訓練、執行期間持續改進)、將已發布成果視為測量工具的說法,以及公告結尾「進展與責任」一節中以一般文字提出的發布步調主張。這是第一方說法,且能力主張在結構上無從查證;該文連結的成果尚未取得。詳見The Navier–Stokes AI Claim - Noam Brown – Agent swarms, alignment, & recursive self-improvement — Noam Brown(OpenAI)與 Dwarkesh Patel,Dwarkesh Podcast,2026-09-17(
practitioner-opinion,13.7k 字,由出版方編輯並標示講者的逐字稿)。§01:01:18「內部/外部模型落差」完整段落——兩條趨勢線、一週/一個月/三個月的階梯、GPT-4 時代的政策版本、產品退化的說法,以及內部數學模型和「不公平的優勢」評語。所有數字都是第一方資訊,無從查證:Brown 描述的是 OpenAI 尚未發布的內部系統,以及他所參與競爭的市場發布節奏。同一段對權力集中的推論出自 Dwarkesh Patel,不是 Brown,文中已另行標明。來源中沒有公布任何測量、曲線或評估時長——問題何時出現仍是預測
Cited by 20
- The Navier–Stokes AI Claim×4
As a capability datum about the internal model it is the second-strongest thing in the corpus after…
- Deployment Simulation×3
On horizon, the method has a bound its own sources do not state. A replayed prefix is as long as…
- Latent Capability Overhang×3
Evaluation Horizon Vs Release Cadence — the sibling gap and its cause: capability extracted and…
- Open Questions Backlog×3
Evaluation Horizon Vs Release Cadence: The internal/external gap is asserted first-party and is…
- OpenAI×2
And an internal/external capability gap it says it cannot weigh. The same interview is the corpus's…
- The OpenAI / Hugging Face Intrusion (July 2026)×2
Evaluation Horizon Vs Release Cadence — the general form of this incident's fourth missed chance: a…
- Autonomous Scientific Discovery
Evaluation Horizon Vs Release Cadence — why this result is not available to check: the model that…
- Compute-Controlled Benchmarking
Evaluation Horizon Vs Release Cadence — the calendar version of this page's budget problem, and the…
- Chain-of-Thought Monitorability
Evaluation Horizon Vs Release Cadence — the other structural limit on pre-release evaluation from…
- Cross-Lab Pre-Release Review
Evaluation Horizon Vs Release Cadence — a second, independent reason the one-to-two-week window is…
- Economic Benchmark Construct Validity
Evaluation Horizon Vs Release Cadence — the same calendar, as a different constraint. That page has…
- Evaluation Awareness & Grader Gaming
Evaluation Horizon Vs Release Cadence — the other structural limit on pre-release evaluation from…
- Expenditure Horizon
Evaluation Horizon Vs Release Cadence — why the money axis cannot substitute for the calendar one:…
- Failures That Look Like Success
Evaluation Horizon Vs Release Cadence — this page's failure mode generalized from one run to the…
- Intelligence Explosion Dynamics
Evaluation Horizon Vs Release Cadence — the same wall-clock argument relocated from the researcher…
- Evals & Benchmarks
Evaluation Horizon Vs Release Cadence — Noam Brown's observation that the horizon a frontier model…
- Noam Brown
Evaluation Horizon Vs Release Cadence — his sharpest structural argument, and the one nobody else…
- Open-Weight Elicitation Irreversibility
Evaluation Horizon Vs Release Cadence — the same fixed-window failure arriving at the closed end of…
- Responsible Scaling Policy Evaluations
Evaluation Horizon Vs Release Cadence — the structural expiry on the point-in-time threshold…
- Task Time-Horizon Scaling
Evaluation Horizon Vs Release Cadence — this curve read as a ratio rather than a trend. If reliable…
Related articles
- Noam Brown
OpenAI research scientist and a pioneer of inference-time (test-time) compute scaling, now working on multi-agent syste…
- Responsible Scaling Policy Evaluations
Anthropic's RSP gates deployment on pre-release capability evaluations in CBRN, automated AI R&D, and high-stakes misal…
- Compute-Controlled Benchmarking
Noam Brown's critique: the single-number benchmark grid is broken because it ignores test-time compute — plot performan…
- Large-Scale Test-Time Compute
Noam Brown's thesis that model capability is now a function of inference budget (tokens/cost/time): with good scaffoldi…
- Open Questions Backlog
Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…
