H
Howardism
Plate IIEntities機器翻譯 · machine-translatedENHOWARDISM

Jeff Dean

Google 的首席科學家;打造了 MapReduce、BigTable、TensorFlow 和 TPU,並共同撰寫 2014 年遭 NeurIPS 拒稿的知識蒸餾論文,如今這項技術讓 Gemini 的 Flash 模型能以低成本產生。他一再採用的方法是用餐巾紙計算找出瓶頸——RAM 搜尋(2001)、語音需求會讓伺服器群翻倍(2013)——而他在 2026 年給創辦人的建議是 1% 法則:在模型有 0–1% 機率失敗的地方打造產品,而非失敗率 20% 的地方

Article metadata
Publication details
Published:August 9, 2026
Filed:Entity
Domain:Entities
Tags:EntityPersonGoogleResearcherSystems
Reading:8 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

Jeff Dean 的插圖

資料來源#

摘要#

Jeff Dean 自 1999 年起便在 Google 擔任首席科學家(他加入時,Google 還是「一家 20 人的新創公司」)。他的建造成果構成了現代機器學習多數系統所依賴或用來訓練的基礎:MapReduce、BigTable、TensorFlow、TPU 和 Gemini。他也撰寫了 Latency Numbers Every Engineer Should Know,這份分散式系統推理所依據的經典數量級表格;並與 Geoff Hinton 和 Oriol Vinyals 合著 2014 年的知識蒸餾論文——NeurIPS 曾以「不太可能造成重大影響」為由拒稿,如今這項技術能從 Pro 系列產生 Gemini 的 Flash 模型。

在這份資料集中,他只出現一次:在一場 57 分鐘的 YC Startup School 2026 對談中接受 Diana Hu 訪問(practitioner-opinion;請留意既存的利益衝突——他是 Google 的首席科學家,談論 Google 的硬體;以下 TPU 效率數據出自他的個人回憶,並非引用的測量結果)。

方法:用餐巾紙計算找出瓶頸#

Dean 最常被引用的兩則起源故事,其實是同一招用了兩次——找出瓶頸,從基本原理計算其數量級,再問換個設計點能否讓它改善 10–100 倍。

  • 2001 年,RAM 搜尋。 他和 Sanjay Ghemawat 算出,Google 的整個搜尋索引能放進他們現有機器的總 RAM 中,並在「幾天內」推出從硬碟改用 RAM 的版本。這就是 Google 搜尋速度快的原因。
  • 2013 年,TPU。 深度學習語音模型剛讓字錯率減半——「相當於在短短幾個月內取得語音辨識 20 年的進展」——但成本遠高於舊系統。餐巾紙上的計算是:如果每位使用者每天對著手機說話三分鐘,Google 就必須讓伺服器群規模翻倍。解方是一款專為低精度密集線性代數打造、除此之外什麼也做不了的晶片——「它跑不了 Chrome 或 Word」——兩年後推出時,能源效率比當時的 CPU 和 GPU 高出 30–80 倍,延遲則低 20–30 倍。

TPU 的故事帶出一個他明確提出、卻容易被忽略的設計教訓:這款晶片是在 Transformer 出現之前打造的,因此刻意只專門化到通用線性代數的層級。「我們知道機器學習演算法還在演進,所以不想過度專門化,但也希望專門化到足夠的程度。」這場賭注押在運算形式上,而非將使用它的架構。

他給創辦人的建議是採用這套方法,而不是照抄答案:「仔細審視問題,想想不一定要受限於問題今天的解法,而是從基本原理出發,你會怎麼解決……找出好一個數量級或兩個數量級的解法。」

他認為下一個瓶頸在哪裡#

  • 推論硬體,而非訓練硬體。 對於「2026 年的『能放進記憶體』時刻是什麼」這個問題,他的答案是高效能、低能耗的推論晶片。「想像一下,如果延遲能低 50 倍,你能做到什麼。」具體方向包括:盡量減少資料搬移;選定少數幾種極低精度,並只在硬體中實作這些精度。
  • 能源是衡量單位,而資料搬移是主要耗能來源。 一次乘法約耗費一個皮焦耳;從 HBM 搬入運算元的成本大約是它的1000 倍。分批處理的唯一目的就是攤平這個比例——「改成支付一千倍除以批次大小」——這正是分批處理與低延遲在結構上相互牴觸的原因。詳見推論效率即能力。
  • AI 版的延遲數字表格。 有人請他更新自己的清單,他列出:從加速器主記憶體到晶片上記憶體、再到乘法器單元的頻寬;每次乘法的能源消耗;晶片間互連頻寬;這種頻寬能連接多少晶片;以及需要 10,000 顆而非 500 顆晶片時的效能下滑。

留下紀錄的預測(2026)#

  • 2027 年:自動化機器學習實驗。 機器學習系統將目標拆成子問題,逐一放進緊密的自動化實驗迴圈中執行,然後重新整合結果,藉此改善自身——「任何有可衡量目標的事情」。參見遞迴自我改進。
  • 代理程式連續執行數天或數週。 他提出一個廣為流傳但錯誤的看法:人們低估了代理程式能持續執行多久。他舉例說明已經行得通的做法——用另一種語言重新實作整套系統,以獲得更好的安全性或效能;這之所以可行,正是因為既有程式碼本身就是規格。
  • 回頭評估自己先前的預測。 2025 年 5 月,他曾說 AI 已達初階工程師水準;到了 2026 年,他認為這個預測「相當準確」,並指出自己低估了兩點:任務複雜度成長的速度,以及有多少進展會落在程式設計以外的領域。

1% 法則#

這是他在此最值得引用的主張,也有自己的專頁:用一般模型測試你考慮投入的問題,並且在模型有 0–1% 機率成功的地方打造產品,而非成功率 20% 的地方——只有部分成功,才表示這項能力正在到來。完整說明及其與為下一代模型打造產品的直接衝突,請見楔子選擇的 1% 法則。

值得借鑑的做法#

  • 把自己的最佳化迴圈做成一項技能。 他和 Ghemawat 寫了一項技能,教模型如何執行他們的微基準測試工作流程——測量、修改、重新執行、擴大基準測試範圍、測量快取占用量、反覆迭代——讓代理程式能無人值守地執行整個迴圈。「說到底,就是把我們身為人會採用的方法,用模型能使用的形式交給它。」人類可讀的前身已公開:一份約 30 頁的 Performance Hints 文件,由他和 Ghemawat 撰寫;有人將其摘要放進模型上下文,藉此提升效能推理能力。
  • 透過評分自己的預測培養品味。「寫下你認為未來 12 個月可能重要的許多事情……12 個月後回頭評估,看看哪些事情確實顯得重要,或是世界上其他人實際著手創造了哪些東西。」這是一套刻意產生樣本的流程,適用於通常被視為天生具備的技能——參見研究品味是人類的瓶頸。
  • 進行違反產業創立假設的思想實驗。 他目前的例子是:60 年來,晶片製造都假設同一設計的每顆晶片完全相同,且不會有任何位元翻轉。大型分散式系統則採取相反假設,在不可靠元件之上建立可靠性(複製、Reed–Solomon)。那麼,如果使用的電晶體每天出錯 20 次,而非一百萬年才出錯一次,你會打造什麼?像大腦一樣具備冗餘訊號路徑的系統。他謹慎補充,這類實驗大多會因正當理由而失敗——「但時不時重新檢視一下仍是好事。」
  • 累積工具,而非頭銜。 職涯方面,他建議打造一套「很棒的工具帶」,並持續增添工具,因為「你永遠不知道何時會碰上某個問題,需要這四項專門工具,而非那三項。」

延伸閱讀#

  • 楔子選擇的 1% 法則——他提出的 0–1% 而非 20% 啟發式,說明新創公司應打造什麼;此頁面以它為核心
  • Google DeepMind——他引用其 Gemini、AlphaFold、AlphaEvolve 和 AlphaChip 研究成果,說明未來發展的樣貌;也是雇主的研究部門
  • 推論效率即能力——他的能源與資料搬移論點是此頁架構層級槓桿的基礎:皮焦耳與 1000 倍的比例,解釋了每項槓桿為何存在
  • 遞迴自我改進——他的 2027 年預測(自動化實驗迴圈),以及讓這些實驗更經濟的機制(學得的替代驗證器)
  • 研究品味是人類的瓶頸——他指出代理程式寫下一切之後,品味會成為稀缺技能,並提出培養品味的方法
  • 為下一代模型打造產品——若把他的 1% 法則解讀為市場選擇,而非功能選擇,該策略便與之相牴觸
  • Large-Scale Test-Time Compute——他對長時間執行代理程式提出的多代理程式加評估器方案,本質上是推論時搜尋,由硬體架構師提出
  • 苦澀的教訓——他的 TPU 設計原則(專門化運算,而非架構),是將苦澀的教訓應用於晶片,而非模型

資料來源#

  • Jeff Dean: The 1% Rule for Building in AI — The 1% Rule for Building in AI,YC Startup School 2026,Diana Hu 訪問(2026-07-30 發布,57 分鐘,practitioner-opinion)。YC 官方逐字稿,非機器轉錄。**利益衝突:**Google 首席科學家談論 Google 的硬體和模型;TPU 效率與延遲倍數是第一手回憶,沒有附上引用來源
§ end
Cited by 12
Related articles
  • Harness Shrinkage as Models Improve

    Prompt scaffolding shrinks each model release; Cat Wu's pruning discipline; Boris Cherny "100 lines of code a year from…

  • The Bitter Lesson

    Sutton 2019: scaled general methods beat hand-engineered structure; recurring justification across the wiki for dissolv…

  • CS329A: Self-Improving AI Agents (Stanford)

    Stanford's graduate course on self-improving agents, taught by Azalia Mirhoseini and Aakanksha Chowdhery (Autumn 2025,…

  • Claude Code

    Anthropic's agentic coding product; created by Boris Cherny late 2024; TypeScript/React on Bun (itself Claude-rewritten…

  • Gemma 4

    Google DeepMind's July 2026 open-weight multimodal family (Apache 2.0): 2.3B–31B dense plus a 26B/4B-active MoE, adding…