H
Howardism
Plate IIEntities機器翻譯 · machine-translatedENHOWARDISM

Jev

TypeSafe AI 首款「System One Model」(2026-09-15 開放早期體驗):這是一種非 LLM、非自迴歸模型,透過 RL 訓練以實現 Calibrated Decisions(RLCD),能接收非結構化狀態,並在單次平行推論中回傳具綱要型別的決策(bool / score / choice,基數 ≤255)及經校準的機率——廠商宣稱其工作流程準確度可比前沿模型,速度約快 194 倍、成本約低 445 倍,且依設計不會產生型別錯誤;獨立測量顯示,它在共用的 13 系統答案驗證 AUC 排行中並列第一,但作為重試閘門的淨效益為零;LangChain 的整合文章(vendor-claim)補充合作夥伴一側的速度數據(在探索審查分類步驟上比 Sonnet 快 5–6 倍;Browserbase Stagehand act() 中位數延遲從 1.97 秒降至 0.46 秒,信心低於 0.7 時改用 LLM),並將它定位為「例外時才升級至前沿模型」流程中的低成本第一階段

Article metadata
Publication details
Published:September 29, 2026
Filed:Entity
Domain:Entities
Tags:EntityLLM ModelTyped DecisionsCalibration
Reading:7 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

Jev 的插圖

資料來源#

這是什麼#

TypeSafe AI 推出的首款公開模型,由創辦人 Diogo Almeida(曾任職 OpenAI;他表示曾參與 ChatGPT 背後的指令遵循研究)於 2026-09-15 開放早期體驗,當時公司已秘密開發兩年。TypeSafe 將這類模型稱為 System One Models,名稱取自 Kahneman 對快速與慢速思考的區分;Jev 則以 William Stanley Jevons 命名,押注智慧成本每下降一個數量級,用量就會增加超過一個數量級。其一句話主張是:「前沿智慧的函式呼叫:輸入非結構化狀態,輸出具型別的機率決策。」 以下內容均出自發布文章,除非另有來源,否則屬於 vendor-claim。

  • 不是 LLM,也不輸出字串。 輸出空間預先宣告(每個問題可輸出 bool、score 或 choice);所有輸出會在一次查詢中平行產生,而非逐一產生 token。choice 的基數最高可達 255;超過此上限時,廠商會先評分、再選擇,速度會明顯變慢。
  • 以 RLCD 訓練——「Reinforcement Learning for Calibrated Decisions」(校準決策強化學習):其目標是讓模型在 System One 任務上給出符合認知誠信的機率,並明確對比 RLHF(偏好文字評分者青睞的輸出)和 RLVR(可用程式檢查的輸出;廠商稱這種方法在判斷任務上會產生「尖峰化/不穩健的智慧」)。目前未公開演算法細節;訓練資料全由內部合成(「主要是一間資料研究實驗室」)。
  • 價格與速度。 每百萬輸入 token 收費 $0.042,輸出不計費;端到端耗時 70–500 毫秒(相較之下,前沿 LLM 的報價為 3–329 秒)。廠商承認無法證明這個價格沒有補貼。
  • 型別錯誤。 依設計為 0%——綱要比對有保證,因此錯誤率圖表中的 0% 標線明確標示為非實證數據。

獨立測量結果#

第三方數據僅見於 Typed Decision Verifiers:在 Proto_AGI 共用的 2,018 筆答案正確性資料集(empirical)上,Jev 的 AUC 為 0.7350,與 VIDRAFT 的 ZTC 397B 在統計上並列第一,高於 GPT-5.2(0.7148);每 1,000 次呼叫的成本約為 $0.024,相較之下約 $0.55。但若把它當成預算上限為 20% 的重試閘門,端到端代理程式準確率只變動 −0.07pp,也就是「修好的錯誤和弄壞的正確答案差不多一樣多」,因為它導向重試的 403 筆項目中,有 216 筆原本就正確。同一研究指出,Convai 的 Laya(每次呼叫約 0.015 秒)「比我們測得的託管 API 快約 140 倍」;依上下文推測,該 API 幾乎可以確定是 Jev,換算後每次呼叫約需 2 秒,遠高於廠商宣稱的 70–500 毫秒區間(廠商也提醒,自家的延遲評估是在靠近服務的美國西岸筆電上執行;該研究沒有說明用戶端位置或輸入長度)。該研究的獨立性也沒有最初記錄時看來那麼明確——詳見 Typed Decision Verifiers 的利益衝突說明。圍繞 Jev 的生態系——ZTC、開源重製版 open-jev、Laya——之所以出現,是因為 Jev 為這個類別命了名。

在合作夥伴的編排流程中(LangChain,2026-09-25)#

第二份第一手說明並非來自 TypeSafe,而是來自整合合作夥伴: Building Prod with Jev and LangGraph(Sydney Runkle 與 Hunter Lovell,LangChain 部落格,vendor-claim——LangChain 銷售文章展示的 LangGraph 執行環境和 LangSmith 追蹤工具)。文章補充三項數據,均非 TypeSafe 提供,也都沒有說明測量方法:

  • 探索審查:分類步驟比 Sonnet 快 5–6 倍。 一個 LangGraph 圖表會針對每個訴訟頁面一次詢問 Jev 三個問題(是否需要回應?是否包含 PII?是否可能享有特權?),每個答案都會對應到一種處理路徑——擱置、由 LLM 遮蔽資料,或觸發 attorney_review 中斷,暫停圖表並交由人工處理。在同一個圖表中以 Sonnet 取代 Jev 作為分類器後,「在多次試驗中」分類步驟慢了 5–6 倍。文章未提供準確度、一致率、頁數或 Sonnet 版本,只有速度數據。
  • 100 次重複執行中的評審穩定性。 在「Jev 作為評審者的早期實驗」中,其分數「在 100 次重複執行中幾乎沒有變動,遠低於我們測試過的任何 LLM 評審者」。文章沒有列出數值、任務或評審者名稱。這裡測的是執行間的一致性,與校準或準確度是不同特性——確定性函式可以完全一致,也可以一致地出錯。
  • Browserbase Stagehand act():中位延遲從 1.97 秒降至 0.46 秒(約快 4.3 倍)。 Stagehand 標記頁面上的互動元素;Jev 選擇動作類型及最佳候選元素;任何信心低於 0.7 的決策都會改由 LLM 處理。數據來自「早期測試」,由 Browserbase 提供並經轉述;沒有任務成功率或後備處理比率數據。

文章的說法是,Jev「從前沿 LLM 套裝中取出一項能力——判斷——並把它變成便宜到不必計量的基本元件」,部署方式則是**「預設低成本,例外時才使用前沿模型」**(Jaya Gupta 所說的「智慧大拆分」)。這將 Jev 定位為依信心門檻升級模型的串接流程中的第一階段,而非 LLM 的替代品:「Jev 並未完全取代多數使用情境中的 LLM。」文章將 TypeSafe 的基準測試重述為「速度最高可快 200 倍、價格便宜 400 倍」(將發布文章的 193.6 倍/444.6 倍四捨五入)。唯一的採用訊號,是一則尚無其他佐證的開發者引言:「我現在基本上正把手上的每個代理程式都改成由 Jev 驅動的工作流程。」

相關連結#

  • Typed Decision Verifiers——定義這個類別;該頁同時收錄發布時的宣稱及用來檢驗它們的獨立排行榜
  • Trained Calibration——RLCD 是廠商命名的第四種校準訓練途徑:把校準當成決策模型的完整目標,而非加在聊天模型上的誠信功能
  • The Bitter Lesson——廠商提出的反向標語「最苦澀的教訓」:與資料、運算或演算法相比,針對正確任務最佳化更重要
  • Crystallizing Agent Work into Workflows——Jev 主打的用途(在手寫控制流程中充當「聰明的 if 陳述式」),就是該頁所述、以模型產品形式銷售的 Type 2 混合式執行;LangChain/LangGraph 文章則直接建構了這種 Type 2 型態,背後沒有升級路徑
  • Reasoning–Acting Interleaving (ReAct)——Stagehand 的 act() 重建,將該頁所述「從列舉的有效集合中,以分類方式選擇動作」實際部署於正式環境,而 Jev 的 255 種 choice 基數就是列舉上限
  • Cost-per-Task Over Cost-per-Token——「預設低成本,例外時才使用前沿模型」:Jev 作為依信心門檻升級之串接流程中的低成本第一階段

資料來源#

  • Introducing System One Models & Jev——Diogo Almeida,TypeSafe AI 部落格,2026-09-15,vendor-claim:比較表、工作流程評估的 Pareto 圖、結構化輸出/工具呼叫錯誤率圖表、常見問答。攝取資料時從圖片轉錄圖表數值;散點數值為近似值(對數座標軸)
  • Inside the JEV Ecosystem: 13 Answer Verifiers on One Test Set——Proto_AGI(mayafree),HuggingFace,2026-09-20,empirical:獨立 AUC 排行、重試閘門實驗及託管 API 延遲比較
  • Building Prod with Jev and LangGraph——Sydney Runkle 與 Hunter Lovell,LangChain 部落格,2026-09-25,vendor-claim(整合合作夥伴;銷售 LangGraph/LangSmith):探索審查圖表及其相較 Sonnet 快 5–6 倍的分類速度、100 次執行的評審穩定性宣稱、Browserbase 的 Stagehand act() 延遲(轉述數據)、三種建置方式圖,以及 LangSmith 決策檢視畫面截圖(編譯時閱讀;範例頁面上的 contains_pii = 0.98)
§ end
Cited by 8
Related articles
  • Typed Decision Verifiers

    A structured-verdict verifier (boolean/choice/ordinal, zero generated tokens) scored against 12 rivals on one shared 2,…

  • Harness Shrinkage as Models Improve

    Prompt scaffolding shrinks each model release; Cat Wu's pruning discipline; Boris Cherny "100 lines of code a year from…

  • Agent Quality Flywheel

    Google's eval-fix loop packaged as a skill your coding agent drives: Build & Test → Ship & Monitor → Learn & Refine, ex…

  • Confident But Unsure

    The model states a final answer its own reasoning cannot support — presenting an educated guess as analysis, or silentl…

  • Deep Research Agents

    Agentic systems that decompose a complex query, iteratively search diverse sources, and synthesize a structured, cited…