資料來源#
- Building Prod with Jev and LangGraph
- Inside the JEV Ecosystem: 13 Answer Verifiers on One Test Set
- Introducing System One Models & Jev
這是什麼#
TypeSafe AI 推出的首款公開模型,由創辦人 Diogo Almeida(曾任職 OpenAI;他表示曾參與 ChatGPT 背後的指令遵循研究)於 2026-09-15 開放早期體驗,當時公司已秘密開發兩年。TypeSafe 將這類模型稱為 System One Models,名稱取自 Kahneman 對快速與慢速思考的區分;Jev 則以 William Stanley Jevons 命名,押注智慧成本每下降一個數量級,用量就會增加超過一個數量級。其一句話主張是:「前沿智慧的函式呼叫:輸入非結構化狀態,輸出具型別的機率決策。」 以下內容均出自發布文章,除非另有來源,否則屬於 vendor-claim。
- 不是 LLM,也不輸出字串。 輸出空間預先宣告(每個問題可輸出 bool、score 或 choice);所有輸出會在一次查詢中平行產生,而非逐一產生 token。choice 的基數最高可達 255;超過此上限時,廠商會先評分、再選擇,速度會明顯變慢。
- 以 RLCD 訓練——「Reinforcement Learning for Calibrated Decisions」(校準決策強化學習):其目標是讓模型在 System One 任務上給出符合認知誠信的機率,並明確對比 RLHF(偏好文字評分者青睞的輸出)和 RLVR(可用程式檢查的輸出;廠商稱這種方法在判斷任務上會產生「尖峰化/不穩健的智慧」)。目前未公開演算法細節;訓練資料全由內部合成(「主要是一間資料研究實驗室」)。
- 價格與速度。 每百萬輸入 token 收費 $0.042,輸出不計費;端到端耗時 70–500 毫秒(相較之下,前沿 LLM 的報價為 3–329 秒)。廠商承認無法證明這個價格沒有補貼。
- 型別錯誤。 依設計為 0%——綱要比對有保證,因此錯誤率圖表中的 0% 標線明確標示為非實證數據。
獨立測量結果#
第三方數據僅見於 Typed Decision Verifiers:在 Proto_AGI 共用的 2,018 筆答案正確性資料集(empirical)上,Jev 的 AUC 為 0.7350,與 VIDRAFT 的 ZTC 397B 在統計上並列第一,高於 GPT-5.2(0.7148);每 1,000 次呼叫的成本約為 $0.024,相較之下約 $0.55。但若把它當成預算上限為 20% 的重試閘門,端到端代理程式準確率只變動 −0.07pp,也就是「修好的錯誤和弄壞的正確答案差不多一樣多」,因為它導向重試的 403 筆項目中,有 216 筆原本就正確。同一研究指出,Convai 的 Laya(每次呼叫約 0.015 秒)「比我們測得的託管 API 快約 140 倍」;依上下文推測,該 API 幾乎可以確定是 Jev,換算後每次呼叫約需 2 秒,遠高於廠商宣稱的 70–500 毫秒區間(廠商也提醒,自家的延遲評估是在靠近服務的美國西岸筆電上執行;該研究沒有說明用戶端位置或輸入長度)。該研究的獨立性也沒有最初記錄時看來那麼明確——詳見 Typed Decision Verifiers 的利益衝突說明。圍繞 Jev 的生態系——ZTC、開源重製版 open-jev、Laya——之所以出現,是因為 Jev 為這個類別命了名。
在合作夥伴的編排流程中(LangChain,2026-09-25)#
第二份第一手說明並非來自 TypeSafe,而是來自整合合作夥伴: Building Prod with Jev and LangGraph(Sydney Runkle 與 Hunter Lovell,LangChain 部落格,vendor-claim——LangChain 銷售文章展示的 LangGraph 執行環境和 LangSmith 追蹤工具)。文章補充三項數據,均非 TypeSafe 提供,也都沒有說明測量方法:
- 探索審查:分類步驟比 Sonnet 快 5–6 倍。 一個 LangGraph 圖表會針對每個訴訟頁面一次詢問 Jev 三個問題(是否需要回應?是否包含 PII?是否可能享有特權?),每個答案都會對應到一種處理路徑——擱置、由 LLM 遮蔽資料,或觸發
attorney_review中斷,暫停圖表並交由人工處理。在同一個圖表中以 Sonnet 取代 Jev 作為分類器後,「在多次試驗中」分類步驟慢了 5–6 倍。文章未提供準確度、一致率、頁數或 Sonnet 版本,只有速度數據。 - 100 次重複執行中的評審穩定性。 在「Jev 作為評審者的早期實驗」中,其分數「在 100 次重複執行中幾乎沒有變動,遠低於我們測試過的任何 LLM 評審者」。文章沒有列出數值、任務或評審者名稱。這裡測的是執行間的一致性,與校準或準確度是不同特性——確定性函式可以完全一致,也可以一致地出錯。
- Browserbase Stagehand
act():中位延遲從 1.97 秒降至 0.46 秒(約快 4.3 倍)。 Stagehand 標記頁面上的互動元素;Jev 選擇動作類型及最佳候選元素;任何信心低於 0.7 的決策都會改由 LLM 處理。數據來自「早期測試」,由 Browserbase 提供並經轉述;沒有任務成功率或後備處理比率數據。
文章的說法是,Jev「從前沿 LLM 套裝中取出一項能力——判斷——並把它變成便宜到不必計量的基本元件」,部署方式則是**「預設低成本,例外時才使用前沿模型」**(Jaya Gupta 所說的「智慧大拆分」)。這將 Jev 定位為依信心門檻升級模型的串接流程中的第一階段,而非 LLM 的替代品:「Jev 並未完全取代多數使用情境中的 LLM。」文章將 TypeSafe 的基準測試重述為「速度最高可快 200 倍、價格便宜 400 倍」(將發布文章的 193.6 倍/444.6 倍四捨五入)。唯一的採用訊號,是一則尚無其他佐證的開發者引言:「我現在基本上正把手上的每個代理程式都改成由 Jev 驅動的工作流程。」
相關連結#
- Typed Decision Verifiers——定義這個類別;該頁同時收錄發布時的宣稱及用來檢驗它們的獨立排行榜
- Trained Calibration——RLCD 是廠商命名的第四種校準訓練途徑:把校準當成決策模型的完整目標,而非加在聊天模型上的誠信功能
- The Bitter Lesson——廠商提出的反向標語「最苦澀的教訓」:與資料、運算或演算法相比,針對正確任務最佳化更重要
- Crystallizing Agent Work into Workflows——Jev 主打的用途(在手寫控制流程中充當「聰明的 if 陳述式」),就是該頁所述、以模型產品形式銷售的 Type 2 混合式執行;LangChain/LangGraph 文章則直接建構了這種 Type 2 型態,背後沒有升級路徑
- Reasoning–Acting Interleaving (ReAct)——Stagehand 的
act()重建,將該頁所述「從列舉的有效集合中,以分類方式選擇動作」實際部署於正式環境,而 Jev 的 255 種 choice 基數就是列舉上限 - Cost-per-Task Over Cost-per-Token——「預設低成本,例外時才使用前沿模型」:Jev 作為依信心門檻升級之串接流程中的低成本第一階段
資料來源#
- Introducing System One Models & Jev——Diogo Almeida,TypeSafe AI 部落格,2026-09-15,
vendor-claim:比較表、工作流程評估的 Pareto 圖、結構化輸出/工具呼叫錯誤率圖表、常見問答。攝取資料時從圖片轉錄圖表數值;散點數值為近似值(對數座標軸) - Inside the JEV Ecosystem: 13 Answer Verifiers on One Test Set——Proto_AGI(
mayafree),HuggingFace,2026-09-20,empirical:獨立 AUC 排行、重試閘門實驗及託管 API 延遲比較 - Building Prod with Jev and LangGraph——Sydney Runkle 與 Hunter Lovell,LangChain 部落格,2026-09-25,
vendor-claim(整合合作夥伴;銷售 LangGraph/LangSmith):探索審查圖表及其相較 Sonnet 快 5–6 倍的分類速度、100 次執行的評審穩定性宣稱、Browserbase 的 Stagehandact()延遲(轉述數據)、三種建置方式圖,以及 LangSmith 決策檢視畫面截圖(編譯時閱讀;範例頁面上的contains_pii= 0.98)
Cited by 8
- Typed Decision Verifiers×3
LangChain's integration post (Runkle & Lovell, vendor-claim — a Jev integration partner selling the…
- Cost-per-Task Over Cost-per-Token
The cascade form: "cheap by default, frontier on exception" (LangChain, 2026-09-25). LangChain's…
- Crystallizing Agent Work into Workflows
The product pitch is the other half. TypeSafe sells Jev as the model built for this seat — "smart…
- LLM-as-a-Judge
A property the limits above take for granted: an LLM judge asked the same question twice can answer…
- MCP and Computer Use
The latency can be split off the model (2026-09). Browser automation is where the "very slow"…
- Entities — People, Orgs, Tools & Projects
Jev — TypeSafe AI's first 'System One Model' (early access, 2026-09-15): a non-LLM,…
- Reasoning–Acting Interleaving (ReAct)
It shipped in browser automation, as a separate model (2026-09). LangChain's Jev integration post…
- Trained Calibration
Every recipe above adds calibration to a model whose main job is producing text. TypeSafe AI's Jev…
Related articles
- Typed Decision Verifiers
A structured-verdict verifier (boolean/choice/ordinal, zero generated tokens) scored against 12 rivals on one shared 2,…
- Harness Shrinkage as Models Improve
Prompt scaffolding shrinks each model release; Cat Wu's pruning discipline; Boris Cherny "100 lines of code a year from…
- Agent Quality Flywheel
Google's eval-fix loop packaged as a skill your coding agent drives: Build & Test → Ship & Monitor → Learn & Refine, ex…
- Confident But Unsure
The model states a final answer its own reasoning cannot support — presenting an educated guess as analysis, or silentl…
- Deep Research Agents
Agentic systems that decompose a complex query, iteratively search diverse sources, and synthesize a structured, cited…
