資料來源#
摘要#
一家 AI 基礎設施公司(GitHub 組織 run-llama),其 Python/TypeScript 框架曾是 2023–24 年打造 RAG 應用的兩種預設方式之一。到了 2026 年,公司將自己描述為「領先的代理式文件 OCR 平台」;共同創辦人 Jerry Liu (@jerryjliu0) 在發布本頁所據的簡報時,直言這項重新定位:「如今我們的核心重點,已聚焦於供代理程式使用的頂尖文件解析。」框架依然存在,但產品已是解析器。
截至 2026 年年中,技術堆疊如下#
| 元件 | 型態 | 定位 |
|---|---|---|
| LiteParse | Apache 2.0、本機執行、CLI 或瀏覽器內執行、零雲端、零 LLM | PDF → 空間文字:每個 token 都標記 x/y/width/height/font/style,並具備區域偵測功能(標題、表格、圖表、註腳)。依 y 座標分組成列,依 x 座標分組成欄 |
| LlamaParse | 託管式、以視覺為基礎、非同步批次 API、按頁計價 | 「LiteParse 的能力止步之處。」預設輸出 Markdown——包含真正的表格、附說明文字的圖表、連結至錨點的註腳,並保留閱讀順序。parse_mode="agentic" 會逐頁執行視覺解析 |
| LlamaExtract | 輸入 Pydantic schema,輸出經驗證的型別化 JSON | 以 schema 為先的路徑,完全略過檢索流程;每個擷取值都附有頁碼 + 邊界框作為引用 |
| LlamaCloud | 託管式流程(解析 · 建立索引 · 檢索 · 擷取 · 託管式 Workflows + 追蹤記錄) | 無須自行執行基礎設施,也能進行相同的介入操作 |
| Workflows | llama_index.core.workflow — 事件驅動圖、型別化 Pydantic 事件、持久化 Context、send_event/collect_events、stream_events | 編排的基本構件;步驟是非同步函式,透過型別簽章隱式連接 |
| ParseBench | 約 2,000 頁經人工驗證的企業文件、5 個維度、arXiv 2604.08538 | 發布於 Hugging Face(開放權重模型、本機執行、無須 API 金鑰)及 Kaggle(前沿模型、託管式提交)。兩邊使用相同的評測架構 |
兩層解析器的拆分,是其中在結構上頗有意思的選擇:以 Apache 2.0 授權免費提供確定性且保留版面的核心功能,並對處理掃描頁面、密集表格及難以解析的多欄版面的視覺層收費。這也為「把預算花在上游」的論點鋪路,不必購買產品也能採取行動。
以定價與基準測試建立定位#
有兩項刻意採取的做法,與其餘技術堆疊的銷售方式形成對照;值得視為論點,而非品質事實:
- 按頁計價,而非按 token 計價。「費用固定、清楚可知、可逐項列帳。不必賭 token 用量。還沒寫程式,就能先估算一條處理 10k 份文件的流程。」公司將成本可預測性定位為直接使用通用 VLM 的差異化優勢。
- 由供應商領先的公開基準測試。 ParseBench 評分的是語意正確性,而非文字重疊程度;它公開資料集與評測架構,並以同一套尺度比較開放權重模型與前沿模型——確實很有用,同時也是 LlamaParse Agentic 登上帕累托前緣的依據。簡報本身的保留說法值得沿用:「部署前先查證——實際數字會低於供應商報價。」Document Parsing as the Retrieval Bottleneck 記錄了搭配圖表的說明文字,在哪些地方誇大了專用模型相較於高設定前沿 VLM 的優勢。
人物#
- Jerry Liu (@jerryjliu0) — 共同創辦人;他在 X 上發布這份簡報的串文(2026-05-25),將內容描述為「從 2023 到 2026,完整導覽 RAG、文件脈絡與 AI 代理程式」,並藉此說明公司如何將重心收斂至解析。
- Pierre-Loic Doulcet (@hexapode) — 116 張投影片的 AI Engineer Singapore 2026 工作坊作者與主講人;這是此知識庫唯一的 LlamaIndex 來源;Document Parsing as the Retrieval Bottleneck 全文皆據此整理。
兩人目前都還沒有自己的頁面——每人只有一個來源,因此相關主張會標註於概念頁,而非個人簡介頁。
相關連結#
- Document Parsing as the Retrieval Bottleneck — 公司的核心技術論點,也是根據其工作坊整理的頁面:瓶頸已從模型、檢索器移至文件本身。LiteParse(空間文字)、LlamaParse(Markdown)、LlamaExtract(schema 優先)與 ParseBench(衡量)是它所建議的修正技術堆疊中的四個環節。
- Crystallizing Agent Work into Workflows — LlamaIndex Workflows 是該頁抽象討論的工作流程層之具體事件驅動實作:以型別化事件作為步驟間的契約、在人類審查暫停期間保留持久脈絡,以及宣告式的扇出/扇入。
- Deep Research Agents — 深度研究是四種工作流程範例之一(拆解 → 平行子檢索 → 組合附引用的答案),其他範例包括合約審查、盡職調查,以及一種持續運作的「活知識庫」,會監看來源並重新發布事實層級的差異。
- LLM-as-Compiler Knowledge Base — 架構上的競爭方案:此知識庫採用一次編譯的 wiki,對照 LlamaIndex 每次查詢時解析並檢索的流程;雙方對於長脈絡成本降低後檢索是否仍有必要意見相左,但都認同輸入時遺失的結構無法在下游復原。
資料來源#
- Beyond RAG: Building Agentic Document Workflows with LlamaIndex — Pierre-Loic Doulcet,Beyond RAG: Building Agentic Document Workflows with LlamaIndex,AI Engineer Singapore 2026(116 張投影片,
practitioner-opinion),以及發布簡報的 Jerry Liu X 串文。全文皆有直接的供應商利益衝突:此處的產品主張來自公司自身的定位,而 ParseBench 的排名則來自供應商自己的基準測試。客戶標誌投影片經 OCR 後成為無法辨讀的文字(CCMCX、Opepsi、MIcheliN、tabst),因此未保留任何客戶名單;「Backed By」投影片上清楚顯示 Norwest 與 Greylock
Cited by 2
- Document Parsing as the Retrieval Bottleneck×3
Llamaindex — the vendor behind the deck, its parser/extraction/workflow stack, and the benchmark it…
- Entities — People, Orgs, Tools & Projects
Llamaindex — The RAG-framework company (run-llama) that narrowed its focus to document parsing for…
Related articles
- Authority and Audit Survive Abundance
Joint answer to two #oq/now questions. (1) At a model upgrade neither prescription governs the other: shrinkage governs…
- Crystallizing Agent Work into Workflows
Malik's production lifecycle at Azure Networking: treat agent exploration as a discovery mechanism, not an execution mo…
- Layerwise Omission Attribution
Rajan: omission — a decision-critical fact silently missing from an answer — is a pipeline property assignable to one o…
- Agent Systems & Harness Engineering
Map of Content for the agent-systems domain — 53 concepts. Harness engineering, agent loops and orchestration, context…
- Open Questions Backlog
Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…
