H
Howardism
Plate IIEvals & Benchmarks機器翻譯 · machine-translatedENHOWARDISM

生產環境代理程式的週期性評估

She 與 Lin(CMU/Meta,arXiv 2609.21267,採用者觀點的部署報告):在 52 天內,對生產環境分析代理程式的 519 題基準測試進行 574 次執行,按時間順序分為 287 次校準/287 次留置測試,比較隨機抽樣、歷史結果快取、固定難度分層子集,以及 Rasch/多維 2PL 自適應測試,用於對單一持續演進系統進行*週期性*評估。從 k=200 起,多維 2PL 自適應測試的分數保真度最佳(在基準測試的 38.5% 題目上 MAE 為 1.03 個百分點,Rasch 為 1.37 個百分點、隨機抽樣為 1.79 個百分點);小預算時則由難度分層固定子集勝出。但團隊仍因營運簡便而部署固定子集,而非追求準確度,並以未重新校準便移轉至另外五種代理程式系列,以及將校準期間縮短至一天而未見損失,來支持這項選擇。

Article metadata
Publication details
Published:September 25, 2026
Filed:Concept
Domain:Evals & Benchmarks
Tags:BenchmarksEvaluation MethodologyCapability EvaluationProduction EvaluationAdaptive TestingPsychometrics
Reading:12 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

生產環境代理程式週期性評估的插圖

資料來源#

摘要#

截至目前,這份 wiki 收錄的每篇效率評估論文,都是在公開、靜態基準測試上,針對受評估的不同模型回應進行校準(tinyBenchmarks/Polo et al. 2024、ATLAS、BenchPress/CollabEval)。Yining She(CMU,研究於 Meta 期間完成)與 Lei Lin(Meta)(arXiv 2609.21267,2026-09-18,empirical)則改為針對單一持續演進的生產系統,按時間排序的執行紀錄進行校準:這是一個已部署的分析代理程式,每月服務數萬名活躍使用者;隨著模型、提示、工具及周邊基礎設施變動,它會在一個包含 519 題、約需 3 小時完成的內部基準測試上反覆受評。研究使用了 52 天內收集的 574 次歷史執行,並按時間順序(而非隨機)切分為 287 次校準執行(第 1–28 天)和 287 次留置測試執行(第 29–52 天),以檢驗在過去資料上校準的方法能否向前推展至未來,而非僅能泛化至未見過的題目。

他們比較了四類方法:隨機抽樣;歷史結果快取(重用某題最近的多數決判定,而不重新執行);固定代表性子集(仿照 Polo et al. 2024,按難度分層或聚類選取,再以加權估計器或 gp-IRT 重建分數);以及以 IRT 為基礎的自適應測試(仿照 Truong et al. 2025 的 Rasch/Fisher 資訊量程序,並在此擴展為採用 D-optimal 題目選擇的多維 2PL)。從 k=200 題起,多維 2PL 自適應測試的分數保真度最佳(MAE 為 1.03 個百分點,涵蓋基準測試的 38.5%),排名保真度也最佳(k=300 時 Spearman 為 0.992)。小預算時,難度分層固定子集勝出,且在所有預算下都緊跟其後。即便如此,團隊部署的是固定子集,而非統計表現更好的自適應方法;這篇論文的核心貢獻,就是第一手記錄這項取捨,以及為證明選擇合理所做的驗證工作。

兩條「自適應測試」曲線——別混為一談#

論文的多方法主要比較(§5.1、Fig. 2、Table 1:快取、固定子集與自適應測試)以 Rasch 自適應測試代表自適應方法——其 k=200 時的 MAE 為 1.37 個百分點,在 k=200 之前略遜於固定子集 gp-IRT 的 1.40 個百分點,之後則反超。另一處 §5.3.2(Fig. 5、Table 4)則將 Rasch 與多維 2PL自適應版本比較,顯示後者在所有情況下都大幅勝出,尤其在小預算時(k=100:1.97 個百分點,Rasch 為 2.92 個百分點,隨機抽樣為 2.94 個百分點)。摘要的主要數字——k=200 時 MAE 為 1.03 個百分點(519 題的 38.5%)——是來自 Table 4 的多維 2PL 數字,而不是 Table 1 主要比較中的 Rasch 數字。若讀者把「1.03 個百分點」拿來和 Table 1 的快取/固定子集曲線相比,就是把用途不同的兩張表混在一起比較。

結果#

分數保真度#

  • k=100(19.3%)時:在非自適應方法與 Rasch 的比較中,難度分層 gp-IRT 以 2.65 個百分點領先,隨機抽樣為 2.94 個百分點,Rasch 自適應測試為 2.92 個百分點。多維 2PL 自適應測試此時已以 1.97 個百分點勝過所有這些方法,但它是在另一處單獨比較(見上文)。
  • k=200(38.5%)時:在主要比較中,Rasch 自適應測試(1.37 個百分點)超越固定子集 gp-IRT(1.40 個百分點);多維 2PL 自適應測試則以 1.03 個百分點大幅領先兩者。
  • 以 MAE 衡量,在相同執行比例下,歷史快取在整個測試範圍都居於劣勢(平均執行比例為 20.3% 時是 7.36 個百分點,降至 81.6% 時是 0.81 個百分點);在各方法共同比較範圍內,它的曲線高於其他所有方法(例如執行比例為 69.1% 時是 1.54 個百分點,而 k=350、67.4% 時,其他三種方法為 0.60–0.93 個百分點)。

快取的排名保真度與分數保真度並不一致#

快取的 Spearman/Kendall 相關性遠比單看其 MAE 所預期的更強:執行比例僅 20.3% 時,Spearman 已達 0.905;在 79.0% 時達 0.996(多維 2PL 自適應測試於 k=400、77.1% 時為 0.995)。一種方法可能保留了哪次執行表現較好,卻無法準確估計好多少——ATLAS 呈現的是相反方向的分數/排名分歧:相較於準確度,仍有 23–31% 的模型在能力排名上變動超過 10 名,儘管 Spearman 相關性為 0.96–0.99。兩篇論文合在一起顯示,分數保真度與排名保真度並非簡單地彼此包含。

與 Polo et al. (2024) 的矛盾:聚類選取器不如單一難度排序#

難度分層(擬合 Rasch 模型,按難度分層,再從每層挑出中位數題目)從 k=150(28.9%)起,便勝過兩種以聚類為基礎的選取器——歷史回應 K-means 與 IRT 特徵 K-means;這兩種選取器改編自 Polo et al. (2024) 的 tinyBenchmarks。從 k=200 起,無論使用哪種估計器,兩種聚類選取器的表現都低於隨機抽樣。這與 tinyBenchmarks 的發現直接矛盾;該研究發現,以 IRT 為基礎的(錨點)聚類在子集選取上始終有效。作者提出兩項尚未測試的假說,解釋這種反轉:(1)單一持續演進代理程式的歷史回應矩陣,可能不如由獨立訓練 LLM 組成的模型群體,具有多樣且獨特的回應模式,因此多維題目參數及其聚類較無代表性;(2)他們的子集佔基準測試的比例遠大於 tinyBenchmarks(k=100 是 519 題中的 19.3%;tinyBenchmarks 則是約 14,000 道 MMLU 題目中的 100 題,<1%)——當抽樣比例較大時,隨機抽樣本身會更準確,縮小較聰明的選取方式勝過它的空間。

部署決策:簡便優先於準確#

儘管從 k=200 起,多維 2PL 自適應測試的分數與排名保真度都較高,團隊仍部署了 難度分層固定子集,設定 k∈{100,200,300,400},讓使用者自行選擇執行成本與保真度之間的取捨。提出的理由全是營運考量,而非統計考量:固定子集在執行前就能揭示工作負載,並適合以平行方式執行問題的評估系統(自適應測試需要依序執行,並按每次執行更新能力);固定子集在每次執行中保留相同題目,方便直接比較題目層級的結果,並在代理程式演進時診斷回歸;快取則需要持續監控判定是否過時,固定子集沒有這項需求。這正是論文最具承載力的貢獻:這份 wiki 大多數評估效率文獻,只驗證方法與指標的一次對應關係;本文則第一手記錄了團隊因指標無法反映的理由,選擇指標表現次佳的方法,接著用論文其餘篇幅驗證這項選擇。

驗證部署選擇#

跨代理程式移轉#

難度分層子集及其 Rasch/gp-IRT 參數——只使用原代理程式的校準資料擬合——未經重新校準便套用至另外五種代理程式系列的 299 次執行;這些系列採用不同的框架、執行 harness、工具組及模型配置(Family A–E:51/146/56/34/12 次執行)。合併來看,gp-IRT 在 12 個預算設定中的 11 個勝過隨機抽樣;k=200 時,隨機/加權/gp-IRT 分別為 1.86/1.49/1.47 個百分點,gp-IRT 接近原始留置測試執行的 1.40 個百分點。這項優勢並非一致存在:例如在 k=400 時,Family D 的 gp-IRT 與加權估計器都輸給隨機抽樣(1.13/1.34 個百分點,隨機抽樣為 0.94 個百分點)。作者將整體結果解讀為證據,認為 IRT 擬合出的難度尺度捕捉到某種內在於題目的特徵,因此能跨代理程式系統泛化,而不只是泛化至同一系統內不同時間的執行。

校準期間敏感度#

固定校準期間結束日為第 28 天,並以 3 天為間隔,將起始日從第 1 天逐步推進至第 28 天,形成十個巢狀時間窗,涵蓋 287 次到 14 次執行;每個時間窗都重新擬合 Rasch 與 gp-IRT,並重建子集。MAE 不會隨時間窗長度單調變化——在 k=200 時,gp-IRT 的 MAE 在十個時間窗內介於 1.35–1.59 個百分點;最短時間窗(14 次執行,實際上是一天的歷史資料)達到 1.41 個百分點,與完整四週時間窗的 1.40 個百分點在統計上無法區分。作者自己的但書很重要:他們將此歸因於代理程式正處於「相對成熟的開發階段」,研究期間每日變動有限,並未聲稱此結果適用於早期階段或快速變動的代理程式。

實務建議(摘自論文)#

  • 模型、提示、工具或執行系統發生重大變更,或題目層級結果持續偏移後,應重新校準;不應依固定日曆週期校準。
  • 定期執行完整基準測試,並將其通過率與固定子集估計值比較,以衡量持續監控期間子集累積的偏移。
  • 統計保真度之外,也要考量營運特性:快取需要監控近期結果是否過時;自適應測試需要依序協調,並維護每次執行的狀態;固定子集兩者皆不需要,代價是準確度並非最高。

範圍與限制#

  • 單一組織、單一生產基準測試。跨代理程式移轉與校準期間驗證(§6)只針對已部署的難度分層固定子集進行——研究從未檢查歷史快取與自適應測試能否移轉或承受校準期間縮短,因此本文沒有證據顯示自適應測試較高的 MAE 表現,或快取雖有 MAE 卻具備排名保真度的特性,也能移轉或在短校準期間下維持。
  • 通過率 MAE 和整體排名相關性,並未直接衡量回歸偵測或營運門檻下的發布閘門決策;論文將此列為未來工作。
  • 未釋出基準測試題目、結果矩陣或實作——§3 已完整說明方法,也能在任何有逐題結果紀錄的基準測試上重現,但外界無法用原始資料獨立核驗本文內容。

關聯文章#

  • Item Response Theory for LLM Benchmarks — 共用 Rasch/2PL/Fisher 資訊量機制(ATLAS 也擬合 IRT 模型、依 Fisher 資訊量選題,並以能力精確度目標作為停止條件),但校準對象不同。ATLAS 的題庫是在靜態排行榜模型群體上擬合一次,其觀測到最大的效能退化,是跨越約一年的時間留置測試,測試對象為不同模型;本文的十個校準時間窗則全取自單一持續演進系統本身的執行歷史。其主要意外——一天的時間窗與四週的時間窗不相上下——支持的主張比「IRT 題庫能抵抗過時」更狹窄:在成熟開發階段,這個代理程式的難度排序不需要太長的回溯期間。這與該頁關於重新校準週期的開放問題有關,但尚未解答——詳見該頁註記。
  • Adaptive Stopping in Evaluation Sampling — 為該頁「降低評估成本的方法」比較增加第四個面向。optstop 會停止對每題抽取更多執行期;ATLAS 會依能力精確度停止對每個模型施測更多題目;本文則讓非自適應(快取、固定子集)與自適應(Rasch/多維 2PL)方法彼此比較,最後因營運理由——無須維護每次執行的序列狀態——選擇非自適應方案。該頁表格中的三種方法都是非自適應施測方法,沒有任何一種呈現營運簡便性與統計上更佳替代方案之間的取捨。
  • Benchmark Score Redundancy — 本頁的固定子集方法,就是 Polo et al. (2024) tinyBenchmarks 的方法,改用於單一持續演進的生產代理程式,而非跨模型的公開排行榜;它與 tinyBenchmarks 的聚類選取器結果相矛盾,而非重現該結果(此處聚類的表現不如難度分層,甚至不如隨機抽樣;見上文)。這也為該頁題目層級維度的討論增加第三個資料點(CollabEval:題目層級矩陣需要約 16 個成分;單維 3PL 能很好地擬合 ATLAS 題庫):在單一系統同質的回應歷史上,以聚類選題的表現實際上不如一維難度排序,符合作者提出的假說——相較於多樣化的模型群體,單一持續演進系統的回應矩陣較少具有可利用的多維結構。

開放問題#

  • 對開發較早期或變動更快的代理程式而言,校準期間的穩定性(一天約等於四週)是否依然成立?論文明確將零結果歸因於「相對成熟的開發階段」,並未測試早期階段或高度變動的代理程式。
  • 歷史快取與自適應測試是否能像已部署的固定子集一樣,移轉至不同代理程式系列並承受較短的校準期間?§6 的兩項驗證都只對難度分層固定子集進行。
  • 難度分層勝過聚類選取的結果,能否推廣至其他生產代理程式的回應歷史?還是只適用於較窄的回應模式多樣性;論文本身正是以此解釋結果為何與 Polo et al. (2024) 矛盾?

資料來源#

  • Efficient Benchmarking in Production: A Study of an Evolving LLM Agent — Yining She(Carnegie Mellon University,任職 Meta 期間完成研究)與 Lei Lin(Meta),Efficient Benchmarking in Production: A Study of an Evolving LLM Agent,arXiv 2609.21267,2026-09-18,28 頁,empirical,採用者觀點的部署報告。全文引用範圍:§2 問題設定(Eq. 1–5,分數與排名保真度目標);§3 方法定義(快取資格條件 Eq. 8,加權/gp-IRT 估計器 Eq. 12–15,Fisher/D-optimal 自適應選取 Eq. 16–17);§4 實驗設定(574 次執行、287/287 按時間順序切分、方法配置);§5.1–5.3(Figures 2–5、Tables 1 和 4);§6(跨代理程式移轉,Table 5–6、Figure 6;校準期間敏感度,Table 12、Figure 7);§7 實務建議;限制。解析警告:由 docling 產生(2.126.0/docling-mlx 0.1.1,confidence_grade: excellent),共有 12 張表。本文所有主要數字均引用 Tables 1 和 4;兩表皆已對照周邊內文核驗,且完全相符。Tables 3 和 6–12 有子標題列攤平錯位的情形(例如 Table 3 的 Kendall's-Tau 區塊中,k=200/38.5 列標被移到一列其他儲存格皆空白的雜散列);未對這些表進行核對。本文沒有引用 Tables 3 或 6–12 表格列中的數字——上述每個數字都可追溯至 Table 1、Table 4,或已核對的內文(§5.1–5.3、§6.1–6.2)。
§ end
Cited by 5
Related articles