資料來源#
- HAS-Bench: Evaluating LLM-Based Human-Agent Systems under Configurable Human Participation
- Voice AI in Firms: A Natural Field Experiment on Automated Job Interviews
摘要#
HAS-Bench(Wu、Huang、Guo 等人,14 位作者,來自 Tokyo / UIC / MBZUAI / McGill / Zhejiang,arXiv 2607.04329,2026 年 7 月)是第一個將人類參與視為受控實驗變數,而非固定背景條件的基準測試。它採用 HAS-Framework,這是一種以圖為基礎的執行框架,人類與 LLM 驅動的代理程式都是同一個共享互動圖中的一級節點——各自具有明確的角色、權限、溝通路徑與行動權限——因此,人類不是事後加在外部、只負責「核准/拒絕」的主管,而是情境可安排路由、可設計且可排程的參與者。
核心做法是:把人類參與拆解成彼此正交、可消融的調節項,再衡量調整每個項目對結果以及協作過程的影響。最重要的實證結果,重新定位了我們對人在迴圈中的看法:人類參與能帶來顯著幫助,但其價值取決於配置,並不會隨參與程度增加而單調上升。「代理程式不只必須決定採取什麼行動,也必須決定何時徵詢意見,以及如何整合不同人類協作者提供的意見。」
證據說明。
empirical——這是一項受控基準測試,但其中的「人類」是由 LLM 使用者模擬器(預設為 GPT-4.1)扮演,預設評審也同樣是 GPT-4.1;穩健性研究則改用 Claude-Sonnet-4/DeepSeek-V3/GPT-4.1-mini 作為替代模擬器(附錄 C.6)。因此,這項研究衡量的是 397 項可驗證任務中的配置式模擬參與,可用來了解人類輸入帶來效益的樣態,但並非真實人類監督負擔的現場遙測資料。閱讀以下所有數字時,都請將這項替代設定納入考量。
三個配置軸#
參與程度沿著三個彼此獨立的軸調整,每個軸都是情境中的一級設定:
1. 能動性層級——Human Agency Scale(A1–A5)(改編自 Shao et al. 2025/Zou et al. 2025)。A1 Full Automation → A2 Minimal Input → A3 Equal Partnership(預設值) → A4 Agent-Assisted → A5 Human-Driven。A1–A2 以自動化為導向(代理程式取代大部分人類工作);A3–A5 以增能為導向(人類保有實質參與)。每個層級都對應明確的執行階段政策:代理程式提示、開放哪些管道、觸發條件,以及誰擁有決策與行動權限。主要實驗測試 A1/A3/A4(A2 是近似 A1 的變體;A5 則把代理程式降為打字員)。
2. 互動管道——釐清、回饋、控制。 這篇論文最清晰的概念貢獻:一般所稱的「人類輸入」被拆分成三種功能,依據其作用對象與時機區分:
- 釐清作用於輸入,發生在代理程式做出承諾之前——在制定計畫或呼叫工具前,補足缺漏資訊,釐清模糊、衝突或規格不明之處。
- 回饋作用於輸出,發生在已有中間產物之後——評估、修正或完善計畫、中間結果或生成的產物。
- 控制作用於行動——核准、否決、修改、覆寫、接手或直接執行(尤其是受保護、安全敏感或只有人類有權執行的行動)。
每個管道都可以由代理程式發起(代理程式提出請求),或由人類發起(人類主動提供)。如此一來,「迴圈中是否有人類」就能轉化為可追蹤、可消融的事件。
3. 人物設定。 固定任務、模型、能動性層級、權限與私人資訊,只改變人類通常的互動方式(每個領域定義三種人物設定)。
基準測試#
涵蓋六個領域的 397 項任務,改編自 τ²-bench 和 MultiAgentBench 中可驗證的任務,並加入互動要求(2,749 項原始來源任務 → 301 項基礎任務 → 經 LLM 評審小組調整、多數決審查與抽樣人工驗證後共 397 項):
- **服務導向(具狀態工具、領域政策):**零售(94)、電信(100)、航空(31)。
- **開放式專家任務(反覆完善/驗證):**程式設計(115)、研究(30)。
- **協商:**議價(27)。
每項任務都標記為六種問題模式之一,以界定其互動需求:資訊不對稱(107)、潛在限制(114)、安全關鍵授權(35)、多方利害關係人規格(62)、反覆驗證(61)、動態目標修訂(18)。
納入過程考量的指標是另一半的貢獻——HAS-Bench 不只評估任務是否成功,也評估協作過程如何展開。結果指標:pass@1、Task Score(部分給分)、Delivery Rate、Safety Rate、HAS Rescue Rate(人類加入後,從自主模式失敗中挽回的比例)。過程指標:Clarification Quality Score、Feedback Utilization Rate、Control Request Justification、Action Safety Rate、Initiative Entropy、Human Intervention Rate(HIR),以及原始互動成本(回合、工具呼叫、人類步驟、權杖)。代理程式主幹模型:GPT-4.1、GPT-4.1-mini、Claude-Sonnet-4、DeepSeek-V3-0324、Llama-3.1-8B。
四項發現#
RQ1——參與有幫助,但代理程式必須懂得運用。 以模型平均值計,Equal Partnership(A3)比 Full Automation(A1)的 Pass@1 高 +8.4,Task Score 高 +11.5;在安全關鍵子集中,Safety Rate 提升 26.9 個百分點。能力較強的代理程式獲益最多:GPT-4.1 +16.9/+20.5、GPT-4.1-mini +13.7/+19.2;單一領域中效果最大的組合是 GPT-4.1 在研究任務上的表現(Pass@1 由 13.3→66.7、Task Score +36.7、挽回率 65.4%)。但效果並不一致,並非普遍適用的開關:Llama-3.1-8B 幾乎沒有獲益(Pass@1 −0.2、Task Score +0.5、挽回率 0.5%)。關鍵在於,較大的增益並不伴隨較高的人類介入率——價值取決於代理程式將輸入付諸實行的能力,而非輸入量。兩種相反的失敗模式具體呈現了這一點:
- 過早自行完成(Claude-Sonnet-4 在研究任務上):86.7% 的任務都交付了提案,但人類輸入量卻是所有組合中最低(HIR 10.9%),而且結果未達接受門檻——它沒有與可供它運用的人類進行互動。
- 能力不足的底限(Llama-3.1-8B 在程式設計任務上):大量人類輸入(HIR 41.4%),但交付率僅 35.7%,Pass@1 完全沒有提升——人類協助無法彌補能力缺失。
RQ2——增加能動性的效益遞減,有時甚至轉為負面。 依序測試 A1→A3→A4(GPT-4.1,程式設計+研究),結果雖然上升,曲線卻逐漸彎折:程式設計 Pass@1 為 39.1→52.2→63.5,研究為 13.3→66.7→70.0(A1→A3 大幅躍升,A3→A4 則只小幅上升)。任務層級的結果尤其明顯:A3→A4 挽回了 27 項任務,卻讓 A3 原本解決的 13 項任務失敗(程式設計挽回 19 項/破壞 6 項;研究則是脆弱的 8 項/7 項)。失敗案例被歸類為過早介入或重複/分散注意力的輸入。「關鍵不只是賦予人類更多能動性,而是要在適當時機以適當形式行使能動性。」
RQ3——不同問題模式需要不同管道。 單獨比較各管道(僅釐清/僅回饋/僅控制與全部啟用):
- 釐清在資訊不對稱與潛在限制模式下表現最好——在承諾之前揭露隱藏資訊/驗收標準。
- 回饋在多方利害關係人規格、反覆驗證、動態目標修訂模式下表現最好——在有中間輸出之後修正、協調或調整。
- 僅控制在安全關鍵授權模式下達到 100% Safety Rate(僅釐清為 51、僅回饋為 54)——釐清和回饋無法取代對受保護行動的明確授權。
- 時機差異就是作用機制:*釐清在承諾之前發揮作用,回饋則在事後修正。*在潛在限制模式下,釐清(29)勝過回饋(17),正是因為在代理程式選定候選方案前,先詢問隱藏的驗收標準成本更低。
- **管道越多不代表越好:**在 6 種模式中的 5 種,最佳單一管道勝過全部啟用(動態目標修訂是唯一例外)。額外管道帶來重複、時機不當的互動與協調成本,並不會讓協作效益持續提升。
RQ4——人物設定會改變結果,卻不會改變介入率。 固定其他所有條件,只改變互動風格:在開放式/協商領域,結果大幅波動(議價 Pass@1 範圍 63.0 點、研究 33.4、程式設計 21.8),但 HIR 範圍維持在 ≤0.04。人物設定不會改變人類參與多少,而是改變參與方式——同一代理程式在議價時提出的釐清問題,最多相差 3.77 題,在電信時則相差 1.97 題。若只衡量最終成功率,就會忽略人物設定的影響,而這正是設置過程層級指標的原因。
為何重要:參與是一套政策,不是旋鈕#
四項 RQ 指向同一個主張:固定的參與政策並不足夠。人類輸入的價值取決於一組配置——共同決定何時(時機:承諾前還是輸出後)、如何(管道:釐清/回饋/控制)、參與多少(能動性層級),以及由誰參與(人物設定/能力)——而最佳配置取決於任務模式,且不會單調提升。更多權限、更多管道或更多介入,都可能降低效能。這是基準測試以實證方式呈現的設計直覺,亦可在整個文獻中見到定性描述:讓人類「置身迴圈中」只有在迴圈設計得當時才有價值。
現場對照:一種配置,67,056 位真實人類#
HAS-Bench 以 模擬人類測試 397 項任務中的多種配置。Jabarian 與 Henkel 的招募實驗則採取相反做法:只用一種配置,隨機套用於 67,056 位真實人士,並觀察行政資料中的結果。以本文的用語來看,這種配置格外清楚——但它不是 A3 的最佳點:
- 能動性層級:階段內為 A1,階段之間為 A5。 代理程式獨自進行面試,對話過程中沒有任何人類參與(全自動化蒐集資訊);接著由人類全權決定結果。這不是「平等夥伴關係」,而是清楚的階段界線——某個階段完全自動化,下一階段則完全由人類負責。
- 管道:只用控制,並在事後行使。 沒有釐清,也沒有任務進行中的回饋。人類唯一的行動,是根據代理程式產生的產物,授權是否採取會帶來重大後果的行動(是否發出錄用通知)——也就是在唯一重要的決策上運用控制管道。
- 結果:確實有效,但人類階段成了排隊瓶頸。 工作錄取通知增加 12%,到職人數與一個月留任率約增加 18%,生產力沒有下降。但面試到錄取決策的時間中位數從 2.62 天升至 7.24 天,因為審閱自己沒有參與的對話,比親自進行面試更慢。
這項實地研究補充了兩點。第一,它從現場印證 RQ3 最明確的發現:對於重大決策授權模式,僅控制就已足夠,根本不需要成本較低的其他管道。第二,它揭露了基準測試無法計價的成本——HAS-Bench 以回合、工具呼叫與權杖衡量互動成本,但人類的等待時間完全沒有反映在其中。在這裡,控制管道的實際成本是人類審閱階段耗時增加 2.8 倍,程度足以讓端到端處理時間變長(20 → 24 天),即使品質有所提升。某種配置可能在結果上勝出,卻在延遲上落敗;只有現場測量才能看見這一點。
基準測試提出的警示,確實也在現場重現:人類評估者會降低收到的訊號權重,在決策時大幅降低 AI 產生的面試分數權重,並提高獨立測驗分數的權重。「代理程式必須決定如何整合人類輸入」還有一個沒有人評估的鏡像問題——人類也必須決定如何整合代理程式的輸入,而預設情況下,他們對代理程式的信任不足。
相關文章#
- AI 決策中的程序價值——以不同目標評分的相同配置測試。HAS-Bench 依任務結果為人類參與配置排序;一項預先註冊的 conjoint 聯合分析(n=1,919 位美國求職者)則依受影響者願意接受的條件排序,兩者未必一致:受試者認為最終決策權由誰掌握(+0.272)比任何附加功能都重要;相較於「AI 先篩選,人類決定」,他們更偏好「AI 提建議,人類決定」,差距為 0.030(p<0.001),因為只有前者讓人類看得到遭拒的案例;他們對申訴管道(+0.156)的重視程度,是系統層級偏誤稽核(+0.068)的兩倍以上。兩篇文章都指出「關鍵在於配置,而非人類參與的多寡」——這組研究留下的開放問題是:參與設計究竟在最佳化誰的偏好?
- 將代理程式工作結晶為工作流程——把本文核心做法落實到工程上的形式。將人類審查設為有型別且持久的事件(
HumanReviewRequested→ 工作流程持續數分鐘或數天 →HumanReviewCompleted),就能把參與從系統外部的故障保護機制,轉化為系統內部可衡量的變數:同意、不同意與編輯都會成為記錄資料,並納入下一批評估資料集。兩者本質上相同,出發點卻相反——一方以模擬人類測試多種配置,另一方則讓單一配置能在正式環境中被具體追蹤——彼此補足對方的不足(衡量出的最佳配置,以及觀察實際部署狀況的機制)。 - 受控變異:AI 的優勢在於降低分散程度——上文提到的現場對照:使用單一固定配置(代理程式自動化整個階段,人類掌握全部決策權,只使用控制管道),隨機套用於 67,056 位真實求職者並觀察行政資料中的結果;相較之下,基準測試以模擬人類測試 397 項任務中的多種配置。
- Parallel Agent Orchestration——該文的開放問題(「每個並行代理程式實際帶來多少人類監督負擔?負擔在哪裡達到飽和?」)在此被重新表述:本基準測試發現,人類輸入的價值有一個最佳配置點(時機/形式/權限恰當),而非單調調節的旋鈕——更高能動性(A4)的效益會遞減,有時甚至為負面。但研究只涉及單一人類、單一任務,且以 LLM 模擬,因此它釐清了問題的樣態(非線性而非線性),卻沒有衡量每個代理程式的真實負擔。
- 規劃/執行分工——這是「人類決定做什麼,代理程式決定如何做」的細緻版本:釐清是規劃階段的輸入,回饋/控制則是執行階段的輸入;論文顯示,值得採用哪種方式取決於問題模式——分工是一套時程安排,而非固定切分。
- Human-AI Accountability Redesign——能動性層級(A1–A5)與控制管道兩個軸,正是該文在決策權/升級處理議題子領域中的基準測試工具;安全關鍵授權(僅控制=100% 安全)是經衡量的案例,顯示授權不能交由釐清或回饋處理。
- Claude Code Auto Mode——控制管道與安全關鍵授權模式,正是「安全動作自動核准/高風險決策設閘門」的決策權設計,現在有了數據佐證:只透過控制進行授權,就能填補受保護行動的安全缺口;釐清/回饋的效果則不足(51/54%)。
- Interaction Models——管道與時機分類法(承諾前釐清、事後回饋、混合主動權),是 HAS-Framework 的任務基準測試版本,與 TML 提出的維持人類參與之架構解法相互呼應;兩者都主張參與必須經過設計,而非預設如此。
- Turn-Based Interface Bottleneck——HAS-Framework 的具型別邊與由代理程式/人類發起的管道,正是非單線程介面需要路由的內容;研究所衡量的結果顯示,由代理程式發起的釐清品質會有差異,這正是介面瓶頸的具體表現。
- 未知事項作為代理式工作的瓶頸——「釐清在承諾之前發揮作用」就是經過衡量的未知事項引出手段:HAS-Bench 量化顯示,釐清在資訊不對稱/潛在限制模式(已知但未明示的資訊)中特別有效,而代理程式能否判斷何時詢問就是所需技能。
- AI Brain Fry——互動成本指標(回合/人類步驟/權杖)與「管道越多 ≠ 越好」的結果,呈現了監督成本中與參與有關的一面:過度詢問和時機不當的介入都有可衡量的成本,因此更多人類參與並非毫無代價。
- Agent Harness Engineering——HAS-Framework 是一種以人類參與可排程為明確設計目標的 harness;RQ2/RQ3 的發現屬於 harness 設計成果——何時徵詢意見、開啟哪個管道是架構設計決策,而不只是模型能力。
- 生成式 AI 的學習成效實驗——人類學習方面的對照研究,同週發表:兩者都指出,自動化與增能的軸向(該研究指學生使用方式;本文指能動性層級的取向)會因果性地決定 AI 參與是帶來持久價值,還是只產出空洞結果——兩者都駁斥了「輸入越多越好」的單調旋鈕觀點。
- Measuring Beyond Accuracy Saturation——這是本文受控基準測試中人機衡量方式的實地對照:HAS-Bench 在 397 項任務中以 LLM 模擬人類,調整參與程度;Nadgir 等人則在 20 項重現任務上進行真實隨機研究,發現代理程式協作讓完成時間縮短一半以上(2.11×,p≈0.002)。兩者都把人機協作列為首要衡量軸——以模擬與真實研究配對回答同一個問題。
連至樞紐文章(單向)#
- 驗證成為新的瓶頸——回饋管道(評估/修正中間輸出)與反覆驗證模式,將人類驗證設為可衡量的調節手段;回饋在需要驗證並完善的模式中表現最佳。
- Design Concept Grilling——由代理程式發起、透過 Clarification Quality Score(精確、必要、不重複)評分的釐清方式,是
grill-me的反轉版——由代理程式訪問人類——而論文衡量了代理程式是否會問得太多。
開放問題#
- 「人類」是同時擔任評審的 LLM 模擬器(GPT-4.1)——配置依賴的結構中,有多少是人機協作的特性,又有多少是 GPT-4.1 同時模擬兩方所造成的結果?附錄 C.6 只在部分樣本中替換模擬器,是唯一的檢驗。
- A4 被實作成固定、單次的主動介入。真實情況下,主動介入的人類會因應情況調整輸入時機——如果由人類自行選擇何時介入,「過早/分散注意力的介入會破壞任務」這項結果仍然成立、變得更嚴重,還是消失?
- 研究顯示,最佳管道因問題模式而異,但問題模式是建構資料時指定的預言者標籤。代理程式能否在執行時推斷自己面對哪種模式(進而決定該徵詢哪種管道)——也就是論文指出代理程式所缺乏、實際部署時真正需要的技能?
- 「更多管道會增加協調成本」的代價,會隨主幹模型能力提升而縮小(因能力差距而生),還是混合主動權互動本身的結構性成本,會持續存在?
資料來源#
- Voice AI in Firms: A Natural Field Experiment on Automated Job Interviews — Jabarian & Henkel,Voice AI in Firms(arXiv 2607.28222,2026-07-30;
empirical,預先註冊的 RCT):§2.4(固定配置——AI 執行面試,人類做決定)、§3.1(結果)、§6.2(人類不信任代理程式所提供的訊號)、§7.1(控制管道的延遲成本)。解析警告與完整討論見受控變異:AI 的優勢在於降低分散程度。 - HAS-Bench: Evaluating LLM-Based Human-Agent Systems under Configurable Human Participation — Wu et al.,arXiv 2607.04329(2026-07-05)。§3 HAS-Framework(圖、管道、能動性量表);§4 基準測試建構與指標;§5.2 主要結果(RQ1 價值、RQ2 能動性測試);§5.3 消融分析(RQ3 管道 × 模式、RQ4 人物設定)。已檢視圖 1(框架概覽與航空業 A1/A3/A4 操作流程)及圖 2(程式設計/研究的能動性層級圖)。
Cited by 21
- Bind, Don't Forbid; Prevent, Don't Detect: The Action-Open and Poisoned-Memory Residuals×2
When binding starves the task, the system elicits specification — clarification-before-commit, the…
- Context Smells×2
Configurable Human Participation: HAS-Bench measures the repair loop in reverse, an agent choosing…
- Crystallizing Agent Work into Workflows×2
Human review is an event, not an exception. The naive shape (pause the process, send an email, hope…
- Open Questions Backlog×2
Configurable Human Participation ×3 (oldest 81d) — The "human" is an LLM simulator (GPT-4.1) that…
- The Orchestrator's Real Workload: Decision Burden, Framing Discipline, and Whether Taste Scales×2
The workflow side gained measured backing. Decision-rights gating — the reconciliation's central…
- Parallel Agent Orchestration×2
Summed-overlap runtime can exceed 24h/day — it measures agent effort, not human attention. What is…
- Agent Harness Engineering
Configurable Human Participation — HAS-Framework is a harness whose explicit goal is making human…
- AI Brain Fry
Configurable Human Participation — the participation-cost side: HAS-Bench's interaction-cost…
- AI-Moderated Interviews: Adaptive Probing, Human Rapport, and Digital Twins
Configurable Human Participation — HAS-Bench's "human" is an LLM user-simulator. The twin results…
- Claude Code Auto Mode
Configurable Human Participation — HAS-Bench's Control channel + Safety-Critical Authorization…
- Controlled Variance: AI's Edge as Reduced Dispersion
Configurable Human Participation — the field counterpart to HAS-Bench's controlled sweep. HAS-Bench…
- Experimental Learning Impact of Generative AI
Configurable Human Participation — the system-side mirror, published the same week: HAS-Bench's…
- Human-AI Accountability Redesign
Benchmark instrument: Configurable Human Participation — HAS-Bench's Human Agency Scale (A1–A5) and…
- Is Human Review of AI-Authored Code Still a Real Control, or Already Rubber-Stamping?
But the failure mode is a threshold, not a destiny — the countermeasures are also in evidence. What…
- Interaction Models
Configurable Human Participation — the task-benchmark companion to this architecture answer:…
- Measuring Beyond Accuracy Saturation
Configurable Human Participation — the human-uplift study is the field counterpart to HAS-Bench's…
- AI Coding Practice
Configurable Human Participation — HAS-Bench (Wu et al.): human participation as a configurable…
- Planning / Execution Division of Labor
Configurable Human Participation — the finer-grained schedule under "humans decide what, agents…
- Procedural Value in AI Decisions
Configurable Human Participation — HAS-Bench treats human participation as a configurable variable…
- Turn-Based Interface Bottleneck
Configurable Human Participation — HAS-Framework's typed human/agent-initiated channels are what an…
- Unknowns as the Agentic Bottleneck
Configurable Human Participation — "clarification acts before commitment" measured: HAS-Bench finds…
Related articles
- Harness Shrinkage as Models Improve
Prompt scaffolding shrinks each model release; Cat Wu's pruning discipline; Boris Cherny "100 lines of code a year from…
- Open Questions Backlog
Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…
- Verification as the New Bottleneck
Fiona Fung: coding is no longer the bottleneck — verification, review, maintenance are; shift-left; TDD loses its tax;…
- AI Brain Fry
Kropp et al. 2026/03: mental fatigue from excessive AI oversight increases minor errors +11%, major errors +39%; cognit…
- Loop Engineering
Replacing yourself as the agent's prompter by designing the system that prompts it: a recursive-goal loop built from fi…
