資料來源#
- Build more natural voice experiences with GPT‑Live‑1 in the API
- Full-Duplex Speech Models Take the Floor When Asked, Not When Needed
- Interaction Models: A Scalable Approach to Human-AI Collaboration
- Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking
- NemotronLabs VoiceChat: An Open Full-duplex Speech-to-Speech Model with Tool Calling Capabilities
- OmniVChat: Synthesizing, Benchmarking, and Training for Native Audio-Visual Dialogue
摘要#
論文自己的定義,也是這個概念與輪替發言之所以必須分開討論的原因:
在此,內容驅動的介入是指:未經要求作答,便針對潛在問題作出回應。
輪替發言研究探討的是何時有發言機會。內容驅動的介入探討的是模型是否有理由接手發言。Sacks、Schegloff 與 Jefferson 的輪替分配規則列出三種取得發言權的途徑——目前的說話者指定下一位、另一方自行接話,或目前的說話者繼續發言。在這篇之前,互動性基準中的所有基準都測量第一與第三種。自行接話最值得關注,因為人類聽者會自行開口糾正錯誤主張、補上遺漏的詞,或警告危險;要這麼做,必須充分理解內容,才能判斷是否有必要介入。
Peng、Nuchged、Fu 與 Yao(UConn / UT Austin / X Square Robot / Oxford,arXiv 2609.19596,2026-09-17,empirical)是本知識庫中第一個能將此現象單獨測量的工具。發現就在標題裡:全雙工語音模型會在受到要求時接手發言,而非在有需要時接手。
實驗設計:拆開發言理由與發言機會#
這套方法要排除的混淆是:開口的理由通常伴隨發言機會——錯誤主張之後往往會有一段停頓。因此:
- 40 段第一人稱英文獨白,主題為日常生活,總長中位數 50.3 秒。每段都有開場、觸發語句與後續內容。同一主題內,只有觸發語句不同——其他內容完全相同。兩種 TTS 聲音各自負責固定的 20 個主題。
- 除了明確插入沉默的情況,使用者在觸發語句後會繼續說話。因此接手發言就代表打斷對方。
- 使用逐詞時間戳將詞間間隔壓縮至 ≤0.12 秒,從設計上移除發言機會。另設自然停頓組,保留原始間隔(句末停頓通常約 0.88 秒)。
- 10 種條件分成三組,表 1 列出其中九種,Neutral 是第十種,也是基準:
- 被直接指定(說話者選擇模型):Question(直接提問)、Request(將相同請求改為陳述句)、Rhetorical(疑問句形式,但並非問模型)。
- 自行接話(聽者必須自行判斷):Word search(想不起某個詞)、False fact(將錯誤主張歸於某個權威)、Repeat(逐字重複前一句)、Hazard(即將發生的危險行動)。
- 讓出發言權(說話者將發言權交出):Turn end(說「我就說到這裡」,接著不停頓地繼續說)、Silence(中性句子後沉默 1.5 秒)。
- 五種家族中的七種配置:Moshi 基礎版(合併 Moshiko 與 Moshika 檢查點)、Moshika-RL、PersonaPlex 基礎版(PPlex)、PPlex-RL、NVIDIA VoiceChat-11B、MiniCPM-o 4.5、Raon-SpeechChat。全程採用官方預設解碼方式;PersonaPlex 使用預設聲音與中性角色提示「You enjoy having a good conversation.」,沒有任何打斷對方的指示。主要實驗網格為 40 個主題 × 10 種條件 × 5 個種子 = 每種配置 2,000 次試驗(Moshi 將兩個檢查點各自的五個種子合併計算)。
- 語音起始率 = 在所有試驗中,模型於 [t₀, t₀+4 s) 內開始一段至少 4 個詞的比例;t₀ = 觸發語句結束時間。若試驗在前 1.5 秒內模型已在說話,仍納入分母,但不算新的起始。各架構的片段定義不同:Moshi/PersonaPlex/Raon 每 80 毫秒一個文字 token,且間隔不得超過 0.64 秒;VoiceChat 使用輪次邊界標記;MiniCPM-o 使用每秒一次的聆聽/說話輸出。
Rhetorical 與 Turn end 兩種條件是讓結果容易判讀的控制組:兩者表面上都像是邀請模型開口(疑問句形式;「我就說到這裡」),但實際上並未指定模型,也沒有真的停止說話。
結果 1——起始發言反映結構,而非內容#
出現三種行為模式,其中只有一種有助於分析:
- Raon-SpeechChat 幾乎一直在說話。 Neutral 基準為 .42;持續說話條件落在 .26–.47;只有 Silence 會改變結果(.68)。圖 2 的試驗時間軸圖說明了原因——許多 Raon 片段在觸發語句結束前就開始,並延續整個回應時間窗,因此其高起始率反映的是近乎持續說話,而非對任何內容作出回應。
- VoiceChat-11B 與 MiniCPM-o 4.5 在對方持續說話時保持沉默(每種條件都只有 .00–.01),主要在插入沉默時才開始說話——MiniCPM-o 為 .98,VoiceChat 只有 .20。不會打斷對方的模型就無法介入。
- 四種 Moshi/PersonaPlex 配置才是真正的比較對象:Neutral 為 .01–.10,而且它們確實會對某些線索作出反應。
在這組比較中:
| Neutral | Question | Rhetorical | Word search | False fact | Repeat | Hazard | Turn end | Silence | |
|---|---|---|---|---|---|---|---|---|---|
| Moshi | .07 | .15 | .10 | .08 | .08 | .10 | .10 | .07 | .12 |
| Moshika-RL | .03 | .15 | .04 | .04 | .01 | .03 | .01 | .04 | .18 |
| PPlex | .10 | .34 | .10 | .22 | .07 | .14 | .16 | .17 | .83 |
| PPlex-RL | .01 | .21 | .04 | .19 | .02 | .03 | .04 | .10 | .56 |
(因篇幅省略 Request:Moshi .17、Moshika-RL .06、PPlex .24、PPlex-RL .12。完整的七種配置網格見原文表 2。)
- 直接提問會使起始率增加 +.08 至 +.24;插入沉默則會將起始率從 Neutral 下的最高 .10 提高至 .83。
- 修辭性疑問幾乎沒有影響——因此模型回應的是有人向它提問,而非疑問句形式。
- 「Turn end」幾乎沒有影響——因此模型回應的是說話者真的停止說話,而非讓出發言權的字句。
- False fact、Repeat 與 Hazard 在七種配置中的數值都與 Neutral 相差不超過 .06。 PPlex 的錯誤事實起始率(.07)甚至低於 Neutral(.10)。
- 唯一能帶動起始率的內容線索是 Word search,在 PPlex 增加 +.12,在 PPlex-RL 增加 +.18——結果 3 將說明為何這項效果不成立。
有效的兩種線索都是表面線索。兩者都不需要理解對方說了什麼。
結果 2——探測指標與行為結果一致#
沒有開口不一定代表對內容不敏感;也可能只是傾向有所改變,但未跨過啟動門檻。因此作者針對 Moshi 和 PPlex,讀取文字通道在每一影格輸出非靜音 token 的機率 P_text(t) = 1 − P(⟨PAD⟩|t) − P(⟨EPAD⟩|t),並與 Neutral 比較(圖 3)。
觸發語句結束後最初 2 秒的平均值:
| Moshi | PPlex | |
|---|---|---|
| Question | +0.13 | +0.07 |
| Silence | +0.06 | +0.30 |
| False fact | −0.03 | −0.02 |
兩種正向控制條件都提高了兩個模型的指標——模型會對語言線索與聲學線索作出反應。False fact 在兩者中都略低於 Neutral。 Word search 在 PPlex 呈現小幅數值,但沒有持續上升。因此這不是一股受到壓抑、但確實存在的發言衝動:即使在 token 機率層級,發言傾向也沒有提高。
結果 3——提供機會與許可仍無法縮小差距#
結果 1 之後還有兩種替代解釋:模型可能理解內容,卻缺乏機會(沒有停頓),或缺乏許可(沒有打斷的授權)。表 3 為 Moshi 和 PPlex 同時加入兩項條件,分母與主要實驗網格相同。每種指示組都配有自己的 Neutral 觸發語句,因此每項對比都固定指示內容,只改變觸發語句。
| Moshi Neutral | Moshi False | Moshi Hazard | PPlex Neutral | PPlex False | PPlex Hazard | |
|---|---|---|---|---|---|---|
| Main grid | .07 | .08 | .10 | .10 | .07 | .16 |
| + 1.5 s silence | .12 | .21 | .21 | .83 | .79 | .82 |
| Natural pauses | .14 | .15 | .15 | .47 | .43 | .49 |
| + instr. "if I'm wrong" | .11 | .08 | — | .09 | .10 | — |
| + instr. "if … unsafe" | .06 | — | .07 | .06 | — | .07 |
- 機會會全面提高起始率,並非只提高內容線索的效果。 PPlex 的 Neutral 起始率從 .10 提升到 .83;插入沉默後,錯誤事實與危險情境也隨之上升,但仍低於或等於同列的 Neutral。整篇論文唯一具有內容特定增益的結果是插入沉默的 Moshi(.21/.21,相較 Neutral .12)。在自然停頓條件下,兩個模型與 Neutral 的差異都不超過 .04。
- 許可幾乎沒有影響。 開場指示很明確——「如果我說的任何內容有錯,請直接馬上打斷我」/「如果我提到自己正在做危險或不安全的事,請直接馬上打斷我」。指示下的 Neutral 起始率與主表相比差距不超過 .05,而錯誤事實與危險情境的起始率與同列 Neutral 相差最多 .03。作者認為這與 Instruct-FD 的低輪替發言指示遵從率一致。
這項結果讓研究發現顯得是結構性的,而非偶然現象:微弱的內容效果不能歸因於模型沒有機會,或未獲准許。
結果 4——即使得到發言權,它們仍不會介入#
另一項輪次釋放實驗將問題從模型會不會接手發言改為它說的話有沒有用:觸發語句結束後沉默 10 秒,只在其中測量實質語音,僅測試 Moshi 和 PPlex。回覆由 DeepSeek-V4-Flash 在 temperature 0 下評分(LLM-as-a-Judge),採用兩個軸向——Relevant:回覆是否回應觸發語句;Intervenes:對 False fact 是否提出質疑、糾正或表達懷疑;對 Hazard 是否發出風險警告或提出更安全的替代方案。只有肯定的介入判斷才計入。
| Condition | Moshi Speak | Moshi Relevant | Moshi Intervenes | PPlex Speak | PPlex Relevant | PPlex Intervenes |
|---|---|---|---|---|---|---|
| Neutral | .37 | .47 | — | .98 | .51 | — |
| Question | .85 | .74 | — | 1.00 | .82 | — |
| Word search | .45 | .26 | — | 1.00 | .36 | — |
| Turn end | .49 | .68 | — | .98 | .90 | — |
| False fact | .41 | .16 | .14 | .98 | .17 | .15 |
| Repeat | .61 | .65 | — | .95 | .74 | — |
| Hazard | .48 | .27 | .04 | 1.00 | .24 | .07 |
由此可見三點。
- 相關性取決於線索要求模型做什麼,而非難度。 只需要回覆的線索——Question、Turn end、Repeat——相關性達 .65–.90。需要協助的線索——False fact、Hazard、Word search——則降至 .16–.36。
- Word search 只是幻象。 它是結果 1 中唯一提高 PPlex 起始率的內容線索,但實際上只有 .36 的回覆提供了遺漏的詞。起始率的正向效果不能證明模型成功提供協助;這項提醒也適用於這篇論文以外的情況。
- 介入比回應相關性更少見。 在非空白的錯誤事實回覆中,Moshi 有 .14、PPlex 有 .15 會提出質疑或糾正。在危險情境回覆中,警告比例分別只有 .04 和 .07。其餘回覆大多不是回應詞——而是有實際內容、卻繼續談論主題而不處理問題的發言;在錯誤事實的情況下,往往還會附和該主張。PPlex 在 .98 的錯誤事實試驗與 1.00 的危險情境試驗中會發言,卻仍幾乎從不介入,因此瓶頸並非能否取得發言權。
引用這些數字時請留意分母:.14–.15 與 .04–.07 是輪次釋放實驗中非空白回覆的比例,涵蓋七種配置中的兩種——不是主要 2,000 次試驗網格的比例,也不代表未納入這項實驗的另外三種家族。
RL 變體帶來的改變:更精準,而非更主動#
兩種後訓練配置都來自同一條互動性對齊路線(Ohashi 等人,arXiv 2606.11167——停頓處理、輪替發言、回應詞、打斷)。它們的行為相同,但與框架設定所預期的不同:
- Moshika-RL 將 Neutral 從 .07 降至 .03,同時維持 Question .15,並將 Silence 從 .12 提高至 .18。其他條件都下降:Request .17 → .06、Repeat .10 → .03、False fact .08 → .01、Hazard .10 → .01——兩種內容線索現在都低於自身的 Neutral。
- PPlex-RL 將 Neutral 從 .10 降至 .01,並降低所有條件;但 Question/Neutral 對比從約 3.4 倍擴大至約 21 倍,Word search 的差值從 .12 增至 .18。False fact 從 .07 降至 .02,Hazard 從 .16 降至 .04,相較之下 Neutral 為 .01。
因此,互動性對齊帶來的是對結構觸發條件的特異性——大幅減少無關起始發言,同時保留或強化對直接提問與沉默的回應——卻完全沒有增加內容敏感度。若以「更好的互動訓練會讓模型在有需要時開口」為假設來看,結果反而指向相反方向:將模型訓練成良好的輪替發言者,會讓它在那些足以合理化主動接話的線索上更沉默。這是本文最接近能力與主動性關係的結果;但論文並未測量五種家族的智慧或任務能力,因此無法據此讀出跨家族的相關性。
有任何模型會對內容主動開口嗎?#
沒有。對於測試過的系統,四項結果的誠實總結如下:
- 在主要實驗網格中,七種配置都沒有顯示出內容線索起始率高於自身 Neutral 基準的效果。
- 全篇論文只有一個單格結果呈現真正的內容特定增益:插入 1.5 秒沉默的 Moshi(錯誤事實與危險情境都是 .21,相較 Neutral .12)——只出現在一個模型、一種停頓設定中,在 PPlex 與自然停頓實驗中都沒有重現。
- 結果 1 中唯一正向的內容效果(PPlex 的 word search)未通過結果 4 的實用性檢驗。
- 這種行為並非門檻假象(結果 2),也不是機會假象或許可假象(結果 3),更不是發言權取得假象(結果 4)。
作者明確表示,機制仍未確定:模型是沒有注意到問題,還是注意到了卻保持沉默,目前無從判斷。token 機率探測結果不支持「注意到但壓抑發言」的輸出通道傾向,但它讀取的是輸出分布,而非理解能力。
與「有需要時就開口」的說法對照#
全雙工互動將主動插話——「我說錯時就打斷我」——列為不再需要特殊 harness、而成為模型行為特例的互動模式之一;互動模型也提出相同主張。這是 Thinking Machines Lab 對 TML-Interaction-Small 的主張,屬於研究預覽版上的 vendor-claim 等級;本知識庫從未對此做過測量。
這篇論文就是那項測量,結果是否定的——但測試的是不同系統。兩者並未交會:
| TML 的主張 | Peng 等人 | |
|---|---|---|
| 系統 | TML-Interaction-Small,尚未發布 | Moshi(+Moshika-RL)、PersonaPlex(+PPlex-RL)、NVIDIA VoiceChat-11B、MiniCPM-o 4.5、Raon-SpeechChat |
| 等級 | vendor-claim,第一方,自行定義基準(CueSpeak/TimeSpeak) | empirical,第三方、開放模型、情境配對協定 |
| 展示內容 | 預覽版中展示了這項能力 | 所有受測開放系統中都沒有這項能力 |
兩者都不能取代對方。 本頁沒有任何內容足以撤回 TML 的主張,而 TML 的主張也不會削弱本文對七種配置所做的結果。真正改變的是預設看法:「主動插話」不能再視為全雙工架構自然帶來的特性。五種具備排程能力的開放家族都沒有這項行為,其中一種明確經過互動性後訓練,另有兩種根本不會打斷對方。現在主張具備這項能力的一方需要提出證據,而且測試已經存在——這套協定已公開(刺激材料、模型輸出與評估程式碼位於 github.com/vocaliodmiku/take-the-floor),而 TML-Interaction-Small 尚未接受這項測試。值得一提的是,CueSpeak 並不能替代這項測試:它測量的是在既有使用者指示下,模型能否於適當時機說出語意正確的回覆,而這正是本文發現已能奏效的直接指定情況。
不同模態中的同一種失效#
這裡的結構與 Agent Epistemic Vigilance 中文字代理程式的結果相近:模型抽象地知道資訊來源帶有自身利益,卻仍不會在未經提示時依此行動。Anthropic 的 Frontier Red Team 將此缺陷稱為傾向性而非認知性;本文則是同一現象在語音模態中的實例——沒有人要求模型注意錯誤主張,因此它不會注意。
有一點差異讓問題更鮮明,而非較不嚴重。多代理程式的聽者從未被告知資訊來源可能不可靠;沒有任何內容授權它懷疑,這正是研究結果指向傾向性的部分原因。本文中,作者確實授權模型——「如果我說的任何內容有錯,請直接馬上打斷我」——但起始率最多只改變 .03。許可已經給了,模型卻沒有使用。與未受提示的條件相比,這是更強烈的同類否定結果,也是應將兩項發現視為跨模態同一現象,而非兩個巧合的原因。
商業產品的發展方向恰好相反(2026 年 9 月)#
值得記錄,因為這是一項關於廠商目標的負面發現,而非其結果。OpenAI 的 GPT-Live-1 API 發布(2026-09-10,vendor-claim)是本知識庫中第一份說明語音模型主動性用途的正式產品聲明,卻完全沒有對自行接話提出主張。文章中每項與主動性相關的主張,都在談處理使用者主動發起的語音,或談不要開口:
- 「流暢地處理打斷」,以及在「打斷與應答發生時」作出回應——這是回應使用者主動打斷,屬於本頁分類中的直接指定/讓出發言權一側。
- OpenAI 率先公布的 Full Duplex Bench v1.5 Interactivity 卡(80.10%)「測試對背景語音、對另一人說話、聽者回應詞與打斷的反應」——四種都是被動回應條件,沒有一種屬於自行接話。
- 「靜默的情境管理」:更妥善地處理背景噪音與沉默,「不打斷對話,也不把每個步驟都說出來」——明確主張要克制。
- OpenAI 選為主要證據的客戶案例,展現的是模型發言次數的減少:Speak 表示 GPT-Live-1「讓學習者有更多思考時間,再由語言家教回覆;與先前輪替發言系統相比,打斷次數減少近 80%。」
因此,商業語音層的產品誘因是減少未受邀請的發言,而旗艦早期採用者指標則是更少打斷。這無法證明該能力是否存在——GPT-Live-1 從未接受本頁協定的測試,而協定已公開。它能說明的是應如何解讀這項缺席:一家致力於打造會等待的家教的實驗室,不會特別留意一個從不糾正錯誤主張的模型。負面結果與產品方向一致,因此「沒有人打造出這項能力」至少與「沒有人能做到」同樣值得考慮。
同一週的第二家廠商,在這個面向也同樣沉默。Google 的 Gemini 3.8 Live 發布(2026-09-15,vendor-claim)也沒有對自行接話提出主張,其兩項與主動性相關的功能都是讓模型描述自己的狀態,而非介入使用者說的內容:「以『我來確認一下……』等早期口語提示自然回應提示」,以及「即時敘述背景多步驟任務進度,逐步向使用者說明」。確認提示屬於直接指定;敘述使用者要求的任務,也只是將直接指定延伸至一段時間。兩者都不是模型自行判斷某句話值得接話。因此,兩項前沿語音產品發布相隔五天,合計涵蓋當前資源最充沛的即時對話產品,卻都沒有主張本頁發現不存在的能力——這大大加強了「沒有人打造出來」的解讀,因為如果能力存在,行銷內容理應最先展現出來。
有一項部分例外值得記錄,但不應誇大。Google 聲稱模型「會自動偵測並在對話中切換 97 種支援語言」——這是由使用者說的內容觸發、未經提示而由模型發起的行為改變,沒有任何既有指示。這是目前任何廠商所主張的最接近自行接話的能力,但它做出的決定關乎通道,而非內容:切換語言符合使用者明顯的意圖,糾正錯誤主張則與之相悖。這種不對稱才有意思——未經提示的配合已經上市,未經提示的反駁則沒有。
沉默模型的技術報告,以及同一事實的反向評價(2026 年 9 月)#
知識庫現在收錄了七種配置之一的第一方報告。NemotronLabs VoiceChat(NVIDIA,arXiv 2609.21967,2026-09-18,empirical)是 NVIDIA-NemotronLabs-VoiceChat-11B 的技術報告——Peng 等人在參考文獻 [3] 引用的同一個 Hugging Face 檢查點,發表時間比他們的測量晚一天。這項識別是確切的,並非推論;它也帶來本頁最有用的比較:同一種行為由兩方評分,方向卻完全相反。
- Peng 等人將它評為發言權底線。 VoiceChat 在十種條件中的九種為 .00,只有插入沉默時為 .20:使用者說話時,它不會接手發言,不論觸發線索為何,包括明確的危險情境,以及明確要求它打斷的指示。不會打斷對方的模型就無法介入。
- NVIDIA 將完全相同的特性評為頭號成果。 在 Full-Duplex-Bench 1.0 中,同一檢查點於表格所有開放權重系統中,停頓處理接手率最低——合成資料 15.3%、CANDOR 25.5%——相較之下,Moshi 為 98.5 / 98.0、Freeze-Omni 為 64.2 / 48.1、PersonaPlex 為 35.8 / 43.1。在該基準中,數值越低越好,因為停頓測試旨在抓出模型於輪次中的猶豫期間搶走發言權的情況。
兩者測量的是同一種傾向。FDB 1.0 的停頓測試獎勵在使用者持續說話時保持沉默;Peng 等人的協定則測量這種行為的代價。兩者沒有互相矛盾,而是讓本頁的論旨更加鮮明:**該領域正在最佳化的基準獎勵克制,卻不為介入計價。**按停頓排行榜頂端的標準打造的系統,必然會朝向內容驅動介入不可能發生的空間角落訓練;兩間實驗室也不必產生分歧,因為沒有任何工具會同時評分兩種行為。(同一張表也呈現了這項取捨的形狀:Moshi 在停頓時有 98.5% 的機率接手發言;而在 Moshi/PersonaPlex 比較組中,Peng 等人也發現它是最願意在輪次中途開口的配置。停頓 TOR 欄與起始率幾乎互為倒數。)
這份報告也提供了機制,而 Peng 等人只能從外部探測。起始發言是經過訓練的逐影格目標:在每 80 毫秒更新的代理程式文字時間軸上,BOS 標示回應開始,EOS 標示停止,其餘都是填充內容;SFT 損失對這些 token 的權重分別為 輪次開始 12.5、輪次結束 7.5,填充內容 1.0——因此模型何時開始與停止說話,比模型說什麼的權重高出一個數量級。此外,§4 還揭露黑箱探測看不到的一項覆寫機制:當模型「無法原生處理輪替發言/插話情境」時,建基於使用者語音/靜音活動的啟發式端點偵測器會強制將 BOS/EOS token 注入模型。因此,Peng 等人測量的發言權策略,有一部分是從依語音/沉默形塑的目標中學得,另一部分則來自其上方手寫的活動啟發式;兩者都沒有任何通道能讓使用者說話的內容影響開口決定。這是 .00 的結構性解釋,而不只是一次測量結果。
這項比較有兩點需要留意。FDB 數據是 NVIDIA 對 NVIDIA 評分,單次執行且沒有誤差線;表中的每一列基準結果也都是從第三方報告複製,而非重新執行。此外,這份 19 頁報告完全沒有談到主動性、介入或打斷的必要性——Peng 等人測量的沉默並不是論文所捍衛的設計目標,而是兩間實驗室都沒有人視為一種選擇的系統特性。
直接為克制評分的基準,以及每個模型都在這項指標上表現最差(2026 年 9 月)#
本頁一貫的說法是,該領域的測量工具獎勵克制,卻不為介入計價。OmniVChat(He、Chu、Chen 等人,Alibaba Qwen Team + CUHK + SJTU,arXiv 2609.21465,2026-09-18,empirical)是本知識庫中第一個將克制列為明確分級標準,而非指標附帶產物的來源;結果卻與以上所有內容相反。
測量構念。 Voice Turn-Taking 下有兩個配對子類別,表面條件相同,唯一差異在於使用者是否說完:
- UPC——「使用者停頓但尚未完成」。 使用者受到視覺干擾,中途停止請求。評分規準認為正確回覆是等待或簡短確認收到。作答即是失誤。
- UCR——「使用者已完成請求」。 同樣受到干擾,但請求已說完。此時作答才是正確的。
這組配對正是本頁一直想要、只是從另一角度提出的辨別方式:它能區分無法讀取請求是否完成與無法讓出發言權,因為在 UCR 表現好、UPC 表現差的模型,並非天生傾向沉默——它是在不該開口時仍然發言。
結果。 論文敏感度研究中的六個評分器,全都將 DSLP-VTT-UPC 列為十七個子類別中最弱的一項;測試使用某個前沿商用模型的 2,800 則回覆。它是整套基準的最低分,也是唯一一個正確答案為先不要接手發言的子類別。
為何這不與本頁矛盾,反而讓論點更鮮明。 Peng 等人的研究關於自行接話——沒有人指定模型發言,也沒有任何內容授權它接話,因此它保持沉默。UPC 在該分類中屬於反向的讓出發言權情況:使用者仍在輪次中,尚未讓出發言權,模型卻搶先接話。這兩種失誤其實是同一種能力缺失的兩面——**模型沒有追蹤輪次狀態,只在意是否出現疑問句形式的語句。**一個聽到請求聽起來像是說完就立刻開口,卻在危險情境已經說完時保持沉默的模型,兩種情況都依賴表面形式;這正是 Peng 等人設計 Rhetorical 與 Turn-end 表面形式控制條件要偵測的問題。
**這項研究沒有證明的事。**這是對預先產生的影片片段進行離線視聽理解測試,而非具備即時發言權的雙工系統:沒有延遲測量、沒有插話,而且錄製的探測「並未測試即時打斷」。片段也經過設計,以排除所測量的失誤——生成器禁止模型在對話中途明確指出遺漏了一行,或使用 again 一詞,因此線索確實來自韻律與情境,而非詞彙;但這種資料分布是刻意設計的,不是實際觀察所得。此外,UPC 的最低分是文字評分器依評分規準給出的分數;評分器聽不到停頓,也不是實際測得的起始時間。這項工具及其 COI 已整理於互動性基準。
開放問題#
- 模型是沒有注意到錯誤主張或危險情境,還是注意到了卻保持沉默?文字 token 探測讀取的是輸出分布,而非理解能力,因此無法區分——而這兩種失誤需要相反的修正方向(加強 grounding,或改變發言策略)。可以用已發布的刺激材料進行可證偽測試:探測內部表徵,或將同一份逐字稿以文字問題交給同一模型,檢查它是否會指出自己在語音中拒絕質疑的主張。
- 缺席現象是預訓練資料的特性,還是後訓練的特性?在人類對話中,糾正他人不受鼓勵,因此對話語料在這種行為上正好十分稀少;但此處兩種互動性對齊的 RL 配置都讓內容線索起始率低於自身基準,這是方向相同的後訓練效果。可以透過獎勵模型在配對刺激中依內容觸發起始發言的 RL 配置來解決,並報告輪替發言品質是否因此保留。
- 採用委派架構——由雙工前端處理語音、文字後端理解內容——的系統,是否比原生雙工模型更常介入內容?七種配置都沒有委派;本知識庫中的前端/後端系統則只在工具呼叫上受評估,從未測試未受邀請的糾正。實驗成本不高:讓前端/後端系統與級聯式量產語音堆疊分別執行這套協定。
相關連結#
- 原生多模態建模:融合深度與輸入/輸出二元性——介紹兩種為此構念打造的串流測量工具:ThinkStream 的 Watch-Think-Speak(評估回應時機,不只評估準確度),以及 AURA 的主動式 QA(事件發生時,即使沒有明確查詢也作出回應)
- 全雙工互動——排程能力;本頁討論是否使用該能力,以及其對主動插話的主張缺少的測量結果
- 互動性基準——說明這套協定在 FD-bench、CueSpeak 與工具呼叫群組等測量工具中的位置
- 互動模型——提出「將互動性視為模型行為」的主張,而本文結果界定了該主張的適用範圍
- Agent Epistemic Vigilance——在文字多代理程式系統中測量相同的傾向性失誤;此處則明確授予了介入許可
- LLM-as-a-Judge——介入率來自單一且未經驗證的評分器判斷
- Time-Aligned Micro-Turns——讓模型得以在使用者輪次中途行動的機制;本文顯示這個機制本身沒有提供行動理由
- NVIDIA——VoiceChat-11B 屬於 NVIDIA,也是兩種不會打斷持續語音的配置之一;其自家技術報告更將這種沉默評為停頓處理的第一名
- GPT-Live——量產音訊全雙工模型,尚未接受這套協定測試;自 2026 年 9 月起推出的 API,其所有主動性主張都與處理打斷或克制有關
- Gemini 3.8 Live——第二款在這個面向沒有提出主張的量產語音產品,同時也是主張能在未受提示下切換語言的產品
資料來源#
- Full-Duplex Speech Models Take the Floor When Asked, Not When Needed — Peng、Nuchged、Fu 與 Yao(University of Connecticut / UT Austin / X Square Robot / University of Oxford),arXiv 2609.19596,2026-09-17(
empirical,5 頁,ICASSP 格式)。**解析說明:**來源為 PDF(docling: 2.126.0,經 MLX 版面/表格處理);匯入驗證的五項檢查均順利通過。儘管如此,仍逐格從pdftotext -layout重新讀取全部四張表格,所有數值都逐位相符;表 2 中跨欄的Addressed/Self-select/Yield群組標題也已確認無誤,docling 會將其攤平,於每個跨欄欄位重複標示群組名稱。已檢視圖 2 與圖 3:圖 2 各面板的起始率標記(.07/.34/.83、.08/.15/.12、.41/.35/.68)與表 2 完全一致;圖 2 也證明 Raon 的高起始率來自近乎持續說話,而非受到觸發後回應。docling 內文將一段零散的機構註腳(「3 X Square Robot」)接在 §1 末尾;這只是外觀問題,不影響任何數字。 - Interaction Models: A Scalable Approach to Human-AI Collaboration — Thinking Machines Lab,2026-05(
vendor-claim):本文拿來對照的主動插話主張 - Build more natural voice experiences with GPT‑Live‑1 in the API — OpenAI,2026-09-10(
vendor-claim):此處只用來說明其主張的內容——處理打斷、FDB v1.5 Interactivity 卡的四種被動回應條件、「靜默的情境管理」,以及 Speak 將打斷次數減少約 80%。它未宣稱具備自行接話能力,也沒有提供本頁所測面向的數據。 - NemotronLabs VoiceChat: An Open Full-duplex Speech-to-Speech Model with Tool Calling Capabilities — Balam、Bartley、Casanova 等人(NVIDIA),arXiv 2609.21967,2026-09-18(
empirical,19 頁):關於NVIDIA-NemotronLabs-VoiceChat-11B的第一方技術報告;這是 Peng 等人在參考文獻 [3] 引用、並在十種條件中的九種評為 .00 的檢查點。本文採用其中的表 1(FDB 1.0 停頓 TOR 15.3 / 25.5,開放權重系統中最低)、§2.1 的逐影格 BOS/EOS 輪替發言目標、§3.2 的輪次開始/輪次結束/填充內容損失權重 12.5 / 7.5 / 1.0,以及 §4 強制注入 BOS/EOS 的啟發式端點偵測備援機制。NVIDIA 為 NVIDIA 評分,單次執行,所有基準比較列皆複製自第三方報告。完整討論見全雙工互動與互動/背景模型拆分。 - Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking — Google(Gemini Audio Team),2026-09-15(
vendor-claim):此處只用來說明其主張的內容——早期口語提示、進度敘述,以及對話中自動切換語言。它未宣稱具備自行接話能力,也沒有提供本頁所測面向的數據。
Cited by 11
- Full-Duplex Interaction×7
The consequence for this page: the modes listed above are what the architecture makes possible, and…
- Interactivity Benchmarks×5
The hardest subcategory is knowing when not to speak. All six judges in the sensitivity study rank…
- Agent Epistemic Vigilance×3
So the asymmetry this page names — machinery for reading a source, none for discounting one, and no…
- Time-Aligned Micro-Turns×3
(Qualified 2026-09-21 by Peng et al., empirical. The mechanism removes the constraint on acting…
- Interaction Models×2
Content Driven Intervention — the "speak when needed" mode, measured on five open families and…
- NVIDIA×2
Three things make this NVIDIA's most disclosure-heavy publication in the corpus. It is open-weight…
- Interaction / Background Model Split
Open source, unlike its sibling. Hu et al. released no frontend weights. This checkpoint is on…
- LLM-as-a-Judge
Content Driven Intervention — the opposite end of the validation spectrum from the specimens above:…
- Interaction & Multimodal
Content Driven Intervention — Speaking because the content warrants it — correcting a false claim,…
- Native Multimodal Modeling: Fusion Depth and I/O Duality
The full-duplex rows corroborate the vault's own numbers from a neutral source: Moshi Eval at a 200…
- Open Questions Backlog
Content Driven Intervention ×3 (oldest 7d) — Do the models fail to notice the false claim or the…
Related articles
- Interactivity Benchmarks
FD-bench, Audio MultiChallenge + TimeSpeak/CueSpeak (proactive audio) and RepCount-A/ProactiveVideoQA/Charades (visual…
- Interaction / Background Model Split
Dual-model architecture: a time-aware interaction model stays present while an async background model handles deep reas…
- Interaction Models
Thinking Machines Lab (May 2026): models that handle audio/video/text interaction natively in real time instead of via…
- Live-Path Minimalism
GPT-Live's serving principle — "the voice must flow": the realtime media loop is the only thing on the live path; deleg…
- Native Multimodal Modeling: Fusion Depth and I/O Duality
An, Lu, Dong et al. (Tencent Youtu + 5 universities, May 2026) formalize 'native' as two operator definitions — mid-fus…
