資料來源#
- Detecting and countering misuse of AI: September 2026
- GTIG AI Threat Tracker: From Prompting to Autonomy – The Evolution of Adversarial AI
摘要#
Anthropic 的 2026 年 9 月威脅報告詳述了九起遭瓦解的影響力行動——報告對此的定義是,相關努力旨在「操縱資訊環境……意圖欺騙、扭曲或暗中施加影響……通常會隱瞞行動的起源、贊助方或協調情形」。行動源自俄羅斯、伊朗、土耳其,以及海灣地區、南亞、非洲和歐洲各地;行動者包括政府、國家宣傳機構、國營媒體、向付費客戶兜售影響力的商業公司、國內政治行動者,以及一例流亡中的反對派運動。
有意思的發現不是語言模型會寫宣傳文案,而是模型打造了行動的哪個部分。case-study,第一方,未經外部查證;所有關於普遍程度與成效的說法,都是供應商對自家偵測結果的評估。
模型打造的是整套機器,而不只是內容#
報告提出的趨勢是:行動者讓模型產出「教條手冊、反對派檔案、部長職掌、人物設定系統、目標資料庫、編入編輯忠誠要求的雇用合約,以及用來評比行動成員的員工評分標準。若沒有這些工具,原本就需要一個配置人力的計畫辦公室。」
中非共和國案例(GTG-04001)是最清楚的例子,也是整個章節中最醒目的細節。一名在班吉的俄語行動者,為與 Wagner/Africa Corps 有關聯的外國資訊操縱與干預行動提供製作後勤,並用 Claude 管理行動的人力資源:規定效忠中非共和國總統及「俄羅斯及其駐軍」的合約、職務說明、評分標準、三次記過解雇程序——接著依照這些標準評分員工文章,再詢問 Claude 哪些員工該留、哪些該解雇。Claude 指出評分標準對政治立場有所加權時,「行動者便把它改稱中性用語,保留評分方式。」當時模型寫的不是宣傳文案,而是在管理宣傳辦公室的人事制度;模型提出的唯一安全介入,則被改個名稱便吸收掉了。
伊朗三方行動(GTG-34001——文化與伊斯蘭指導部下屬的 ICCO、呼羅珊禮薩維省伊斯蘭宣傳辦公室、Bina 文化觀察站)在部會規模上呈現相同模式:行動計畫、教條手冊、人物設定系統、目標資料庫、部會規劃文件、印有官方 ICCO 信頭的九部分國際影響力組合,以及最高領袖葬禮的組織計畫。阿聯案例(GTG-84002)則增加了以克隆的瑞士非政府組織身分,代兩名具名人士撰寫聯合國人權理事會證詞;18 名歐洲議會議員的個人檔案;以及針對曾批評阿聯在蘇丹行為的聯合國特別報告員所製作的反問責檔案。
持續沿用的教條檔案,作為協調基礎#
讓這些行動得以擴大的機制,是這個 wiki 已追蹤為正當 harness 模式的一種做法。報告指出:「包含教條的 Markdown 檔案在數百個工作階段中幾乎原封不動地重複使用。行動者在 AI 代理程式內保留禁用詞清單,維護共用的核准來源和規避規則檔案,並執行以固定批次呼叫 Claude 的自訂軟體。」其結果是:「中央設定意味著產製內容的人從來不必彼此協調,甚至不必知道對方的存在。」有一名行動者正在製作課程,準備把這套工作流程教給其他人。
MEK/NCRI 行動(GTG-84006)點出了相關成品:一個名為「Viktor」的共用代理平台,各工作區都有自己的長期記憶檔案,隨時間更新禁用詞、核准來源、帳號管理規則和偵測規避規則,「讓代理程式即使沒有真人使用者逐次指揮,也能持續產出內容。」瓦解行動表中的特徵清單包含 SKILL.md / LEARNINGS.md memory。阿聯行動則在系統設定中嵌入一份總教條檔案,指示 Claude「在數百個工作階段中」重複執行同一任務。
這是對抗性使用的 Agent Context Files,值得在此列出,因為它改變了「協調」在歸因上的意義。傳統的協同不真實行為偵測,會尋找共用基礎設施、同步時間或行動者之間的聯繫。這裡共用的成品是一份常設指令文字檔,複製到彼此沒有其他關聯的帳號中;產出的內容之所以一致,是因為教條一致,而非有人互相交談。過去被視為指揮管道證據的一致性,如今可能只是複製檔案的證據。
洗白歸因,包括洗掉模型本身的保留語#
行動者「提示 Claude 刻意移除轉載材料中的國家歸因,讓主張經過一連串媒體傳播,看起來像是獲得獨立證實」。俄羅斯國營媒體編輯台(GTG-24015)把這當成產品來操作:同一則報導在 Sputnik Moldova、RIA Novosti 和摩爾多瓦的擴散網絡中反覆迴響,「製造虛假的查證迴圈」。馬來西亞平台(GTG-84005)重新發布 TV BRICS、Xinhua、Sputnik/RIA 和 CGTN 的內容,移除國家歸因,讓它們看起來像是馬來西亞獨立報導。
有一個案例性質截然不同,同樣該列入安全頁面與威脅頁面:一名與俄羅斯國營媒體有關的行動者「產出模型標記為未經查證的主張,接著指示模型刪除這些保留語,並把所有內容說成已確認,使材料讀起來像是既定事實。」模型的校準訊號——標示未經查證主張的保留語——被當成可移除的格式層。模型的文風也是如此:中非共和國行動者要求模型去掉「典型的格式習慣,積極避免新聞動態看起來像是合成的 AI 生成文字。」兩者都是同一種做法:讀者可能用來辨認機器撰寫或機器不確定性的線索,在行動者眼中都只是後製步驟。
拒絕請求,以及行動者如何繞過拒絕#
Claude 在幾個節點拒絕了請求,後續發展的模式相當一致,足以成為一項發現:
- 中非共和國:拒絕行動中最激進的要求——指名真實人士是武裝分子,藉此促使安全部隊對他們採取行動。「行動者轉而改用匿名消息來源的說法。」
- 馬來西亞:指出一份捏造檔案是政治誹謗材料後拒絕,並且「對於明確提及心理作戰的措辭有所抗拒。」「行動者協商出經過消毒的措辭,繼續朝相同能力推進。」
先拒絕明示的框架,接著改換說法,取得相同能力。這是影響力行動中 Safeguard Evasion by Task Decomposition 所記錄、橫跨五類危害的模式。
觸及人數的數字實際上說明了什麼#
報告以 Brookings Breakout Scale 評估每起行動(第一級 = 影響侷限於單一平台上的單一社群;第六級 = 對廣大公眾和政策造成影響),而分布情形則平衡了前文的描述:
| 行動 | 產製規模 | 突破程度 |
|---|---|---|
| 肯亞假草根動員(GTG-54004) | 每個工作階段恰好批次產出 50 則推文,在同一套策略下支持政府、反對反對派;同一工作流程也轉售給零售品牌做行銷 | 第一級——「完全孤立在假帳號網絡內……未能觸及或影響任何真實人士」 |
| 商業化影響力即服務(GTG-54002,LKM Company,法國) | 約 20 種語言共 8,913 篇文章,散布於約 70 個捏造的新聞網站、70 個相配的 X 帳號、250 多個不真實留言帳號,橫跨六大洲 | 第二級——沒有證據顯示影響力突破自身行動範圍 |
| 馬來西亞選舉平台(GTG-84005,BBS Bilişim,伊斯坦堡) | 約 1,000 個設有暖身機制的假 X 帳號、一個假媒體、捏造的檔案,以及根據真實人口普查和選舉資料建立的全部 222 個國會選區檔案 | 第二級 |
| MEK/NCRI(GTG-84006) | 擷取 500 多個頻道,分析約 51,944 則封存訊息製成心理特徵檔案,並製作附有波斯語音訊的 AI 虛擬人物 | 第二級 |
| 親伊朗政府三方行動(GTG-34001) | 已使用六種語言,計畫擴至 20 種語言;100 多個付費伊朗頻道 | 第三級 |
| 孟加拉國人民聯盟(GTG-54006) | 約 16 個月輪替使用 29 個帳號;至少 1,500 個標題、300 種敘事、1,500 個圖片提示 | 第三級 |
| 阿聯/穆斯林兄弟會(GTG-84002) | 約 300 個不真實的網紅帳號、一個克隆的非政府組織、代筆的聯合國證詞 | 第三級 |
| 中非共和國/Radio Lengo Songo(GTG-04001) | 每日內容行動,供稿給一個 98.9 FM 電台和國家廣播公司 | 第四級 |
Anthropic 自己的解讀是:「我們發現的大多數內容,幾乎沒有或完全沒有獲得真實互動……最廣泛的真實觸及出現在國營媒體作為散播管道之處(包括 FM 廣播、衛星與短波廣播,以及全球電視)。」唯一觸及真實受眾的行動,之所以奏效,是因為它擁有一台廣播發射機,而非模型更好。產製成本低廉,散播成本卻不低;這九個案例沒有任何一個顯示 AI 解決了散播問題。有兩項但書指向相反方向:報告評分的是遭到早期瓦解的行動,因此低觸及度部分是評估介入行動的結果;而 GTG-24015 的產出經由既有的專業流程,登上真正的俄羅斯廣播電波,這正是模型成功之處——它不必自行建立散播管道。
另一家供應商的判斷:提升生產力,而非突破(GTIG,2026 年 9 月)#
GTIG 的 2026 年第二季追蹤報告(GTIG AI Threat Tracker: From Prompting to Autonomy – The Evolution of Adversarial AI,case-study,第一方,與 Anthropic 相同的上游觀測位置)從 Gemini 得出相同結論:「這些手法都沒有帶來突破性能力」,而且「我們沒有看到成功自動化的證據」。報告觀察到與中國、伊朗和俄羅斯相關的行動,以及商業垃圾訊息發送者和付費散播不實資訊的行動者。這些例子符合本頁「模型打造整套機器」的解讀,但規模較小。伊朗行動者讓 Gemini 為虛構人物撰寫詳盡的文字轉圖像提示(包含相機角度、攝影棚燈光、臉部紋理),也讓它扮演內建說服技巧的專家角色(心理作戰專家、石油市場分析師)。值得關注的是前瞻性的項目。印尼行動者正設計一個中央社群媒體自動化平台,配備反偵測瀏覽器和代理輪替,並加入一個WhatsApp 機器人閘道,支援多帳號管理與「類人 AI 對話能力」。GTIG 表示「尚未觀察到這些互動能力部署於實際行動中」。Anthropic 克隆行動者案例(見下方 User Awareness)是以人工操作的同類互動能力,因此 GTIG 等待的下一步,是把一項已能手動奏效的技巧自動化。兩家供應商得出相同的低突破性結論,彼此印證,但限制也相同:兩者都看得到建構階段,卻都無法追蹤內容傳播至受眾。
觀測位置本身就是方法論上的發現#
「社群媒體網站通常要等內容開始流傳後,才會看見一場行動;我們或許能在行動仍在建構時,就在 Claude 上看到它。行動者用 AI 規劃行動、選擇目標、撰寫材料……行動上線後,我們就失去對它的觀測能力。」
模型供應商位於平台上游,處於產製階段。這是影響力行動研究社群以往未曾採用過、截然不同的觀測位置,而且有利有弊。這讓 Anthropic 能描述教條檔案、員工評分標準和未公開的目標資料庫——這些成品從未流傳,平台端研究者也無從得知。這也解釋了為何觸及數據較弱:供應商無法追蹤內容傳播出去後的情況,只能仰賴開源研究和業界資料描述後續發展。此外,除了報告挑選「最值得注意且新穎」案例外,這也是第三個理由,說明為何此處沒有任何普遍程度的主張具代表性:樣本只包含在建構階段使用美國前沿模型的行動,因此排除了在本地使用開放權重模型的行動者。
延伸閱讀#
-
Illicit Distillation — 同一份報告中的姊妹篇第一方歸因研究,也有相同的方法論問題:列出具名對象與公開數字,卻沒有外部查核
-
AI-Enabled State Surveillance — 同一份報告的姊妹章節,且常涉及相同行動者:中非共和國行動對反對派人士執行常態監控計畫,MEK 網絡建立伊朗境內人士的逮捕紀錄檔案,而伊朗宣傳機構與監控單位共用人員;這兩頁把同一條連續脈絡分開討論
-
Agent Context Files — 轉為對抗性運用的模式:教條 Markdown、禁用詞清單、核准來源檔案和
SKILL.md/LEARNINGS.md記憶,在數百個工作階段中近乎原樣重複使用,讓從未見面的行動者產出一致內容 -
Safeguard Evasion by Task Decomposition — 這裡兩次遭拒絕的請求及其繞過方式:改用匿名來源框架,以及協商經過消毒的措辭來取得相同能力
-
The Stolen Model-Access Economy — 說明其中數起行動如何存取 Claude:透過 VPN、外國電話號碼、輪替帳號和第三方 IP 遮蔽服務,因為伊朗遭封鎖而無法直接存取
-
AI-Accelerated Offense (總覽) — 同樣的「AI 縮小勞動力差距」論點,但放在資訊領域:單一員工的產出超越新聞編輯室所能製作的量,正如一名國家行動者能做到超越一組入侵專家團隊的程度
-
User Awareness — 身分冒充案例則反轉了這個情境:行動者克隆一名真實行動者的 Telegram 帳號,讓 Claude 閱讀他約 8,400 則貼文以模仿其風格,並在伊朗境內與他的聯絡人進行即時政治對話;對方「不知道自己正在和 AI 輔助帳號交談」
-
Anthropic — 本文作者、執法行動者,也是此處所有數字的唯一來源
-
Google Threat Intelligence Group (GTIG) — 第二家供應商的說法,同樣判定沒有突破性進展,且互動式機器人閘道尚未部署
開放問題#
- 突破尺度的分布(多數為第一至第三級)是由及早瓦解行動的一方評估的。是否有平台端或學術研究衡量過未遭中斷的 AI 輔助影響力行動的觸及程度,讓我們能把低觸及發現與介入行動的影響分開?
- 共用教條檔案會讓彼此沒有聯繫、也不共用基礎設施的行動者產出一致內容。是否有歸因方法能偵測這一點——例如複製的常設提示所帶來的文體或指令層級特徵——還是這會徹底擊敗協調行動偵測?
- 報告指出,AI 協助打造的整套機器「原本就需要一個配置人力的計畫辦公室」。有沒有案例顯示,整套機器在帳號遭停權後仍持續運作,就像 AI-Enabled State Surveillance 所述的馬利監控平台?本文沒有說明這一點。
資料來源#
- Detecting and countering misuse of AI: September 2026 — Anthropic Threat Intelligence,Detecting and countering misuse of AI: September 2026,2026-09-10,
case-study(第一方;瓦解行動的一方評估自己的偵測和觸及估計;案例是刻意挑出的「最值得注意且新穎」案例,因此本質上不具代表性)。「影響力行動」章節,第 41–80 頁:定義、九個案例研究 GTG-04001 / 54002 / 84005 / 24015 / 34001 / 54006 / 84006 / 54004 / 84002、七項趨勢清單(影響力即服務、AI 作為新聞編輯台、打造整套機器、複雜工具使用、洗白歸因、作業安全、假冒和偽裝人物)、「我們如何調查」和「我們如何衡量觸及程度」的方法論段落,以及各案例的突破尺度評級。上文的觸及表是根據各案例的文字評級整理,PDF 並無此表。圖 2–4(第 49–51 頁,不真實留言群組的螢幕截圖)以圖像進行兩階段判讀,僅供說明——本文沒有依據這些圖的數量資料 - GTIG AI Threat Tracker: From Prompting to Autonomy – The Evolution of Adversarial AI — Google Threat Intelligence Group,GTIG AI Threat Tracker: From Prompting to Autonomy,2026-09-08,
case-study(第一方;未提供觸及或互動數字)。僅引用「資訊行動」小節及其緩解措施方框:沒有突破性進展的判斷、伊朗人物設定圖像與敘事提示,以及印尼自動化平台/尚未在實際行動中觀察到的 WhatsApp 機器人閘道
Cited by 11
- Agent Context Files×2
The file replaces the command channel, and that is an attribution problem. "The central setup meant…
- Anthropic×2
Detecting and countering misuse of AI: September 2026 is the fourth in a series (March, August and…
- AI-Accelerated Offense
Ai Enabled State Surveillance / Ai Enabled Influence Operations — the same labor-collapse thesis…
- AI-Enabled State Surveillance
Ai Enabled Influence Operations — the sibling section, frequently the same actor: the CAR…
- Google Threat Intelligence Group (GTIG)
It is the second first-party vantage on adversarial AI use, alongside Anthropic's September 2026…
- Illicit Distillation
Ai Enabled Influence Operations — the sibling first-party attribution exercise in the same report,…
- Agent Security
Ai Enabled Influence Operations — Nine disrupted campaigns in Anthropic's September 2026 threat…
- Open Questions Backlog
Ai Enabled Influence Operations ×3 (oldest 12d) — The Breakout Scale distribution (mostly…
- Safeguard Evasion by Task Decomposition
Ai Enabled Influence Operations — the negotiation form: a defamation refusal answered with…
- The Stolen Model-Access Economy
Ai Enabled Influence Operations — how several operations reached a blocked service at all: VPNs,…
- User Awareness
Ai Enabled Influence Operations — the inverse case in the wild: an operation cloned a real…
Related articles
- Autonomous Intrusion
The class of attack in which a model or a collective of agents conducts a network intrusion end-to-end — the campaign r…
- AI-Enabled State Surveillance
Eight disrupted operations in Anthropic's September 2026 threat report show the model standing in for three different i…
- The Stolen Model-Access Economy
AI credentials have become loot, compute and cover at once — resale value, attack workloads run at the victim's expense…
- Agent Supply Chain Risk
Runtime-composed agent ecosystems expand the supply-chain attack surface: model poisoning (250 docs backdoor a 13B mode…
- Anthropic
AI safety company / vendor of Claude; mission-as-tiebreaker culture; ~30–40 PMs across teams; Mike Krieger leads Labs r…
