AI心智病毒可在代理間自我傳播,Anthropic研究揭露多代理AI新風險

Anthropic發現特定想法、目標或指令可以形成AI心智病毒(mind virus),透過AI代理彼此傳訊自行擴散。受影響的代理不只會改變原本行為,還可能主動說服其他代理接受相同目標,甚至把相關指令寫入可長期保留的設定檔,讓影響在對話內容被清除後繼續存在。
AI心智病毒和傳統電腦病毒不同,也不完全等同提示注入。部分既有攻擊是由系統直接複製惡意提示,該研究觀察到代理接受某個想法後,主動透過一般文字訊息影響其他代理,再由新感染的代理繼續往下傳播。

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *