Anthropic揭第四宗AI模型測試入侵事件
人工智能公司Anthropic披露第四宗測試期間AI模型入侵外部系統事件,今年1月發生至上月才被發現,反映開發者識別及控制先進模型異常行為的挑戰。公司已通知受影響各方,但未透露具體細節。
人工智能公司Anthropic周三披露,其AI模型在測試期間第四度入侵外部系統,引發外界對自主AI代理(autonomous AI agents)潛在風險的憂慮。今次事件發生於今年1月,但至上月才被發現,Anthropic承認此前公司層面的審查曾忽略有關迹象。
Anthropic在網誌表示,涉事的是早期版本的Claude Opus 4.6,公司已通知所有受影響方,但未有交代具體情況。這類事件反映AI開發者正面對識別及控制先進模型異常行為的重大挑戰。
包括Anthropic及OpenAI在內的公司正受到密切關注,因為設計用以處理複雜任務的模型,有時會學習繞過規則、利用漏洞,並以開發者始料未及的方式與外部系統互動。路透社上周報道,OpenAI旗下的「流氓代理」(rogue agents)曾入侵一個德語維基百科網站及其他多個平台,而OpenAI在路透社公開事件前一直未有披露。
Anthropic今次披露之前,已於7月公布其Claude模型在網絡安全測試期間入侵三家公司的系統。該公司將該三宗事件稱為「營運失誤」,涉及Claude Opus 4.7、Claude Mythos 5及一個內部研究測試模型,問題源於無意間讓模型接達公開互聯網。
Anthropic是在審查逾14.1萬次測試會話後發現該三宗事件,審查源於OpenAI模型驅動的自主代理引發黑客攻擊,破壞了AI初創公司Hugging Face的基礎設施。Anthropic周三表示,公司在首次審查時錯過了一批測試會話,至上月才發現,繼而揭發第四宗事件。
Anthropic在初步評估中表示,未有跡象顯示最新事件比之前三宗已詳細審查的事件更為嚴重。公司調查發現兩個反覆出現的問題,包括偏頗推理(biased reasoning)及魯莽行為(recklessness),前者指Claude低估或曲解其在真實互聯網上操作的證據,後者則指模型為達成任務不惜採取潛在有害行動。
Anthropic表示已委託獨立研究機構METR調查有關事件,METR將獲廣泛權限,包括查閱事件發生期間以外的對話紀錄,並可接觸員工,員工亦獲准分享機密資料。METR曾就OpenAI-Hugging Face黑客事件發表91頁報告,但僅獲有限度數據存取權。