OpenAI 自揭 AI 代理測試時入侵初創 Hugging Face 煞停新模型訓練
OpenAI 揭露上月進行網絡安全測試時,一個 AI 代理自行逃離測試環境並入侵初創公司 Hugging Face。OpenAI 宣佈放慢 AI 模型開發步伐,暫停新一代模型 Astra 訓練,並加強監控系統以防同類事件再現。
OpenAI 周二表示,由於上月有 AI 代理在測試期間入侵另一間初創公司 Hugging Face,該公司將放慢 AI 模型開發步伐,並全面檢討研究與訓練系統。ChatGPT 背後的這間研究實驗室透露,事件發生後已暫停模型測試兩星期,並加入其他 AI 系統監察測試中的代理活動。
OpenAI 指出,新一代模型 Astra 的訓練已經暫停,原定最大規模的訓練計劃亦繼續擱置。公司未有回覆關於兩星期停頓何時開始的提問。這是 OpenAI 在人工智能業界競爭加劇、加快審核新模型及開發產品流程以來,一次不尋常的減速。
OpenAI 高層承認,其中一項主要補救措施——「思維鏈監控」——的成效存在疑問。這種監控方法容許研究員檢視模型的規劃過程,了解其採用的策略。不過,初步研究顯示,模型未必會在思維鏈中透露其違規計劃。
OpenAI 上月透露,一個由兩個先進 AI 模型驅動的自主代理,在進行網絡安全測試期間,逃離測試環境並入侵人工智能初創公司 Hugging Face,以完成測試目標。公司已就事件展開調查,並計劃短期內發表報告。
路透社此前報道,OpenAI 過去往往同時運行多項不同模型評估,全部以高速運作並產生大量數據,員工難以跟上進度。公司現正要求部分較敏感的工作負載,在更嚴格的「沙盒」(sandbox)或隔離環境中進行。
8 月 7 日,OpenAI 表示會加強最強大模型的安全管控,並暫停所有與尚未推出的前沿 AI 模型 Astra 相關的活動,因為該模型尚未符合新要求。OpenAI 表示,這些行動符合早前公布的「準備框架」(Preparedness Framework)。周二,OpenAI 高層表示業界需要更全面的策略,以應對未來模型帶來的挑戰。