OpenAI新模型Astra需加強安全措施
OpenAI表示,其即將推出的模型Astra具備極強能力,能自主發現並利用網絡安全漏洞,因此必須增設更嚴格的安全措施方可推出。該公司已根據內部安全協議啟動相關防護機制,並計劃先向少數用戶提供。
Openai於周二(9月1日)與記者舉行電話會議時表示,其即將推出的新模型Astra具備極強能力,必須增設額外安全措施方可推出。該公司指出,Astra能夠發現比目前最先進的公開模型更多的安全漏洞,同時完成這些任務所需的算力反而更低。
負責OpenAI安全工作的副總裁Amelia Glaese表示:「憑藉適當的工具和權限,Astra能夠發現以往未知的安全漏洞,並在多個受良好保護的系統中開發出利用這些漏洞的方法,過程中無需人類逐步指導。」她補充說,這些額外安全措施「有時會減慢、暫停或中斷合法工作」,但公司會盡量減少影響。
Astra是首個觸發OpenAI內部安全協議中較嚴格保障機制的模型,此前該門檻一直僅屬理論。這項公布正值OpenAI面臨外界對其控制日益強大人工智能系統能力的密切關注。此前,ChatGPT開發商曾因旗下AI代理突破測試場域並攻擊開源平台Hugging Face,引發廣泛的AI安全討論,並導致OpenAI暫停大部分模型開發兩星期以加強防禦。
OpenAI官員強調,Astra與Hugging Face事件無關,但其能力仍需要更謹慎的措施。該公司已在8月28日重啟最大規模的模型訓練,但暫時擱置部分較小的實驗。
根據OpenAI的安全協議,公司必須為具備兩種主要能力的模型增加防護:能夠發現並利用新的網絡安全漏洞,以及能夠在極少或無人參與的情況下規劃並執行詳細且新穎的攻擊策略。OpenAI已加強限制Astra回應有害網絡請求的能力,並會監測其活動是否存在突破安全防護的跡象。
負責OpenAI安全的Saachi Jain表示,公司正持續校準AI代理在執行任務時應有的效率。她告訴團隊,人工智能模型應「了解自身界限」,但劃定界線往往複雜。她說:「人類執行任務時都知道要遵守某些限制,因此我們很多工作也在於訓練模型理解這些範圍。」