新模型具備自主駭客能力 OpenAI緊急暫停Astra部分開發工作

OpenAI緊急暫停新模型Astra部分開發工作。圖/AI生成
OpenAI緊急暫停新模型Astra部分開發工作。圖/AI生成

當地時間上周五(7日),OpenAI宣布,由於安全疑慮,將暫停部分針對人工智慧模型Astra的工作。此舉是在多起AI代理「逃出」控制範圍的事件後作出。

《衛報》(The Guardian)報導,OpenAI表示,經過評估後發現Astra在「代理式編碼與網路安全」方面有顯著進展,已達到「臨界」門檻。該模型能夠在沒有人類介入的情況下,自行發現並利用漏洞,或是在僅被給予「高階目標」時,自行規劃並執行網路攻擊。

公司強調,Astra並未參與稍早一起AI代理在測試中失控、進入公開網路並駭入新創公司Hugging Face的事件。OpenAI也發現其他自主代理逃出控制範圍的案例。這些報告加劇外界對AI模型能力快速提升、以及人類是否仍能有效控制的疑慮。不過,也有批評者認為,OpenAI、Anthropic與Meta等公司主動揭露此類事件,可能是為了炒作技術實力,吸引更多投資人關注。

為防止AI代理出現失控行為,OpenAI宣布將對更高能力模型實施更嚴格的安全控管,包括建立隔離測試環境、限制網路與工具存取,並加強模型權重保護、加密,以及監控與偵測能力。公司表示,將暫停所有不符合這些新要求的Astra相關內部活動。

OpenAI在官方部落格中寫道:「我們致力與政府、安全機構及公民社會合作,確保像Astra這類前沿模型及其後續版本的能力,能以負責任的方式部署,造福全人類。」

同時間,Meta也揭露其模型在網路安全測試中曾駭入另一家公司。英國人工智慧安全研究所(AISI)上周二(4日)表示,由OpenAI與Anthropic驅動的代理,曾主動寄送針對性電子郵件給軟體開發者,試圖通過一項網路挑戰。該機構強調,這些嘗試並未成功,也未造成實際傷害,但這是首次在沒有特定提示的情況下,清楚觀察到自主性與欺騙相關風險在真實環境中出現。AISI指出,這些行為並非模型逃出安全測試環境,而是測試時刻意開放網路存取以評估最大能力,但「這種行為的可能性、持續性與新穎性本身就值得關注」。

這些事件發生之際,川普政府正敲定一套針對AI模型安全與網路安全風險的測試框架。OpenAI與Anthropic在面對中國及其他科技公司競爭加劇的情況下,主張允許任何人查看與修改底層程式碼的開源模型構成安全風險,並呼籲聯邦政府加強相關監管。

延伸閱讀

熱門文章

分享