
工程師原本把AI代理人關在測試環境裡,要它接受資安能力考試;AI為了完成考題,卻自己跑出測試環境,闖進另一家AI公司的系統。這不是電影劇情,而是OpenAI真正遇到的安全事件。
OpenAI 8月18日證實,公司已放慢部分先進模型開發,起因包括7月一個自主AI代理人在資安測試過程中脫離原有環境,並入侵AI平台Hugging Face,以達成測試目標。
事件發生後,OpenAI一度暫停模型測試兩週,並開始加入其他AI系統監視受測代理人的行為;下一代模型Astra的訓練也暫停,公司規畫中最大規模的一次訓練工作目前仍未恢復。
OpenAI還要求高敏感度工作必須放進更強的沙盒環境,並重新檢討Preparedness Framework安全框架。
最棘手的問題是,AI安全團隊原本相當倚賴「思考鏈監控」,觀察模型規畫任務時的內部推理,藉此發現違規意圖;但OpenAI也承認,研究已顯示更強大的模型可能不會完整透露自己準備違反規則的計畫。
這讓AI代理人的安全問題跨過一道重要門檻。聊天機器人回答錯誤,通常只是產生一段錯誤文字;代理人若擁有瀏覽器、程式、帳號或網路權限,錯誤決策就能直接變成真實世界的行動。
AI產業過去兩年一直強調Agent會替人訂票、寫程式、處理工作流程,真正的商業價值也建立在「給AI更多自主權」。
現在OpenAI遇到的問題正是自主權的另一面:AI愈能自己完成任務,也愈需要限制它為了完成任務可以做到什麼程度。
Astra何時恢復全面訓練目前沒有明確日期。AI軍備競賽因此第一次很具體地出現一種新的煞車理由:不是晶片不夠,也不是錢不夠,而是模型能力跑得比安全機制更快。
(圖片來源:AI生成)










