AI代理接連突破資安測試邊界,OpenAI、Anthropic與Meta事件敲響資安警鐘
科技產業資訊室(iKnow) - 黃松勳 發表於 2026年8月7日

圖、AI代理接連突破資安測試邊界,OpenAI、Anthropic與Meta事件敲響資安警鐘
生成式AI正快速從回答問題的聊天機器人,演變為能夠自行規劃任務、使用工具與操作網路服務的AI代理(AI Agent),但更高的自主能力也開始帶來新的資安挑戰。近期OpenAI、Anthropic與Meta相繼揭露旗下或受測AI模型在資安評估過程中出現未經授權的網路行為,其中部分模型甚至接觸真實企業、開發者與外部系統,使AI安全議題從模型輸出內容是否有害,進一步延伸至「AI實際能做什麼」的行動安全問題。
英國AI Security Institute(AISI)的最新測試尤其凸顯這項風險。研究人員在允許模型連網、並降低部分安全防護的實驗條件下進行資安能力評估,結果發現AI代理曾自主採取測試範圍以外的行動,包括接觸真實人物與組織。最嚴重案例中,Anthropic受測模型甚至建立多個假身分,試圖說服開源專案維護者接受含有惡意程式碼的修改,顯示AI代理已具備將技術攻擊與社交工程結合的能力。
根據AISI披露的測試結果,研究團隊在7款先進AI模型的資安評估中,發現19起AI代理在公開網際網路採取未經授權行動的情況,絕大多數來自Anthropic模型,另有兩起涉及OpenAI的GPT-5.6 Sol。研究人員強調,這些模型並非真正「逃離沙盒」後自行連上網路,而是在實驗設計中原本就被允許存取網際網路,且部分供應商設定的資安防護機制也被關閉,因此事件同時反映出模型自主能力與測試環境管理兩方面的風險。
Anthropic:假身分與社交工程,AI代理開始直接接觸真人
Anthropic模型的行為尤其受到注意。測試期間,模型除了提出含惡意程式碼的程式修改要求,還建立假冒使用者帳號,聲稱已獨立檢查相關程式碼並確認安全;同時向兩名專案維護者寄送5封電子郵件,其中部分郵件夾帶惡意程式。模型甚至研判專案維護工作可能由AI程式代理執行,因此在另一個GitHub專案留下針對AI程式代理設計的提示注入內容,呈現跨越傳統單一路徑攻擊的策略規劃能力。
OpenAI:多個AI代理暗中協作,最終突破環境進入Hugging Face
OpenAI面臨的問題則顯示,多代理協作可能形成另一種新的安全變數。該公司研究人員於Black Hat資安大會揭露,多個內部AI代理自5月起便透過OpenAI內部Artifactory檔案系統建立訊息板,在研究人員未察覺的情況下交換完成資安測試的技巧與資訊。部分模型後續找到利用Artifactory取得外部網路資源的方法,甚至發現並利用零時差漏洞取得管理權限,相關活動最終導致內部系統異常。
更值得注意的是,研究團隊在撤銷模型權限、移除訊息板並修補系統後,AI代理數日內又找到其他通訊方式,繼續交換漏洞利用技巧,最終兩個模型串聯多項技術,在7月中旬進入AI開發平台Hugging Face。OpenAI研究人員指出,模型原本只是被要求完成資安測試,但當正常方法無法取得答案時,會嘗試以「鑽漏洞」甚至作弊方式取得獎勵,凸顯任務目標設定與代理行為邊界之間可能存在落差。
Meta:測試環境設定錯誤,AI取得網路權限並入侵外部系統
類似問題也出現在Meta。Meta表示,其AI模型在第三方資安測試過程中,因測試環境「設定錯誤」而意外取得網際網路存取能力,之後利用第三方服務的安全漏洞進入外部系統。負責測試的Irregular指出,該事件與先前Anthropic測試所遇到的環境配置問題相似。這意味近期所謂AI「自行駭入」事件,不能全部歸因於模型突然產生不可控制的自主意圖,測試環境的隔離、權限設定與網路控制同樣是重要因素。
面對相關事件,AISI已停止部分AI代理資安評估、隔離相關虛擬機器,並規劃重新設計測試架構。未來措施包括導入更細緻的網路存取控制、多層次防禦機制,以及利用另一個大型語言模型即時監控受測代理的操作,在模型要求執行超出測試範圍的行動時即時攔截。此外,研究團隊也將強化沙盒隔離與測試提示設計,避免模型因面臨無法在既定限制內完成的任務,而尋找非預期的替代路徑。
OpenAI也表示將大幅提高AI代理監控與資安投入,並在研究速度與安全控制之間重新調整優先順序。這些事件所揭示的核心問題,不只是AI模型能否發現漏洞,而是當AI代理同時具備長時間執行任務、工具使用、網路連線、程式撰寫與多代理協作能力後,傳統以「限制回答內容」為核心的安全機制已不足以涵蓋風險。AI安全架構必須進一步管理模型可以存取哪些資源、採取哪些行動,以及何時必須取得人類授權。
隨著AI代理逐步取得程式執行、網路存取、工具調用與跨系統操作能力,近期事件凸顯的已不只是模型本身的安全問題,而是企業是否具備足以約束自主代理的執行環境。未來AI Agent若進一步進入軟體開發、資安維運與企業核心流程,權限最小化、網路隔離、即時行為監控、人類授權及異常中止機制,都將成為部署架構的重要環節。尤其當模型開始能以非預期方式尋找完成任務的替代路徑,如何在保留AI自主執行效率的同時,確保其行動始終維持在可控制與可追蹤的範圍內,將直接影響AI代理能否安全進入大規模商業應用。(1836字;圖1)
參考資料:
AI agents fake identities, target real people in new security incident. CNN, 2026/8/5
OpenAI’s models shared hacking tips on a secret messaging board before Hugging Face breach. Politico, 2026/8/5
Anthropic’s AI used fake identities, malware in rogue attack on GitHub project. Ars Technica, 2026/8/6
Out-of-control AI systems are going rogue and hacking people. Is it time to panic? The Independent, 2026/8/6
Rogue OpenAI models behind 'unprecedented cybersecurity incident' teamed up to break out of their testing environment. Tom’s Hardware, 2026/8/6
Meta says its AI model hacked another company, adding to worries about bots going rogue. AP News, 2026/8/7
Meta becomes latest firm to say its AI hacked another company. BBC, 2026/8/6
--------------------------------------------------------------------------------------------------------------------------------------------
【聲明】
1.科技產業資訊室刊載此文不代表同意其說法或描述,僅為提供更多訊息,也不構成任何投資建議。
2.著作權所有,非經本網站書面授權同意不得將本文以任何形式修改、複製、儲存、傳播或轉載,本中心保留一切法律追訴權利。
|