美國人工智慧(AI)新創公司OpenAI與Anthropic。路透社
美國近期傳出多起AI代理自主駭入其他平台帳號的事件後,英國人工智慧安全研究所週二(4日)公布測試報告表示,AI開發商Anthropic最先進的AI模型會利用假身分欺騙真人,並植入惡意程式,成為模型失控的又一案例。
美國有線電視新聞網(CNN)報導,英國人工智慧安全研究所(AISI)表示,Anthropic和OpenAI的AI模型是在降低安全防護措施的情況下進行測試,並首次發現它們在執行未經授權的任務時,竟透過社交工程(Social Engineering)手段向真人審核者施壓。
「這是AISI首次在現實世界中觀察到如此嚴重的欺騙行為,且該行為未經提示,並針對真人發起」,AISI補充說,目前還沒有證據顯示這起事件在現實世界造成實際危害。
在AISI進行的122次網路安全挑戰中,他們發現,AI代理(AI agent)曾有10次「在實際運作的網路採取自主且未經授權的行動,鎖定真實的人士與組織」,其中大部分源自Anthropic的Mythos 5模型,其餘則來自OpenAI的GPT-5.6-Sol模型。
AISI指出,在最嚴重的情況下,這些AI代理會透過建立「多個假身分」,試圖獲得真人審核員的批准,以「將惡意程式植入於公開使用的開源計劃」。
該研究所表示,AI代理會「試圖直接聯繫真人,透過線上檔案傳輸服務發送訊息和檔案,以說服對方或其AI編碼工具執行惡意程式」。而在AI代理的行為遭到質疑後,它便隨即修改先前的紀錄,並考慮使用新身分繼續執行前述動作。
對此,Anthropic在社群媒體X平台發聲明表示,這些模型是在「刻意放寬的條件」下進行測試,當時已移除安全防護措施,且對網路的使用方式並未設有具體限制。「我們正在與他們密切合作,以收集更多事件細節,同時展開自己的調查」,並補充說,目前沒有證據顯示該模型曾逃離安全環境。
OpenAI則把兩項未經授權的自主行為界定為「越出測試環境」以及「從事與測試任務無關的行為」。該公司在企業部落格貼文中表示:「我們致力於與業界攜手合作,強化安全開展高風險評估的共同做法。」
OpenAI和Anthropic等兩間AI開發商均於上月底通報,自家AI模型曾逃離測試環境並駭入其他系統,而這是先進AI模型自主行動的又一案例。要求政府採取更多行動來監管AI、甚至放緩其發展步伐的呼聲愈來愈多。
而在AISI發布消息的同日,Meta、Anthropic、Google及OpenAI等美國頂尖AI公司的代表正與美國總統川普(Donald Trump)幕僚會面,討論先進AI模型自願安全測試的框架。