快訊

    多重身分、植入病毒...AI代理失控又一樁 欺騙真人過程全曝光

    2026-08-05 13:58 / 作者 朱紹聖
    美國人工智慧(AI)新創公司OpenAI與Anthropic。路透社
    美國近期傳出多起AI代理自主駭入其他平台帳號的事件後,英國人工智慧安全研究所週二(4日)公布測試報告表示,AI開發商Anthropic最先進的AI模型會利用假身分欺騙真人,並植入惡意程式,成為模型失控的又一案例。

    美國有線電視新聞網(CNN)報導,英國人工智慧安全研究所(AISI)表示,Anthropic和OpenAI的AI模型是在降低安全防護措施的情況下進行測試,並首次發現它們在執行未經授權的任務時,竟透過社交工程(Social Engineering)手段向真人審核者施壓。

    「這是AISI首次在現實世界中觀察到如此嚴重的欺騙行為,且該行為未經提示,並針對真人發起」,AISI補充說,目前還沒有證據顯示這起事件在現實世界造成實際危害。

    在AISI進行的122次網路安全挑戰中,他們發現,AI代理(AI agent)曾有10次「在實際運作的網路採取自主且未經授權的行動,鎖定真實的人士與組織」,其中大部分源自Anthropic的Mythos 5模型,其餘則來自OpenAI的GPT-5.6-Sol模型。

    AISI指出,在最嚴重的情況下,這些AI代理會透過建立「多個假身分」,試圖獲得真人審核員的批准,以「將惡意程式植入於公開使用的開源計劃」。

    該研究所表示,AI代理會「試圖直接聯繫真人,透過線上檔案傳輸服務發送訊息和檔案,以說服對方或其AI編碼工具執行惡意程式」。而在AI代理的行為遭到質疑後,它便隨即修改先前的紀錄,並考慮使用新身分繼續執行前述動作。

    對此,Anthropic在社群媒體X平台發聲明表示,這些模型是在「刻意放寬的條件」下進行測試,當時已移除安全防護措施,且對網路的使用方式並未設有具體限制。「我們正在與他們密切合作,以收集更多事件細節,同時展開自己的調查」,並補充說,目前沒有證據顯示該模型曾逃離安全環境。

    OpenAI則把兩項未經授權的自主行為界定為「越出測試環境」以及「從事與測試任務無關的行為」。該公司在企業部落格貼文中表示:「我們致力於與業界攜手合作,強化安全開展高風險評估的共同做法。」

    OpenAI和Anthropic等兩間AI開發商均於上月底通報,自家AI模型曾逃離測試環境並駭入其他系統,而這是先進AI模型自主行動的又一案例。要求政府採取更多行動來監管AI、甚至放緩其發展步伐的呼聲愈來愈多。

    而在AISI發布消息的同日,Meta、Anthropic、Google及OpenAI等美國頂尖AI公司的代表正與美國總統川普(Donald Trump)幕僚會面,討論先進AI模型自願安全測試的框架。
    朱紹聖 收藏文章

    本網站使用Cookie以便為您提供更優質的使用體驗,若您點擊下方“同意”或繼續瀏覽本網站,即表示您同意我們的Cookie政策,欲瞭解更多資訊請見