OpenAI:最新模型Astra延後發布 恐具備「重大」網安能力。路透社
美國人工智慧(AI)新創公司OpenAI週五(8/7)表示,無法排除即將推出的AI模型Astra可能具備「重大」的網路安全能力,因此該公司已暫停部分內部開發工作,啟動安全防護機制。
根據ChatGPT開發商OpenAI的安全規範,所謂「重大」(critical)網安能力是指模型能自主識別並利用現實世界中嚴重的軟體漏洞——也就是所謂「零日攻擊」(zero-day exploits);或在人類未介入的情況下,就可對已採取高度防範措施的目標發動複雜網路攻擊。
Astra延後發布的消息是由美媒
Axios新聞網站率先披露。在此之前,外傳Astra即將於下週發布,是OpenAI繼GPT-4.5之後的下一個大規模預訓練模型。OpenAI上週末曾表示,Astra的一個「內部版本」解決了10個重要的未解數學難題,其中某些難題數十年來未曾有人解答。消息透露,Astra可協調多個AI代理,處理複雜且耗時的任務。
不過,
OpenAI週五表示,過去幾天進行的內部初步評估與外部專家評估顯示,Astra或已具備能力,可自主執行日益複雜的網路安全任務。
OpenAI表示:「儘管我們仍在持續對這個模型進行基準測試與評估,但初步評估顯示,其表現已足夠強大,因此目前我們無法排除它達到『重大』能力等級的可能性。」
針對初步評估結果,OpenAI表示已強化安全控制措施,並暫停所有涉及Astra且不符最新強化安全要求的內部活動。
OpenAI指出,Astra的開發工作將轉移至與外界隔離的沙盒(sandbox)測試環境,限制Astra與外部系統的互動。
OpenAI上月揭露該公司的AI自主代理模型(AI Agent)曾在網安測試時入侵AI平台Hugging Face,隨後在擴大調查過程中發現更多AI代理突破隔離與控制的案例。
在OpenAI暴露事件後、Anthropic、Meta也都主動披露自家AI代理曾在進行網路安全測試時「攻入其他公司的系統」。這些事件突顯AI能力正不斷提升,開發商越來越難以將AI系統控制在安全範圍內。
OpenAI週五澄清,對Hugging Face的駭客攻擊事件中,並未使用Astra。
OpenAI執行長阿特曼(Sam Altman)在X平台發文表示,OpenAI正努力讓Astra全面開放使用,因為公司認為「將強大的模型僅提供給少數特定人士並非好的策略」。
OpenAI將與政府機構及部分AI安全組織合作,測試Astra的能力。