快訊

    輝達推出AI安全平台 防止AI代理失控

    2026-09-28 20:14 / 作者 陳家齊
    輝達執行長黃仁勳資料照片。路透社
    輝達(Nvidia)在週一(28日)發表全新的安全平台,以防止人工智慧(AI)的代理(agent)失控。在此之前,多家AI龍頭企業都發生AI代理失控、進行網路攻擊的情況,使全球對AI高速發展的安全性提出質疑。

    這家AI晶片巨頭表示,其推出的「輝達開放代理安全平台」(Nvidia Open Agent Safety Platform)有一整套相關工具,可讓開發人員持續監控與管理AI行為,確保AI代理遵循規範。公司指出,該軟體包含一項技術,能在「幾毫秒內」將試圖越界的代理進行隔離。

    AI代理(AI Agents)是讓AI自主自動行動,以完成人類交付的任務。但是,在達成交付任務的途中,AI代理經常擅自採取不安全的行動,以完成交付的目標。AI代理目前也是AI在消費者市場很可能有巨大商業潛力的應用,臉書母公司Meta本月推出的AI代理Muse,可以自動安排行程,訂購票券,及時通知特價商品,已掀起民眾下載使用的狂潮。

    包括OpenAI、Anthropic、Meta以及Alphabet旗下Google等企業的AI代理,在近幾個月內皆曾發生失控案例。其中,OpenAI的失控AI代理甚至駭入澳洲政府的網站,成為失控AI攻擊國家政府的第一個案例。

    OpenAI的代理在今年夏天,也對AI新創公司Hugging Face發動了干擾極大的駭客攻擊。另一巨頭Anthropic則於7月表示,其正在測試的AI曾連上網際網路,並在該AI開發商不知情的情況下,於4月開始發生了三起駭入企業網站事件。

    輝達指出,近期這些事件的模式如出一轍:AI代理都能繞過沙盒(開發人員用於測試模型的封閉環境)的安全控制措施,以完成其任務。輝達的安全工具將避免這種事情發生

    執行長黃仁勳表示:「當我們持續擴大探索AI功能的邊境時,我們也必須加速推進探索AI安全技術的邊境。」

    針對AI發展恐怕「毀滅人類」的疑慮,黃仁勳已在多個場合斥之為無稽之談,表示AI代理失控的問題就是工程問題,可以用工程解決。美國總統川普也說,美國絕對不會放慢AI發展腳步。

    雙層防護架構

    這家晶片巨頭的企業級AI事業部門副總裁博伊塔諾(Justin Boitano)表示,如果OpenAI、Anthropic這些尖端AI實驗室,很早便使用輝達這項技術來評估其AI模型,本可防止針對Hugging Face的攻擊。他說:「就我們所知,這個新的安全平台本可以阻止這起漏洞入侵事件。」輝達後來收購了Hugging Face。

    針對AI安全問題,輝達提出的解決方案包含兩個部分。首先是OpenShell這套軟體產品,輝達已在3月的科技主題會議上發表過預覽,可在輝達專為代理型AI打造的Vera中央處理器(CPU)運行。它能讓使用者為 AI 代理設定存取規則並即時強制執行。該軟體為開源性質,可以被自由使用與改編。

    同時,Nvidia Sentry是一項運行於晶片上的獨立安全層,可在輝達的BlueField資料處理器(DPU)上運行。輝達表示,Nvidia Sentry旨在提供額外的AI監控層,對代理進行監督,並在任何出現可疑狀況的代理採取行動時進行干預,將其隔離。

    博伊塔諾在談到Sentry時表示:「我們相信,這層額外的安全系統將使業界能夠安全地測試最先進的 AI 系統。它能在幾毫秒內隔離可疑的代理。」

    對於OpenAI與Anthropic是否採取輝達的AI安全平台,博伊塔諾說,這要等這些AI巨頭自行決定。

    除此之外,輝達的AI安全平台已經獲得超過100家企業採用,其中包括微軟(Microsoft)、Perplexity、埃森哲(Accenture)以及摩根大通(JPMorgan Chase)。
    陳家齊 收藏文章

    本網站使用Cookie以便為您提供更優質的使用體驗,若您點擊下方“同意”或繼續瀏覽本網站,即表示您同意我們的Cookie政策,欲瞭解更多資訊請見