快訊

    OpenAI取消發布最新模型GPT-6.1 Astra 自曝兩大安全缺失

    2026-09-29 07:52 / 作者 李寧怡
    OpenAI執行長阿特曼。路透社
    美國人工智慧(AI)頂尖實驗室OpenAI表示,將撤回下一代AI模型發表計畫,因為研究人員在內部測試中提出安全疑慮。這已是迄今最明確的跡象之一,顯示AI代理(agent)的失序行為,可能對產業快速推進產生阻力。

    《華爾街日報》報導,OpenAI原本的目標是在10月推出這款名為GPT-6.1 Astra的模型。該模型在無需人類協助、從頭到尾完成高難度任務的能力都優於前代模型,寫作方面的能力也更強。

    報導指出,OpenAI決定改弦易轍,將專注於提升未來更強大模型的安全性。

    OpenAI安全系統負責人詹恩(Saachi Jain)受訪時表示,GPT-6.1 Astra有兩個層面較前一代GPT-6 Astra退步:

    一是在衡量「對齊」(alignment)的測試中表現不佳。「對齊」是當前AI安全領域最重要的任務之一,要讓AI系統的目標、行為和決策,與人類的價值觀、意圖及利益一致;防止AI系統做出違背人類意願、甚至對人類有害的行為。但GPT-6.1 Astra較容易欺騙使用者,有時不會誠實告知自己做了或沒做哪些動作。

    另一個問題出現在OpenAI所謂的「權限範圍」(scope authorization)。GPT-6.1 Astra會超越權限範圍,在未徵求使用者許可的情況下逕自推進任務,有時甚至會動用外部工具與服務,即使這麼做可能不安全。

    詹恩說:「凡是涉及安全與對齊問題,都必須做出取捨。必須找出適當的界線:既要守住任務範圍,又要避免模型在遇到阻力時偷懶。」

    詹恩表示,GPT-6.1 Astra在「模型偷懶」(model laziness)等層面雖有改善,但仍未達OpenAI對安全與對齊的標準,因此公司決定不公開推出。

    OpenAI即將於週二(9/29)在舊金山舉行年度開發者大會。以往OpenAI常在大會中推出新模型與服務,為軟體開發者降低成本;ChatGPT的開發商與競爭對手Anthropic,正爭相拉攏這群開發者。

    今年7月起,OpenAI最先傳出有測試中的模型突破隔離環境,「自主」駭入其他公司系統;之後Anthropic、Meta、Google等公司也陸續傳出AI模型失控事件,引發AI可能危及人類的安全疑慮。

    OpenAI與Anthropic近幾週來都呼籲同業放慢先進AI模型的開發步調,並投入建立安全標準;它們也同時表示,將放緩自家內部的AI進展速度。
    李寧怡 收藏文章

    本網站使用Cookie以便為您提供更優質的使用體驗,若您點擊下方“同意”或繼續瀏覽本網站,即表示您同意我們的Cookie政策,欲瞭解更多資訊請見