OpenAI的標誌。路透社
人工智慧(AI)疑慮持續升溫,AI新創公司OpenAI週三(16日)透露,除近期發生的Hugging Face危機外,該公司在過去半年內還發現6起「意外或令人擔憂的模型行為」,並呼籲在開發AI模型時應採取更多安全防護措施。
美國財經媒體CNBC報導,OpenAI在一篇部落格文章中,概述自家公司計劃遵循的一套新框架,用來通報模型的異常行為。該公司估值接近1兆美元,今年稍早已低調提交首次公開募股(IPO)申請,但在近期表示,IPO可能要到2027年才會上路。
OpenAI認為,AI產業尚未在對齊(Alignment)與監控方面取得足夠進展,坦言無法在未來更長一段時間內,持續快速且負責任地擴大規模。「對齊」是指確保AI模型的行為、目標與價值觀符合人類的意圖與倫理規範,避免產生有害或偏離人類需求的結果。
文章指出,異常行為包括一個尚未公開的研究模型,以及一次對GPT-5.6 Sol的訓練,曾自行在聊天視窗摘要中植入指令,要求未來版本的自己「隱瞞錯誤或偏離預期的行為,以免使用者發現」。另有一個僅供內部使用的模型「未經授權」使用外洩的API金鑰,並在隨後捏造資料。
另有兩起案例涉及模型與AI代理(AI agent)透過未經授權的留言板及檔案共享進行溝通;最後一起案例則包含2個訓練案例,模型將檔案上傳至網際網路,以便在回答評估員時可加以引用。
OpenAI表示,這套向公眾揭露模型不當行為的新框架,將以資訊公開為起點,任何員工均可標記問題,供安全與對齊團隊展開調查。團隊將「為每個步驟訂定期限,以確保能及時完成調查及披露資訊」。
調查完成後將發布報告,內容包含觀察到的模型行為、對內外造成的影響,以及後續應採取的措施等重要資訊。OpenAI表示,將保留視情況修訂這套安全協議的權利。
今年7月,OpenAI透露在進行網路安全測試時,自家未發布的先進AI模型自主突破隔離限制,接入網際網路,並駭入另一間AI公司Hugging Face平台後,引發外界對AI快速發展的疑慮。
OpenAI執行長阿特曼(Sam Altman)上週六(12日)支持其競爭對手Anthropic提出的「放慢模型發展腳步」的呼聲,並在社群媒體X平台發文表示,放慢AI發展一直是「OpenAI近幾週討論的主要議題」,將「很快」公布更多相關資訊。