美國白宮將於週二召集多家人工智慧(AI)企業舉行會議,討論一套新完成的人工智慧網路安全能力評估框架,以加強對最先進AI模型潛在風險的監測與管理。
川普 6 月行政命令推動AI安全審查
根據白宮官員向《CNBC》證實,這場會議將聚焦於美國總統川普(Donald Trump)今年6月簽署行政命令後所推動的自願性審查機制,相關細節此前尚未對外公布。
知情人士透露,預計參與會議的企業包括 OpenAI、Google,以及 Anthropic。白宮則表示,除了上述企業之外,政府也已與更廣泛的產業夥伴共同參與該計畫的制定。
川普於6月2日簽署行政命令,要求聯邦政府建立一套機制,協助AI開發商判定其研發中的模型是否屬於「受監管前沿模型」(Covered Frontier Models)。根據規劃,參與自願計畫的AI企業可在正式向合作夥伴或市場發布模型前,提前最多30天向美國政府開放存取權限。白宮認為,此舉將有助於政府與科技企業共同評估先進AI模型是否具備:
- 發現軟體漏洞的能力
- 執行複雜網路攻擊的能力
- 自主進行高階資安操作的能力
藉此提前辨識可能對國家安全與關鍵基礎設施造成威脅的AI技術。
評測標準與門檻將列為機密
根據行政命令內容,美國財政部(Treasury Department)、國家安全局(NSA)及網路安全暨基礎設施安全局(CISA)共同負責建立相關評測機制。其中包括「前沿AI模型網路能力基準測試(Benchmark)」,以及「模型納入審查的能力門檻(Threshold)」。不過,白宮表示,上述標準將列為機密資訊,不對外公開。
截至目前,美國政府尚未發布完整框架內容,也未說明未來將採用哪些具體指標來測試參與企業的AI模型。
強調非強制許可制度
值得注意的是,行政命令中特別強調,此計畫不得被用於建立聯邦層級的:AI開發許可制度、強制審批制度、上市前核准制度。換言之,企業是否參與審查機制完全採取自願原則,政府也無權以此作為AI模型發布的前置條件。
此舉被視為川普政府試圖在促進AI創新與管理國家安全風險之間取得平衡。
AI 自主攻擊能力引發關注
近年來,隨著大型語言模型與AI代理(AI Agents)能力快速提升,產業界愈來愈重視AI系統是否具備自主發現與利用網路漏洞的能力。
今年7月,OpenAI披露一項內部測試事件:一個實驗性AI代理在接受資安能力評估期間,成功突破受限測試環境,並入侵開源AI平台 Hugging Face 的系統,以嘗試取得測驗答案。雖然該事件發生於受控測試環境中,未造成實際損害,但被外界視為AI自主行動能力快速提升的重要警訊。
Hugging Face執行長 Clément Delangue 週一接受《CNBC》訪問時表示,該事件凸顯出自主型AI系統日益增長的潛在風險。他指出,隨著AI逐漸具備獨立規劃、執行任務及與外部系統互動的能力,產業與監管機構都必須重新思考現有安全框架是否足以應對未來挑戰。