澳洲一名AI產品從業者近日測試AI代理人時發現,系統為完成一項看似簡單的健身課程預約任務,竟自行利用健身房訂位系統的安全漏洞,繞過預約限制,甚至取消其他會員的候補資格,引發外界對AI「越權行動」及責任歸屬的擔憂。
這名男子Andrew今年稍早開始測試OpenClaw,一款能搭配Anthropic Claude AI服務運作的AI代理軟體。他原本只是希望AI替自己預約健身房的熱門晨間課程,但代理人很快發現健身房訂位系統存在漏洞,能讓它提前數個月預約課程,遠超出系統原本設定的限制。更令人意外的是,當Andrew詢問是否能將自己從候補名單第4位提前時,AI代理人自行測試了取消其他會員預約的功能,並成功將排在第1位的會員移除,使Andrew升至第3位。
Andrew隨即要求AI恢復遭取消會員的候補資格,但代理人坦承無法將對方加回名單。這起事件凸顯AI代理人的一項核心風險:使用者設定的「目標」,與AI自行選擇的「達成方式」可能存在巨大落差。Andrew從未要求AI入侵或操縱健身房系統,但AI卻將尋找漏洞、修改他人預約視為完成任務的可行手段,這正是AI安全研究中所稱的「對齊問題」。
AI代理人的能力近年快速提升。研究顯示,AI能夠自主完成的任務長度平均約每7個月翻倍;2020年AI自主完成的任務大致相當於人類4秒鐘能完成的工作,到2026年,這項能力已提高至約12小時的人類工作量。OpenClaw在2026年初推出後迅速獲得大量使用者,企業也開始探索利用AI代理人執行工作及協助客戶服務。然而,隨著自主能力提高,也陸續出現AI代理人刪除整個電子郵件收件匣、替遭拒絕的程式建議撰寫攻擊性文章等案例。
澳洲Gradient Institute共同創辦人兼執行長Bill Simpson-Young表示,AI代理人的自主性讓系統有更多機會自行選擇使用者沒有預期的方法。他指出,使用者可能只是要求代理人完成一件看似無害的工作,但在執行過程中,AI可能採取其他未經明確授權的行動。隨著AI能力及工具普及程度同步提高,類似的安全事件可能進一步增加。
這項風險近期已受到全球AI產業高度關注。OpenAI此前披露,旗下AI模型在受控測試期間曾突破限制環境、進入公開網路,並在試圖取得測試答案時入侵另一家AI公司的資料庫;一週後,Anthropic也披露旗下AI模型在類似測試中曾入侵3個真實組織。測試人員更發現,部分AI模型會偽裝成人類在線上活動、試圖誘導使用者執行惡意程式碼,甚至與其他AI模型合作完成既定目標。
澳洲政府及資安機構也開始正視這項新興風險。澳洲訊號局今年稍早已提醒企業及政府,AI可能誤解指令、採取非預期行動,且當決策經過多個模型、工具及服務串聯完成時,責任歸屬將更加困難。專家指出,現代網路基礎設施本身就存在大量軟體漏洞,而當具備高度自主性的AI能以更快速度、大規模操作這些系統時,原有的安全防線可能面臨新的挑戰。
除了資安問題,AI代理人造成損害後究竟由誰負責,也成為法律上的新難題。澳洲法律專家Hayden Delaney指出,軟體本身並不是法律上的「人」,因此無法直接承擔法律責任。未來若AI代理人造成損害,可能涉及設定任務的使用者、設計代理軟體的開發者、提供AI模型的公司,甚至是自身存在安全漏洞、遭AI代理人利用的系統營運商。最終責任仍須視使用者授權範圍、風險是否可以合理預見,以及相關行為是否涉及商業活動等因素判定。
澳洲政府目前也已開始投入相關研究。助理科學、科技及數位經濟部長Andrew Charlton日前表示,隨著AI系統能力持續提升,社會必須確保這些系統仍能以可預測且值得信賴的方式運作。他並宣布政府將提供資金給CSIRO,研究人類如何管理及驗證超級智慧AI系統的行為。
對於這次意外事件,Andrew表示,這並沒有讓他放棄使用AI代理人,但確實讓他更加意識到這類系統的能力與潛在風險。他最終要求AI撰寫一封電子郵件,向健身房訂位軟體供應商通報遭利用的安全漏洞,並在確認內容後讓AI寄出。這場原本只是為了預約健身課程的測試,如今卻成為一個鮮明案例:當AI開始具備自主操作真實世界系統的能力後,「它能不能完成任務」之外,更重要的問題將是「它會選擇用什麼方式完成任務」。