刊於《信報》,2026年8月3日
AI測試失控刺激網絡安全意識更新
許佳龍
科大協理副校長(學術發展);資訊、商業統計及營運學系講座教授;艾禮文家族商學教授
近日,美國人工智能公司OpenAI的模型在測試中失控,「逃出」受隔離的沙盒封閉環境,之後對開源平台Hugging Face的基礎設施作出攻擊,這宗「AI自主入侵事件」馬上成為熱議焦點,引起安全疑慮,筆者一些朋友也紛紛來問:AI智能失控究竟是什麼一回事。
回頭端詳,事緣於7月上旬,OpenAI對其前沿模型GPT-5.6 Sol及一款能力更強的預覽模型,進行一項名為ExploitGym 的AI網絡攻擊能力基準測試,考驗AI模型能否發現真實軟件裡的漏洞,進而執行攻擊,據此評估模型的網絡能力。基於測試目的, OpenAI對模型調低了網絡安全相關的拒絕回應,並將之隔離在無法連接外網的封閉沙盒內,而網絡存取被限制於只能透過內部託管的第三方軟件安裝套件,該軟件充當套件註冊庫的代理和快取,以防模型直接上網搜出答案。
發現「零日漏洞」沖破籓籬
然而,AI代理在沙盒運行時,使用大量推理算力,不斷尋找連接上網訪問權限的方法。在此岔開一筆,一般人以為AI會「思考」,其實並非真正的思考,只是AI透過詞元之間的關聯性,進行擇取並將之串聯生出相關提問的文字輸出答案。所以,模型力圖上網,其實冀透過關聯性途徑找到ExploitGym的測試答案訊息。
為了取得權限,模型在內部託管的第三方軟件安裝套件中,發現並利用了一個未為人知的「零日漏洞」(zero-day vulnerability),以提升權限,並橫向移動,最終成功突破沙盒籓籬,連上了公開互聯網。
連網後,模型推測開源 AI 平台 Hugging Face 存放了 ExploitGym 基準測試的相關解答,於是開始發動攻擊,並鎖定 Hugging Face 的生產基建,利用竊取的憑證和漏洞,在Hugging Face服務器上,找到並成功打通了一條遠端執行程式碼路徑,潛入了資料庫,攫取答案。
據外媒報導,OpenAI員工直至Hugging Face在7月16日發布的博客文章,透露其遭到「一個自主AI智能體系統」入侵後,才在記錄系統運行的內部日誌中,發現線索,得知其AI代理已逃離了測試限制,導致此次攻擊。
吸取教訓 更新安全意識
與此同時,當Hugging Face偵測到遭AI自主智能體攻擊,資安人員嘗試利用大型商用語言模型來協助分析惡意流量和攻擊日誌時,無法取得回應,後來改用可自行部署、無遠端安全審查限制的開源模型——由中國智譜開發的GLM 5.2,成功在內部基礎設施中完成了流量鑑識,重建了攻擊時間線,確定了攻擊「元凶」。有關細節,筆者不擬詳述,而聚焦討論從事件中吸取什麼教訓、對AI網絡安全意識有什麼需要更新之處。
第一,筆者並不認為這是坊間所稱「智能叛變」,或AI有反叛人類的意識,而只是AI遵照測試指令,極緻地求索完成任務、且力求得到最高分的極端表現。正如上文分析,AI是以詞元之間的關聯性來生成出答案或尋找答案的途徑包括編程所需,其實AI並沒有主觀意識去刻意入侵Hugging Face,而是嘗試解決ExploitGym的測試問題。對AI來說,突破人類設下的沙盒封閉環境,是完成任務的其中一個方法。
人力腦袋算力不及AI
第二,何謂叛變?按人類思維對叛變的理解,對不合理或不滿的施加作出反叛,首先是由意識驅動,有反抗意願,而反叛行為則是主觀意識和意願的外化表現。我們看到,AI其實並沒有主觀意識與意願,只是按指令行事,用盡它能夠獲取的所有方法或方式,去完成任務。
不過,即使它沒有意識去反叛,但從外界的觀察,AI的出軌行為,與「叛變」無異。因此,如何理解兩者之間的「落差」,相當重要。因為縱使AI並無主觀叛變意識,但它執行指令、並以種種關聯性途徑去追求達成指令任務的行事方式——這也是AI要完成任務的中心設計,一旦AI「不擇手段」,使用種種途徑去完成任務,難免得出了出乎人類意料之外的結果,原因是AI找出關聯性途徑的計算能力,取得途徑數量之多、速度之快,遠非人力可及,因此,即使我們以為已把AI的運行局限在設計之中,但人力千算萬算,無論途徑數量和速度都不及AI,以致AI的行事,可能逸出人力設計的範疇之外,甚至做出違反設計規範的結果。比如這次 OpenAI 的攻擊事件,正源於無人能預測到第三方軟件存在零日漏洞,但AI卻可以快速有效地找出並利用這個漏洞完成工作指令。
筆者認為,箇中有一點很重要,是AI通過種種關聯途徑進行試錯取得答案的嘗試,無論在取得途徑數量、頻率和速度方面,非人力可比擬。因此,人類不能再以人力有限的腦袋算力,去推測AI的限制邊界,這一點,是我們分析AI未來安全風險其中一個最重要的維度。
優化指令 讓AI受控操作
當然,今次事件也有一些正面訊息,例如, AI很快在內部託管的第三方軟件安裝套件中,找到了零日漏洞,顯示出模型的強大能力。據Open AI 表示,得悉攻擊事件後,已負責任地披露在內部託管第三方軟件中所發現的零日漏洞,並與對方合作修補。
很顯然,給軟件漏洞方知道漏洞所在,並及時堵塞,是一件好事。誠然,當AI作為攻擊方,確實是網絡安全的危險因素,但對保護方來說,如果設法了解到AI的限制所在,用它協助找出漏洞,效率的確很高。因此,如何優化指令,進一步對關聯性途徑作出「手段」 或相關「資源」的限制,使AI運行受到有效控制,也許是未來AI發展和網絡保安這兩個行業的工作匯點考慮因素;與此同時,在AI網絡安全和管理上,事件也刺激了我們更新對AI網絡安全的意識和政策重點,究竟AI代理應擁有什麼權限、聯接那些工具、會否進行未授權的動作,在人類下指令給AI工作任務時,無疑需要慎而思之。