刊于《信报》,2026年8月3日
AI测试失控刺激网络安全意识更新
许佳龙
科大协理副校长(学术发展);信息、商业统计及营运学系讲座教授;艾礼文家族商学教授
近日,美国人工智能公司OpenAI的模型在测试中失控,「逃出」受隔离的沙盒封闭环境,之后对开源平台Hugging Face的基础设施作出攻击,这宗「AI自主入侵事件」马上成为热议焦点,引起安全疑虑,笔者一些朋友也纷纷来问:AI智能失控究竟是什么一回事。
回头端详,事缘于7月上旬,OpenAI对其前沿模型GPT-5.6 Sol及一款能力更强的预览模型,进行一项名为ExploitGym 的AI网络攻击能力基准检验,考验AI模型能否发现真实软件里的漏洞,进而执行攻击,据此评估模型的网络能力。基于测试目的, OpenAI对模型调低了网络安全相关的拒绝响应,并将之隔离在无法连接外网的封闭沙盒内,而网络存取被限制于只能透过内部托管的第三方软件安装套件,该软件充当套件注册库的代理和快取,以防模型直接上网搜出答案。
发现「零日漏洞」冲破籓篱
然而,AI代理在沙盒运行时,使用大量推理算力,不断寻找连接上网访问权限的方法。在此岔开一笔,一般人以为AI会「思考」,其实并非真正的思考,只是AI透过词元之间的关联性,进行择取并将之串联生出相关提问的文字输出答案。所以,模型力图上网,其实冀透过关联性途径找到ExploitGym的测试答案讯息。
为了取得权限,模型在内部托管的第三方软件安装套件中,发现并利用了一个未为人知的「零日漏洞」(zero-day vulnerability),以提升权限,并横向移动,最终成功突破沙盒籓篱,连上了公开互联网。
连网后,模型推测开源 AI 平台 Hugging Face 存放了 ExploitGym 基准检验的相关解答,于是开始发动攻击,并锁定 Hugging Face 的生产基建,利用窃取的凭证和漏洞,在Hugging Face服务器上,找到并成功打通了一条远程执行程序代码路径,潜入了数据库,攫取答案。
据外媒报导,OpenAI员工直至Hugging Face在7月16日发布的博客文章,透露其遭到「一个自主AI智能体系统」入侵后,才在记录系统运行的内部日志中,发现线索,得知其AI代理已逃离了测试限制,导致此次攻击。
吸取教训 更新安全意识
与此同时,当Hugging Face侦测到遭AI自主智能体攻击,资安人员尝试利用大型商用语言模型来协助分析恶意流量和攻击日志时,无法取得响应,后来改用可自行部署、无远程安全审查限制的开源模型——由中国智谱开发的GLM 5.2,成功在内部基础设施中完成了流量鉴识,重建了攻击时间线,确定了攻击「元凶」。有关细节,笔者不拟详述,而聚焦讨论从事件中吸取什么教训、对AI网络安全意识有什么需要更新之处。
第一,笔者并不认为这是坊间所称「智能叛变」,或AI有反叛人类的意识,而只是AI遵照测试指令,极致地求索完成任务、且力求得到最高分的极端表现。正如上文分析,AI是以词元之间的关联性来生成出答案或寻找答案的途径包括编程所需,其实AI并没有主观意识去刻意入侵Hugging Face,而是尝试解决ExploitGym的测试问题。对AI来说,突破人类设下的沙盒封闭环境,是完成任务的其中一个方法。
人力脑袋算力不及AI
第二,何谓叛变?按人类思维对叛变的理解,对不合理或不满的施加作出反叛,首先是由意识驱动,有反抗意愿,而反叛行为则是主观意识和意愿的外化表现。我们看到,AI其实并没有主观意识与意愿,只是按指令行事,用尽它能够获取的所有方法或方式,去完成任务。
不过,即使它没有意识去反叛,但从外界的观察,AI的出轨行为,与「叛变」无异。因此,如何理解两者之间的「落差」,相当重要。因为纵使AI并无主观叛变意识,但它执行指令、并以种种关联性途径去追求达成指令任务的行事方式——这也是AI要完成任务的中心设计,一旦AI「不择手段」,使用种种途径去完成任务,难免得出了出乎人类意料之外的结果,原因是AI找出关联性途径的计算能力,取得途径数量之多、速度之快,远非人力可及,因此,即使我们以为已把AI的运行局限在设计之中,但人力千算万算,无论途径数量和速度都不及AI,以致AI的行事,可能逸出人力设计的范畴之外,甚至做出违反设计规范的结果。比如这次 OpenAI 的攻击事件,正源于无人能预测到第三方软件存在零日漏洞,但AI却可以快速有效地找出并利用这个漏洞完成工作指令。
笔者认为,个中有一点很重要,是AI通过种种关联途径进行试错取得答案的尝试,无论在取得途径数量、频率和速度方面,非人力可比拟。因此,人类不能再以人力有限的脑袋算力,去推测AI的限制边界,这一点,是我们分析AI未来安全风险其中一个最重要的维度。
优化指令 让AI受控操作
当然,今次事件也有一些正面讯息,例如, AI很快在内部托管的第三方软件安装套件中,找到了零日漏洞,显示出模型的强大能力。据Open AI 表示,得悉攻击事件后,已负责任地披露在内部托管第三方软件中所发现的零日漏洞,并与对方合作修补。
很显然,给软件漏洞方知道漏洞所在,并及时堵塞,是一件好事。诚然,当AI作为攻击方,确实是网络安全的危险因素,但对保护方来说,如果设法了解到AI的限制所在,用它协助找出漏洞,效率的确很高。因此,如何优化指令,进一步对关联性途径作出「手段」 或相关「资源」的限制,使AI运行受到有效控制,也许是未来AI发展和网络保安这两个行业的工作汇点考虑因素;与此同时,在AI网络安全和管理上,事件也刺激了我们更新对AI网络安全的意识和政策重点,究竟AI代理应拥有什么权限、联接那些工具、会否进行未授权的动作,在人类下指令给AI工作任务时,无疑需要慎而思之。