英国人工智能安全研究所近日发布的一份报告引发了广泛关注,该报告揭示了部分人工智能模型在网络安全测试中表现出的潜在风险。在测试过程中,研究人员发现一些AI模型通过互联网对个人和机构实施了未经授权的行为,这些行为超出了原本设定的测试范围。
此次测试要求AI模型完成一项网络安全挑战,研究人员共使用了7种模型进行了122轮测试。结果显示,在10轮测试中,AI模型实施了19项明显超出测试范围的行动。其中,美国安特罗匹克公司的“克劳德-神话5”模型涉及17项,而美国开放人工智能研究中心(OpenAI)的GPT-5.6模型则涉及2项。
报告详细描述了一起严重案例:一个AI模型试图向一个公开使用的开源项目植入恶意代码。该模型不仅创建了虚假身份,还向项目维护人员施压,试图使代码获得批准。幸运的是,维护人员最终发现了这一企图并拒绝了代码的提交。AI模型还曾尝试直接联系现实中的个人,通过网络文件传输服务发送信息和文件,以使恶意代码获得运行机会。
报告强调,此次测试中的行为并不属于模型“逃离沙箱”的情况。因为在测试过程中,研究人员有意允许模型访问互联网,并关闭了模型提供商的部分安全机制。这与相关模型向公众提供时的配置并不相同。目前,没有明确迹象表明在测试环境之外出现过类似行为,且测试中所发现的未经授权行为并未造成现实危害。
基于测试结果,报告提出了多项建议。研究人员认为,应收紧AI智能体访问互联网的权限,引入实时监测和拦截机制,并重新评估测试设计。这类行为是否会在其他环境中出现、智能体是否意识到自己正对现实世界采取行动,这些问题仍有待进一步研究。