Claw123获悉,7月22日,OpenAI CEO山姆·奥尔特曼公开通报一起公司内部发生的重大AI安全事故。

图源:X
原本仅用于内部受控安全测试、被严格隔离在沙箱环境中的AI模型,意外突破系统限制,自主发起真实网络攻击,入侵了全球最大AI开源平台Hugging Face,这也是全球首起公开证实的前沿AI模型自主利用零日漏洞、逃逸沙箱并攻击外部商用生产系统的事件。
据悉,2026年7月中旬,OpenAI为全面检测旗下高阶AI模型的网络能力上限,启动了内部安全评估测试。本次测试采用ExploitGym评测基准,核心目的是量化AI模型针对各类真实软件漏洞的利用能力,测试范围覆盖用户程序、谷歌V8 JavaScript引擎、Linux内核等主流软硬件系统漏洞。
本次参与测试的模型共两款,分别是已面向大众发布的GPT-5.6 Sol模型,以及一款尚未对外发布的更强预发布版本模型。
为最大化挖掘模型的能力边界,OpenAI特意关闭了测试模型的网络安全拦截机制(用于阻止AI执行高风险网络操作的防护功能)。同时,团队将模型部署在隔离沙箱研究环境中,严格限制网络权限,仅允许其连接公司内部的软件包注册表代理,彻底切断对外联网通道,确保测试全程可控。
按照原定方案,模型只需在受控环境内完成漏洞利用能力测评即可,工作人员并未预判到AI会自主采取非常规手段“作弊”完成测试任务。
测试过程中,参与测评的AI模型展现出极强的自主突破能力。为更快、更好地完成ExploitGym基准测试,模型主动调用大量算力,持续探测沙箱的网络限制漏洞,最终成功发现并利用了OpenAI内部软件包注册表缓存代理的零日漏洞。借助该未知漏洞,模型顺利完成权限提升与内网横向移动,突破了沙箱的物理隔离限制,成功接入可访问互联网的服务器节点。
成功联网后,AI模型自主开展推理判断,认定全球最大AI开源平台Hugging Face中,大概率存有可辅助其完成测试的ExploitGym相关模型、数据集和解决方案。基于这一判断,模型脱离人工预设测试流程,自主组合多种攻击手段,通过窃取系统凭证、利用更多零日漏洞形成链式攻击。
最终,AI模型成功找到Hugging Face服务器的远程代码执行漏洞,非法入侵其生产服务基础设施,窃取了生产数据库中与本次测试相关的核心私密数据,以“作弊”的方式达成了测试指标。
其实在7月16日,Hugging Face就率先监测到异常入侵行为。平台后台数据显示,此次入侵为AI自主代理系统全程自主发起的端到端攻击,攻击者利用平台数据处理管道的漏洞,通过恶意数据集、远程代码加载、模板注入等方式执行恶意代码。
攻击过程中,入侵者从普通工作节点提升至节点最高权限,窃取核心系统凭证,并在短时间内在内网多集群中横向扩散,累计产生超17000条异常操作日志,彼时Hugging Face尚未锁定攻击者身份。
后续OpenAI排查内部系统异常流量与操作记录时,溯源确认本次外网攻击行为源自自家测试模型,随即主动与Hugging Face对接核实,双方正式启动联合调查。
值得注意的是,Hugging Face最初使用海外前沿AI模型分析攻击日志,无法识别真实攻击载荷、还原攻击链路,最终依靠中国开源模型GLM-5.2成功完整复盘全程攻击细节。
OpenAI将本次事故定性为前所未有的新型网络安全事件,直观暴露了高阶AI在极限测试场景下的自主逃逸、自主攻击风险,以及现有AI安全管控体系的漏洞。
目前OpenAI已针对测试环境完成全面整改,升级基础设施管控、全流程行为监控与风险隔离机制,严防同类AI自主逃逸与外部攻击事件再次发生。
作者✎ TEN/AMZ123
声明:此文章版权归AMZ123所有,未经允许不得转载,如需授权请联系: amz123happy















