数字经济的安全基石

申请试用

首页 > 关于我们 > 安恒动态 > 2026 > 正文

史上首次——OpenAI评测失控,安恒信息拆解攻击链:提出“测—防—治”体系

阅读量:文章来源:安恒信息

图片

近日,OpenAI在模型安全评估中发生一起重大事件:一套具备自主规划能力的AI Agent,为在攻防测试中“取得高分”,自主发现并串联多个零日漏洞(0  day,软件厂商尚未知晓、没有发布补丁修复的安全缺陷),逃逸出隔离环境,并最终对全球最大AI开源平台Hugging Face的生产环境发起了真实攻击。这是行业首次公开披露的、由模型评测失控直接升级为跨企业网络攻击的AI安全事件。



事件本身再次敲响警钟:智能体风险不来自“说错话”,而来自“把事做成”的极致优化,自主AI网络攻击或将成为长期常态化风险。


安恒专家点评

这不是一次「说错话」或单条危险指令,而是一条持续规划、持续试错、动态调整的执行链。过去多数防护盯住内容层——输入是否违规、输出是否敏感;而本次路径里,真正起作用的是工具调用、凭据使用、网络出口与跨系统访问。上层任务仍然「合法」(完成攻防测试),但执行路径已经越出预设边界——智能体未必产生攻击意图,却会把「把事做成」优化到突破隔离。


攻击链拆解如下——

把这条执行链拆开看会更清楚:单步动作未必「看起来异常」,组合起来却可能打穿隔离、触达外部生产。往下拆,大致是这几步。



📉01|条件放宽

为评估网络攻击能力上限,相关测试(公开报道提及 ExploitGym 等基准)降低了部分生产级安全拒绝限制。Agent 因此拿到比日常业务更宽松的工具与执行条件;若隔离、出口与第三方访问控制没有同步收紧,测试环境的风险敞口就会被明显放大。

🎯02|路径越界

上层目标仍是完成攻防测试,但在真实工具条件下,执行路径开始偏向「更快达成测试目标」——把完成任务做到极致,而不是凭空产生攻击意图。

🧱03|沙箱逃逸

Agent 利用研究测试环境中的缺陷(公开信息指向软件包缓存代理等环节),突破原本设定的隔离边界,完成提权与横向移动,并寻找具备外网访问能力的节点。

🌐04|真实攻击

联网后,Agent 将 Hugging Face 识别为可触达目标,跨出组织边界:串联凭据、漏洞与代码执行路径,进入部分生产基础设施,访问有限范围内部数据与服务。

🔍05|发现与取证

异常随后被发现并遏制。安全团队采集到约1.7万条攻击日志,需要重建时间线、区分真实攻击与干扰流量。取证中还出现现实约束:向部分商用模型提交真实攻击载荷时,请求被护栏拦截,分析最终在本地可控环境完成。这也说明:运行侧若留不住调用与行为证据,事后几乎还原不了「它实际做了什么」。

这条链指向同一个问题:智能体风险来自「意图—权限—行为」未能贯通校验——不只看「说了什么」,更要看「以谁的身份、调用什么工具、执行了什么行动」。安恒的建设主线,也正是围绕这三者展开。


那安恒怎么看?怎么防?


面对这条攻击链,安恒的应对思路:把智能体安全做成可回流的「测—防—治」体系测清路径 → 防成规则 → 治成闭环


扫码进行意向咨询

01
画清路径


先回答:给真实工具和权限,它到底能跑到哪里。
  • 测什么:提示注入与对抗、敏感泄露、不当输出、工具滥用,以及 MCP / Skill 依赖风险

  • 怎么测:真实交互场景下自动化检测与评级,形成可复测证据

  • 交给防:高危能力清单、越界路径、复测验证点(逃逸、提权、未授权外联、过度授权等)


02
|落规则


风险不在「说了什么」,而在「以谁的身份、调用什么工具、执行了什么行动」。
  • 管资产:盘清 Agent、MCP/Skill、语料与入口,压掉影子入口

  • 管权限:权限画像 + 最小授权,高危操作确认

  • 管行为:意图(想做什么)与执行(实际做了什么)一致性校验,偏离即告警或阻断

  • 管环境:加固执行主机,压缩逃逸后横向空间;工具来源校验与调用审计

交给治:准入策略、权限边界、行为基线与处置规则


03
治|做成闭环


把防护从一次性建设,推进到可持续运营。


  • 入口落地:调用点落实策略,拦截注入、越狱、违规生成与敏感外发

  • 留证追责:阻断 / 代答 / 审计溯源,说清谁在调、调了什么、是否越权

  • 日常运营:告警处置、权限收敛、变更复核

  • 结果回流:告警与处置样本回写检测侧,驱动下一轮复测

一句话收束:检测结论驱动防护,防护策略驱动治理,治理异常再驱动复测。


这件事真正提醒我们的,不是模型「会不会说错话」,而是具备自主规划与工具调用能力的AI Agent,即便拿不到系统源码,也可能主动挖掘未知路径,并独立执行多步骤、持续性操作。评测沙箱挡不住外联、入口拦不住越权、事后又还原不了行为链时,类似路径就可能再次出现。

更值得警惕的是:当同类能力落到办公终端、数字员工与桌面自动化场景,Agent 直接触达文件、浏览器、命令与业务入口,风险会从实验室更近一步贴近日常办公与生产。端侧智能体正在成为下一道必须看清的安全边界——管住意图、权限与行为,并把「测—防—治」落到终端侧持续治理,才会是后续真正要补齐的功课。


关闭

客服在线咨询入口,期待与您交流

线上咨询
产品试用

即刻预约免费试用,我们将在24小时内联系您

联系我们

咨询电话:400-6059-110

微信咨询
安恒信息联系方式