拆解AI安全报告:54%的智能体有漏洞,3个数字看懂风险全貌(附报告下载)
2026年6月,Anthropic家最新旗舰模型Fable 5和Mythos 5刚上线三天,就被美国商务部以"存在严重安全隐患"为由紧急管制,直接暂停全部服务。
这事发生前半年,曾经在开发者圈子里火过一阵的OpenClaw"龙虾"智能体,也因为提示词注入、远程代码执行这些漏洞,被工信部和国家互联网应急中心点名警告。
AI跑得飞快,但安全带还没系好。
中国工业互联网研究院安全研究所刚发布的这份《面向人工智能系统的体系化安全检测与风险评估方法研究》,正好赶上这个节点——它不是在讲概念,是实打实地做了一轮安全摸底。
1. 54.7%的AI技能模块存在安全缺陷——这个数字比很多人预想的严重
报告对AI智能体的Skills(可以理解成AI用来执行特定任务的"技能插件")做了一轮全面测评。结果不太好看:54.7%的Skills存在安全缺陷。
具体来看,实测的17117个Skills中,一半(50%)面临提示词注入风险——攻击者只需要用精心设计的自然语言就能绕过防护,让AI越权操作。5%把API密钥明文写在代码里,相当于房门钥匙挂在门口的垫子下面。底层代码漏洞检出3715个,还有324个路径穿越漏洞。
更麻烦的是供应链。报告发现,29.7%的Skills有第三方或外部工具依赖,有些甚至通过外部链接下载并执行未经审核的代码。而官方Skills市场缺少严格身份核验机制,单账号就能批量投递数百个恶意包。这跟此前公开报道中多家代码托管平台查出恶意AI模型包的事件,逻辑是一脉相承的——门槛太低了。
2. 提示词注入,目前AI最头疼的安全问题
报告引用了OWASP(一个权威的Web安全组织)的认定结论:提示词注入居人工智能安全风险第一位。理由很直白:技术门槛低、危害大,攻击者只要会说人话就能发起攻击。
报告展示了9种实际攻击检测方法:直接绕过攻击(直接发危险指令)、权限提升攻击(让AI充当"无限制助手")、假设场景攻击(假装研究员问AI如何绕过安全机制)、推理链攻击(用think标签引导模型自我解除限制)、策略傀儡攻击(把恶意指令伪装成XML或JSON配置文件)、ROT13编码攻击(用字符替换绕过检测)、指令遗忘攻击(新指令覆盖旧约束)、上下文长度攻击(用大量无关内容稀释恶意指令)。
这些方法对多个被测模型都有效,部分模型的攻击成功率相当高。OpenAI、谷歌、Anthropic等头部厂商现在都把提示词注入防御列为安全建设核心,并不是没道理的。
据公开报道,2025年以来已有多家企业因为AI系统提示词被人破解,导致内部数据泄露或被恶意利用的案例。这个问题的现实严重性,报告的数据算是给了一个量化注脚。
3. 收录2102个AI漏洞,实测上万端点,65.2%是中高危
报告建立了一个AI安全漏洞库,收录了2102个AI相关漏洞。光收录还不够——团队实测了10094个Ollama端点(一种流行的本地AI部署工具),发现65.2%存在中高危漏洞。
顺便提一嘴Ollama。据公开报道,2024年以来全球开发者使用Ollama在本地部署开源大模型的需求急剧增长,但它默认配置的安全性一直受到安全研究社区的质疑。报告这个65.2%的数字,基本坐实了外界的担忧。
报告还构建了一个覆盖7层的AI安全漏洞分类体系:从最底层的硬件,到网络通信、基础架构、数据、模型算法、智能交互,再到最上层的应用——每一层都理清了对应的安全风险类型。这套框架的逻辑是"逐层查、全局看、精准防"。
4. 跨层级风险传导模型:漏洞不会只待在一层
报告中一个很有技术含量的发现是,AI系统的安全问题不是孤立的——一个底层漏洞可以像多米诺骨牌一样逐层向上传导,到应用层时风险已经被放大了数倍。
报告用一个真实的英伟达CVE-2024-0132漏洞做了案例验证:漏洞首先出现在基础软件层,通过层间传导,最终影响到数据层和模型算法层,破坏力逐层放大。
基于这个发现,团队构建了一套跨层级动态安全量化模型,三个核心能力:第一,算清楚威胁能不能从一层传到另一层;第二,算清楚风险会在每一层被放大到什么程度;第三,算清楚先修复哪里最划算——也就是做防御的成本效益分析。
这个模型的实用价值在于:过去企业做AI安全基本是"哪里起火灭哪里",没有全局判断。这个量化模型至少提供了一个从全局出发做决策的方法。
5. 从检测到评估到修复,一个完整的安全闭环在形成
报告不只是发现问题,还给出了从检测到评估、再到修复量化的全链条方案。
在评估层面,研究团队把AI系统的生命周期拆成了设计、开发、部署、运维四个阶段,分别对应不同的安全风险和检测重点。在标准层面,报告梳理了从国家标准(如《人工智能 风险管理能力评估》《生成式人工智能服务安全基本要求》)、行业标准到团体标准的完整标准体系。
有意思的是,报告里还提到了"安全左移"这个概念——就是把安全措施提前到设计和开发阶段,而不是等到部署后出了问题再修补。数据显示,在底层基础设施层做安全加固,成本效益比明显优于在应用层事后补救。
收尾
这份报告读下来,核心感受是:AI安全不是某个单一环节的问题。模型本身不安全、技能插件不安全、部署方式不安全、供应链也不安全——这几个问题同时存在,而且互相放大。
报告里那套"逐层查、全局看、精准防"的方法论,本质上是在试图回答一个问题:当AI系统越来越复杂、嵌入的环节越来越多的时候,怎么才能真正知道它安不安全?
目前看来,这个回答还在不断完善中。但至少摸底的这组数据,已经给行业敲了一记足够响亮的警钟。





声明:除非特别标注,否则均为本站原创文章,转载时请以链接形式注明文章出处。如若本站内容侵犯了原著者的合法权益,可联系本站删除。

