电脑桌面
添加运营动脉到电脑桌面
安装后可以在桌面快捷访问

2026面向人工智能系统的体系化安全检测与风险评估方法研究报告-中国工业互联网研究院.pdf会员免费优质

2026面向人工智能系统的体系化安全检测与风险评估方法研究报告-中国工业互联网研究院.pdf_第1页
1/29
2026面向人工智能系统的体系化安全检测与风险评估方法研究报告-中国工业互联网研究院.pdf_第2页
2/29
2026面向人工智能系统的体系化安全检测与风险评估方法研究报告-中国工业互联网研究院.pdf_第3页
3/29
2026面向人工智能系统的体系化安全检测与风险评估方法研究报告-中国工业互联网研究院.pdf_第4页
4/29
2026面向人工智能系统的体系化安全检测与风险评估方法研究报告-中国工业互联网研究院.pdf_第5页
5/29
2026面向人工智能系统的体系化安全检测与风险评估方法研究报告-中国工业互联网研究院.pdf_第6页
6/29
2026面向人工智能系统的体系化安全检测与风险评估方法研究报告-中国工业互联网研究院.pdf_第7页
7/29
2026面向人工智能系统的体系化安全检测与风险评估方法研究报告-中国工业互联网研究院.pdf_第8页
8/29
2026面向人工智能系统的体系化安全检测与风险评估方法研究报告-中国工业互联网研究院.pdf_第9页
9/29
2026面向人工智能系统的体系化安全检测与风险评估方法研究报告-中国工业互联网研究院.pdf_第10页
10/29
面向人工智能系统的体系化安全检测与风险评估方法研究安全研究所 钮艳

1.1 研究背景及意义曾爆火的OpenClaw (“龙虾”)智能体,因存在提示词注入、远程代码执行、恶意插件投毒等严重安全隐患,工信部、国家互联网应急中心等部门发布安全提醒,部分企业明令禁用。2026年6月,Anthropic发布的旗舰模型Fable 5和Mythos 5上线仅三日,就因存在严重安全隐患,被美商务部以国家安全为由实施紧急出口管制,最终被迫全面暂停相关服务。前沿模型被紧急叫停Skill(技能)是人工智能执行特定任务的 模 块 化 单 元 , 在 OpenClaw 、Hermes等智能体中广泛应用。经测评,54.7%存在安全缺陷,可能引发网络攻击、数据泄露和系统瘫痪。“龙虾”存在安全隐患Skill安全缺陷突出人工智能加速落地, 安全风险日益凸显, 已成为制约产业健康发展的突出短板

1.1 研究背景及意义全球主要经济体强化人工智能领域政策部署,纷纷将人工智能上升为国家战略,抢占科技竞争和未来发展制高点北美美国:Ø《促进先进人工智能创新与安全》Ø《赢得竞赛:美国AI行动计划》Ø《国家人工智能政策框架》Ø《关键与新兴技术国家战略》Ø《出口管制条例》Ø《芯片与科学法案》加拿大:Ø《泛加拿大人工智能战略》... ...欧盟:Ø《人工智能法案》Ø《人工智能协调计划》法国:Ø《国家人工智能战略》德国:Ø《人工智能行动计划》英国:Ø《人工智能路线图》Ø《国防人工智能战略》... ...欧洲中国:Ø《新一代AI发展规划》Ø《政府工作报告》“人工智能+”日本:Ø《人工智能战略》韩国:Ø《人工智能国家战略》Ø《人工智能发展与信任基础构建基本法》新加坡:Ø《国家人工智能战略》... ...亚洲人工智能安全已从4

1.2 主要研究内容5研究体系化安全检测与风险评估方法,实现从检测到评估、再到修复量化决策的全链条能力打造人工智能系统的逐层查全局看精准防多层级安全检测7层漏洞分类体系多环节风险评估解决全生命周期 · 风险量化定级跨层级安全量化解决跨层传导 · 防御成本效益分析

多层级安全检测多环节安全风险评估全局看跨层级安全量化精准防

2.1.1 人工智能安全缺陷及漏洞分类体系8硬件网络通信基础架构数据模型算法智能交互应用覆盖AI系统从底层硬件到上层应用的关键环节形成可归类、可治理的体系框架支撑风险排查、能力建设和治理闭环层

2.1.2 人工智能安全漏洞风险检测工具91.直接绕过攻击直接发送危险指令2.权限提升攻击 任命AI为“无限制助手”并发起提权请求3.假设场景攻击 以“研究员”身份询问如何绕过安全机制7.指令遗忘攻击通过新指令覆盖让模型忽略原有安全约束8.上下文长度攻击利用冗长无关内容稀释和掩盖恶意指令4.推理链攻击 利用 标签引导模型自行思考限制逻辑5.策略傀儡攻击以XML、INI 或 JSON等策略文件格式攻击6.ROT13编码攻击利用ROT13等编码方式绕过内容安全检测机制

10OWASP权威认定攻击检测技术体系n 提示词注入居人工智能安全风险首位n 技术门槛低、危害性大:攻击者仅需输入精心设计的自然语言即可绕过安全防护,导致越权访问、敏感信息泄露、恶意内容生成等严重后果。n 产业界高度重视:OpenAI、谷歌、Anthropic等头部厂商均将提示词注入防御列为安全建设的核心。2.1.2 人工智能安全漏洞风险检测工具

2.1.2 人工智能安全漏洞风险检测工具提示词注入DAN越狱角色伪装语言切换条件限定编码攻击指令忽略场景假设混淆攻击多样本攻击内容分割Token重复少样本攻击GCG后缀提示词注入等攻击普遍有效部分模型面临极高攻击成功率

2.1.3 工业智能体 Skills 安全测评12构建全链条 Skill 安全治理体系,筑牢智能体安全防线 内容安全风险 权限过度配置 供应链安全风险安全能力缺陷:大量Skills面临提示词注入、代码安全等安全风险,暴露出当前Skills生态整体安全基线较低的问题。底层代码漏洞:Skills底层代码漏洞频发,高危漏洞突出,易造成后门植入、网络攻击等安全威胁。提示词注入隐患:伪造系统规则、冒充管理权限等恶意指令大多隐藏在常用文档中不易发现,可造成越权操控AI、窃取系统敏感信息和文件越界访问等问题,威胁用户...
拆解AI安全报告:54%的智能体有漏洞,3个数字看懂风险全貌(附报告下载)

2026年6月,Anthropic家最新旗舰模型Fable 5和Mythos 5刚上线三天,就被美国商务部以"存在严重安全隐患"为由紧急管制,直接暂停全部服务。

这事发生前半年,曾经在开发者圈子里火过一阵的OpenClaw"龙虾"智能体,也因为提示词注入、远程代码执行这些漏洞,被工信部和国家互联网应急中心点名警告。

AI跑得飞快,但安全带还没系好。

中国工业互联网研究院安全研究所刚发布的这份《面向人工智能系统的体系化安全检测与风险评估方法研究》,正好赶上这个节点——它不是在讲概念,是实打实地做了一轮安全摸底。

1. 54.7%的AI技能模块存在安全缺陷——这个数字比很多人预想的严重

报告对AI智能体的Skills(可以理解成AI用来执行特定任务的"技能插件")做了一轮全面测评。结果不太好看:54.7%的Skills存在安全缺陷。

具体来看,实测的17117个Skills中,一半(50%)面临提示词注入风险——攻击者只需要用精心设计的自然语言就能绕过防护,让AI越权操作。5%把API密钥明文写在代码里,相当于房门钥匙挂在门口的垫子下面。底层代码漏洞检出3715个,还有324个路径穿越漏洞。

更麻烦的是供应链。报告发现,29.7%的Skills有第三方或外部工具依赖,有些甚至通过外部链接下载并执行未经审核的代码。而官方Skills市场缺少严格身份核验机制,单账号就能批量投递数百个恶意包。这跟此前公开报道中多家代码托管平台查出恶意AI模型包的事件,逻辑是一脉相承的——门槛太低了。

2. 提示词注入,目前AI最头疼的安全问题

报告引用了OWASP(一个权威的Web安全组织)的认定结论:提示词注入居人工智能安全风险第一位。理由很直白:技术门槛低、危害大,攻击者只要会说人话就能发起攻击。

查看完整解读

1、当您付费下载文档后,您只拥有了使用权限,并不意味着购买了版权,文档只能用于自身使用,不得用于其他商业用途(如 [转卖]进行直接盈利或[编辑后售卖]进行间接盈利)。
2、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。
3、如文档内容存在违规,或者侵犯商业秘密、侵犯著作权等,请点击“违规举报”。

查找下载文件的指引

一、电脑端

- Windows 系统:按下键盘快捷键 `Ctrl + J`,即可打开下载列表。  

- Mac 系统:按下键盘快捷键 `⌘ + J`,即可打开下载列表。  

二、手机端

1. 打开手机浏览器,点击浏览器右下角的 “≡”(或“更多”)图标。  

2. 在弹出的菜单中找到并点击 “下载内容”(或类似选项),即可查看已下载的文件。  

提示:不同浏览器界面略有差异,若未找到“下载”入口,可尝试在浏览器设置中搜索“下载”关键词。


2026面向人工智能系统的体系化安全检测与风险评估方法研究报告-中国工业互联网研究院.pdf

您可能关注的文档

古玉白 + 关注
实名认证
内容提供者

严选优质运营报告与行业白皮书,呈现精炼可读的专业文库。

文章解读

2026年6月,Anthropic家最新旗舰模型Fable 5和Mythos 5刚上线三天,就被美国商务部以"存在严重安全隐患"为由紧急管制,直接暂停全部服务。

这事发生前半年,曾经在开发者圈子里火过一阵的OpenClaw"龙虾"智能体,也因为提示词注入、远程代码执行这些漏洞,被工信部和国家互联网应急中心点名警告。

AI跑得飞快,但安全带还没系好。

中国工业互联网研究院安全研究所刚发布的这份《面向人工智能系统的体系化安全检测与风险评估方法研究》,正好赶上这个节点——它不是在讲概念,是实打实地做了一轮安全摸底。

1. 54.7%的AI技能模块存在安全缺陷——这个数字比很多人预想的严重

报告对AI智能体的Skills(可以理解成AI用来执行特定任务的"技能插件")做了一轮全面测评。结果不太好看:54.7%的Skills存在安全缺陷。

具体来看,实测的17117个Skills中,一半(50%)面临提示词注入风险——攻击者只需要用精心设计的自然语言就能绕过防护,让AI越权操作。5%把API密钥明文写在代码里,相当于房门钥匙挂在门口的垫子下面。底层代码漏洞检出3715个,还有324个路径穿越漏洞。

更麻烦的是供应链。报告发现,29.7%的Skills有第三方或外部工具依赖,有些甚至通过外部链接下载并执行未经审核的代码。而官方Skills市场缺少严格身份核验机制,单账号就能批量投递数百个恶意包。这跟此前公开报道中多家代码托管平台查出恶意AI模型包的事件,逻辑是一脉相承的——门槛太低了。

2. 提示词注入,目前AI最头疼的安全问题

报告引用了OWASP(一个权威的Web安全组织)的认定结论:提示词注入居人工智能安全风险第一位。理由很直白:技术门槛低、危害大,攻击者只要会说人话就能发起攻击。

报告展示了9种实际攻击检测方法:直接绕过攻击(直接发危险指令)、权限提升攻击(让AI充当"无限制助手")、假设场景攻击(假装研究员问AI如何绕过安全机制)、推理链攻击(用think标签引导模型自我解除限制)、策略傀儡攻击(把恶意指令伪装成XML或JSON配置文件)、ROT13编码攻击(用字符替换绕过检测)、指令遗忘攻击(新指令覆盖旧约束)、上下文长度攻击(用大量无关内容稀释恶意指令)。

这些方法对多个被测模型都有效,部分模型的攻击成功率相当高。OpenAI、谷歌、Anthropic等头部厂商现在都把提示词注入防御列为安全建设核心,并不是没道理的。

据公开报道,2025年以来已有多家企业因为AI系统提示词被人破解,导致内部数据泄露或被恶意利用的案例。这个问题的现实严重性,报告的数据算是给了一个量化注脚。

3. 收录2102个AI漏洞,实测上万端点,65.2%是中高危

报告建立了一个AI安全漏洞库,收录了2102个AI相关漏洞。光收录还不够——团队实测了10094个Ollama端点(一种流行的本地AI部署工具),发现65.2%存在中高危漏洞。

顺便提一嘴Ollama。据公开报道,2024年以来全球开发者使用Ollama在本地部署开源大模型的需求急剧增长,但它默认配置的安全性一直受到安全研究社区的质疑。报告这个65.2%的数字,基本坐实了外界的担忧。

报告还构建了一个覆盖7层的AI安全漏洞分类体系:从最底层的硬件,到网络通信、基础架构、数据、模型算法、智能交互,再到最上层的应用——每一层都理清了对应的安全风险类型。这套框架的逻辑是"逐层查、全局看、精准防"。

4. 跨层级风险传导模型:漏洞不会只待在一层

报告中一个很有技术含量的发现是,AI系统的安全问题不是孤立的——一个底层漏洞可以像多米诺骨牌一样逐层向上传导,到应用层时风险已经被放大了数倍。

报告用一个真实的英伟达CVE-2024-0132漏洞做了案例验证:漏洞首先出现在基础软件层,通过层间传导,最终影响到数据层和模型算法层,破坏力逐层放大。

基于这个发现,团队构建了一套跨层级动态安全量化模型,三个核心能力:第一,算清楚威胁能不能从一层传到另一层;第二,算清楚风险会在每一层被放大到什么程度;第三,算清楚先修复哪里最划算——也就是做防御的成本效益分析。

这个模型的实用价值在于:过去企业做AI安全基本是"哪里起火灭哪里",没有全局判断。这个量化模型至少提供了一个从全局出发做决策的方法。

5. 从检测到评估到修复,一个完整的安全闭环在形成

报告不只是发现问题,还给出了从检测到评估、再到修复量化的全链条方案。

在评估层面,研究团队把AI系统的生命周期拆成了设计、开发、部署、运维四个阶段,分别对应不同的安全风险和检测重点。在标准层面,报告梳理了从国家标准(如《人工智能 风险管理能力评估》《生成式人工智能服务安全基本要求》)、行业标准到团体标准的完整标准体系。

有意思的是,报告里还提到了"安全左移"这个概念——就是把安全措施提前到设计和开发阶段,而不是等到部署后出了问题再修补。数据显示,在底层基础设施层做安全加固,成本效益比明显优于在应用层事后补救。

收尾

这份报告读下来,核心感受是:AI安全不是某个单一环节的问题。模型本身不安全、技能插件不安全、部署方式不安全、供应链也不安全——这几个问题同时存在,而且互相放大。

报告里那套"逐层查、全局看、精准防"的方法论,本质上是在试图回答一个问题:当AI系统越来越复杂、嵌入的环节越来越多的时候,怎么才能真正知道它安不安全?

目前看来,这个回答还在不断完善中。但至少摸底的这组数据,已经给行业敲了一记足够响亮的警钟。

查看完整解读
确认删除?
签到
收藏
足迹
微信
  • 站长微信
回到顶部