安远AI白皮书:智能体L1-L5分级,安全治理有谱
安远AI联合上海人工智能实验室、清华大学智能产业研究院、华为于2026年7月世界人工智能大会(WAIC2026)发布《通用型AI智能体L1-L5分级安全框架白皮书》(1.0版)。这是国内首份系统化提出以"自主性"为主轴、将通用型AI智能体划分为L1-L5五级的安全治理框架,覆盖自主性分级、风险识别、安全防护与综合治理四大要素,为开发者、平台方、用户与评测机构提供可对标的分级安全治理范式。本文拆解报告要点。
一、背景:智能体爆发式增长,安全治理存在"时间差"
报告开篇点出核心矛盾:智能体(Agent)是能够感知环境、规划路径、调用工具、保持记忆,在有限人类监督下自主完成多步骤复杂任务的AI系统;2025年以来智能体的数量与能力持续增长,应用场景不断扩大,但技术演进与安全治理之间存在显著的时间差。近期国内外频发的智能体安全事件就是警示——部分开源智能体被曝出架构缺陷、供应链投毒、权限越界、敏感信息泄露等问题,多个监管部门相继发布安全提示。
报告指出智能体相对传统基础模型具备四项显著的风险特征:一是风险在时间与空间维度扩展——记忆机制使风险具备长期持久性,规划—行动闭环把风险从认知域延伸至物理与现实域;二是风险跨模块传导与放大——安全威胁可在记忆、感知、规划、行动各层之间传导;三是错误信息可沿交互网络快速扩散,引发群体性认知偏差;四是多智能体协同中错误可放大为系统级故障。各国虽尚未形成统一治理模式,但围绕能力与风险实施分级治理已成为全球共识。
解读:智能体的风险不是"大号聊天机器人"的风险,而是"能做事、能调用工具、能跨域行动"带来的系统性风险——治理必须从"事后审查"前移到分级预防,这正是本框架的出发点。

二、分级框架:以"自主性"为主轴,L1-L5五级划分
报告的核心创新是把分级主轴从"能力强弱"换成"自主性水平",并借鉴汽车驾驶自动化分级方法。自主性指智能体在无人干预下独立可靠运行并实现既定目标的程度,被分解为两个可观测、可度量的维度:决策自主度(在关键决策节点能否独立决策、是否需要用户确认)与降险自主度(遭遇异常或失败时能否自行重试、回滚、达成最小风险状态)——两个维度缺一不可,且须同时达标方可判定为该等级,任一维度未达标则按较低维度认定。
五级划分及典型示例为:L1辅助执行智能体(Assisted Executor)——如GitHub Copilot行内代码补全,决策由用户确认、失败即返回用户;L2有监督协作智能体(Supervised Collaborator)——如ChatGPT、Claude、Kimi、豆包等聊天产品的非Agent模式,可在预批工作流内自主决策,但目标与边界由用户设定;L3有条件自主智能体(Conditional Autonomous Agent)——如Claude Code、Kimi Agent、Manus及OpenClaw类产品,可在单一设计运行范围(ODD)内独立完成规划执行,超出范围即主动让出控制权;L4高度自主智能体与L5自适应自主智能体当前暂无现实实例——L4可跨域并发运行、仅在预设高风险节点申请审批,L5具备自主迭代与自我改进能力(报告建议对L5谨慎研发部署),框架纳入它们是为避免未来自主性突破后的"防护真空"。
解读:这套分级最实用之处在于"责任刻度"——它明确随自主性等级提升,决策与降险责任如何从人类用户过渡到智能体系统,让"谁该负责、何时接管、权限给多大"第一次有了工程化的判定标尺,而不是停留在"高/低自主性"的模糊描述。

三、风险识别:九大基线故障风险 + 高自主等级滥用失控风险
报告按智能体系统架构总结出贯穿L1-L5的九大基线故障风险(Malfunction),涵盖提示注入、记忆投毒、供应链污染(模型、MCP等组件)、权限越界、敏感信息泄露与篡改、工具滥用、身份伪造与令牌劫持、过度授权与权限残留、自动化偏差等。报告特别强调智能体相对传统软件新增的两条供应链支路——模型与MCP等组件若在供应链环节被植入恶意代码,风险将沿共享记忆、间接提示注入等路径同步影响多个业务域的下游决策。
随着自主性等级提升,风险呈现清晰的演进路径:L1-L2阶段以"回答错误、误用工具"等故障为主,人工复核与日志审查能发挥兜底作用;进入L3后,外部攻击(提示注入、记忆投毒)导致智能体偏离预期行为的风险显著上升,监督重心须从"事后审查"前移至实时失效检测;到L4-L5,智能体可自主发现、组合与创建新工具、自主迭代框架,手段层规约可能失效,治理必须上升到目标层红线对齐、可扩展监督与能力释放评估。报告同时提示高自主性等级(L3-L5)在滥用与主动失控领域的新兴风险——智能体可能被诱导执行未授权行为、被借可信身份实施定向欺诈,甚至自主迭代出绕过既有控制的能力。
解读:风险图谱的完整价值在于"对号入座"——不同等级产品对照九大基线风险自查,高自主产品额外对照滥用与失控清单;它把"智能体安全"从模糊焦虑变成了可逐条排查的工程清单。

四、安全防护与综合治理:分级防护六原则 + 五大责任主体
报告提出设计智能体安全防护应遵循六项核心原则,核心可概括为"最小权限+分层控制+人机协作":对高影响、不可逆或超出授权范围的行动,人类应具备充分的事前审批权并能在必要时随时接管;实施最小权限原则,配合策略拦截、沙箱隔离与高风险行动审批;建立智能体身份认证与授权体系,实施细粒度权限控制、动态授权和权限隔离;对敏感数据实施访问控制、加密保护与最小化访问;建立全链路日志记录、行为可追溯、人工审批与应急接管机制;并对个人与组织数据分级保护。
在技术防护之上,报告提出综合治理建议:智能体开发者在产品设计时应遵循红线与推荐性治理原则(如目标层红线贯穿全部等级、L5须谨慎研发部署等);并明确智能体生态链中五大责任主体——开发者、平台和组件提供者、企业用户、个人用户、第三方研究评测机构——各自的治理职责,包括供应链安全事件中的责任分工、安全事件信息共享流程、响应时限与协作方式等。报告同时给出不同等级对应的防护组合建议:L1-L2以人工复核、日志分析为主,L3起叠加实时失效检测与运行时接管,L4-L5则需结合可解释性研究、可信评测与表征分析。
解读:报告的可落地性体现在"责任到人"——它把安全从单一的技术问题拆成组织治理问题:谁开发谁负责分级评估、谁部署谁负责授权与监测、谁评测谁负责独立验证;五大责任主体各守一段,才能覆盖智能体全生命周期。

五、全球坐标:中国"治理协同+框架指南+伦理指引"路径鲜明
报告梳理了各国治理进展,指出中国已形成"治理协同+框架指南+伦理指引"的治理体系,核心思路是发展与安全并重、敏捷治理与分类分级:2025年5月国家网信办等部门发文提出"构建智能体分类分级治理框架";网安标委《人工智能安全治理框架2.0》要求从应用场景、智能化水平、应用规模等维度对AI安全风险科学评价分级;2026年3月发布的强制性国家标准《智能体应用安全基本要求》进一步落地;上海等地亦将"具有高度自主能力的自动化决策系统"列入伦理审查复核清单。
海外方面,美国联邦层面采取"意见征询+标准引导+身份管理"路径,NIST启动AI Agent标准倡议、发布智能体身份与授权概念文件;欧盟AI法案对不可接受风险的智能体用途实施禁令,高风险领域须履行风险管理、人类监督与上市后监测义务;新加坡是全球推进智能体治理最积极的国家之一,其《模型AI治理框架》被视为全球首个政府主导、专门面向智能体AI部署治理的推荐性框架文件,围绕风险评估与边界设定、人类有意义问责、技术控制与流程保障、终端用户责任四大支柱。本框架即在此背景下,尝试贡献一套"可参考、可对标"的中国方案。
解读:智能体治理正从"要不要管"进入"怎么分级管"的深水区——中国强调发展与安全并重,欧盟强调风险禁令,美国侧重身份与标准,新加坡突出推荐性框架;本白皮书的L1-L5分级,有望成为各方对话的共同语言。

六、常见问题解答(FAQ)
1. 什么是通用型AI智能体?
能感知环境、规划路径、调用工具、保持记忆,在有限人类监督下自主完成多步骤复杂任务的AI系统,典型形态包括通用AI助手、GUI智能体和编程智能体。
2. L1-L5五级怎么划分?
以"自主性"为主轴,按决策自主度与降险自主度两维度划分:L1辅助执行、L2有监督协作、L3有条件自主、L4高度自主、L5自适应自主;两维度须同时达标才可判定该等级。
3. 智能体有哪些主要安全风险?
九大基线故障风险:提示注入、记忆投毒、供应链污染、权限越界、敏感信息泄露、工具滥用、身份伪造、过度授权、自动化偏差;L3-L5还需关注滥用与主动失控新兴风险。
4. 分级防护的核心原则是什么?
最小权限+策略拦截+沙箱隔离+高风险行动审批;人类对高影响行动有充分事前审批权与随时接管权;建立身份认证、细粒度授权、全链路日志与应急接管机制。
5. 这份白皮书由谁发布、给谁用?
安远AI联合上海人工智能实验室、清华智能产业研究院、华为于WAIC2026发布,供智能体开发者、平台与组件提供者、企业和个人用户、第三方评测机构参考对标。
想系统阅读安远AI及各机构最新的人工智能行业研究报告,运营动脉(www.yydm.cn)提供精品报告库、课件库与模板库,7W+精选资料每月更新1000+份,是持续跟踪AI安全与智能体产业动态的好去处。
声明:除非特别标注,否则均为本站原创文章,转载时请以链接形式注明文章出处。如若本站内容侵犯了原著者的合法权益,可联系本站删除。




