Skip to content

AI Agent越来越多,但谁来给Agent的风险分类——一个实用治理框架 ​

2026年8月8日 · 预计阅读 12 分钟 关键词:AI Agent、风险分类、治理框架、自主性等级、ARC


客服Agent、代码生成Agent、金融交易Agent、自主安全Agent,共同点是什么?都能自主行动——调用工具、读写数据、根据环境反馈决定下一步。而现有通用AI风险框架(NIST AI RMF、EU AI Act等)的评估重点大多放在"模型输出"这一环,对连续行动的Agent覆盖不足。这篇文章用"12维风险评分 → GPA聚合 → IAT分级 → 自主性分级 → 三级治理输出"的链路,把"Agent有多危险、该管到哪一级"变成一套可重复的评估流程。ARC(Agent Risk Classification)是本文为演示这套思路构建的示例框架,不是监管或行业标准。


01 现象:Agent在跑,治理没跟上 ​

2023年以来,AI Agent从演示走向生产环境的速度明显加快。自主编程Agent(如Devin)、Multi-Agent协作系统、AutoGPT式的任务链分解、MCP(Model Context Protocol)协议驱动的工具调用网络,一批批进入企业流程。

能力先行的同时,治理动作明显滞后。不少团队的Agent已经能调用API、读写数据库、操作生产环境,风险评估还停留在"模型输出对不对"的阶段。评估流程跟不上部署速度,在金融、交易这类场景里不是小问题:一个能自主行动的Agent,它的错误不再是"答错一道题",而可能是实打实的资金损失。这不只是合规问题,还可能演变成运营事故。


02 为什么现有框架管不住Agent ​

多数通用AI风险框架(NIST AI RMF、ISO/IEC 42001、EU AI Act分类法)把评估重点放在"模型-输出"环节:输入问题、模型返回答案、评估答案的风险。

Agent AI打破了这条链路。它不只是回答问题,而是连续行动:决定做什么、调用什么工具、按什么顺序执行、根据环境反馈调整下一步。这个差异放大了四类风险:

2.1 自主决策权 ​

Agent不是被动响应器,而是主动行动者。它决定是否执行行动、何时执行、以什么顺序执行。这个"决定权"本身就是传统框架没有覆盖的维度。

2.2 工具调用链 ​

一个Agent在一个任务中可能调用5-15个不同工具——读写文件、执行Shell命令、调用外部API、操作数据库。每个工具调用都是风险暴露点,且风险不是简单相加:

Rchain=1−∏i=1n(1−ri)

其中 ri 是第 i 次工具调用的单步风险概率。n=10、ri=0.01 时,Rchain≈0.096,接近单次调用风险的10倍。

2.3 多步推理副作用 ​

Agent的推理过程不一定是"线性正确"的。它可能在中间步骤产生不可逆的副作用——比如先删除了一个文件,在后续步骤中才"意识到"这是个错误决定。事后可追溯,不等于事前可预防。

2.4 环境反馈回路 ​

Agent与环境交互后,环境状态改变,Agent继续基于新状态做决策。这个反馈闭环可能形成风险复合效应:

St+1=f(St,At)

如果 At 有偏差,St+1 会进一步扭曲,后续决策 At+1 偏差更大——典型的自激震荡。

四类放大器叠加,说明Agent的风险很难直接套用传统AI风险框架——它需要一套针对"连续行动"的评估方法。


03 ARC框架:给Agent配一张风险处方 ​

ARC(Agent Risk Classification)是本文构建的示例框架,针对典型Agent AI系统设计结构化、可重复的风险评估流程。设计思路:不去预测所有失败模式,而是对Agent的固有风险维度系统化评分,再根据评分匹配合适的治理等级。

3.1 12维风险评分 ​

ARC定义12个独立风险维度,每个维度按1-5分打分:

维度说明低风险(1)高风险(5)
意图对齐Agent目标与人类意图的匹配度固定目标目标可自修改
工具滥用工具调用的越界风险无工具调用无限制工具调用
数据泄露敏感数据处理风险无数据处理处理PII/支付数据
推理失控多步推理过程中的偏差累积单步推理10+步骤自主推理
环境破坏对外部系统状态的修改能力只读可删除/修改
目标漂移长期任务中目标的稳定性单次任务无限时任务
提示注入对抗性提示攻击的脆弱性无直接暴露面向公众开放
权限溢出权限提升的可能性最小权限最高权限(root/管理员)
不可解释性决策过程的可理解程度完全可追踪黑箱推理
错误传播错误在链式调用中的扩散单步可隔离全链不可逆
社会操纵对人类的欺骗或操纵能力无社交交互可模拟人类
部署扩散Agent副本/实例的扩散范围单实例多实例并发

综合风险评分(等权):

RARC=112∑i=112si,si∈{1,2,3,4,5}

更精细的加权版本:

RARCw=∑i=112wi⋅si∑i=112wi

权重 wi 可由组织根据自身风险偏好调整,例如金融行业可调高"工具滥用"和"权限溢出"的权重。

3.2 GPA聚合:把12个维度压成三个指标 ​

12维评分是精细画像,管理层面还需要一个可操作的总分。ARC把12维映射到三个高层指标:

  • G - 治理完备性:组织对Agent的控制能力(监控、审计、访问控制、熔断机制)
  • P - 性能可靠性:Agent完成任务的质量(准确率、鲁棒性、失败恢复)
  • A - 自主性等级:Agent脱离人类干预独立行动的程度

综合风险评分(风险向,分数越高越危险):

GPArisk=α(5−G)+β(5−P)+γA

其中 α+β+γ=1,默认配置 α=0.4、β=0.3、γ=0.3(治理权重最高)。治理完备性G和性能可靠性P越高,风险越低(取5-G、5-P);自主性A越高,风险越高(直接取A)。一个治理完善、性能可靠但自主性很高的Agent,综合风险仍然不低。

3.3 IAT五级分类 ​

基于GPA风险分,ARC把Agent归入5个综合评估等级(区间左闭右开,与代码实现一致):

IAT等级GPA风险分含义治理要求
IAT-I< 1.0最低风险标准监控
IAT-II[1.0, 1.8)低风险增强日志
IAT-III[1.8, 2.6)中等风险人工抽查
IAT-IV[2.6, 3.4)高风险人工审批部署
IAT-V≥ 3.4极高风险禁止部署

3.4 自主性五级框架 ​

自主性是Agent风险的核心变量。ARC定义了独立于具体任务的自主性等级量表:

等级名称特征
L1人工在环(HITL)每步操作需人类确认
L2人工监督(HOTL)人类实时监控,可干预
L3人工例外(HITEL)人类只在异常时介入
L4部分自主人类设定目标,Agent规划执行
L5完全自主人类仅做战略委托


04 代码实现:给四个典型Agent打分 ​

下面的代码用ARC框架对四个典型Agent做评估:客服对话Agent、代码生成Agent、金融交易Agent、自主网络安全Agent。要评估别的Agent,改三个字典(dims、G、P、A)就行:

运行输出:

风险排序符合直觉:客服Agent原始风险低(ARC 1.58)、治理完善(G=4.5)、自主性低(L2),综合风险最低(IAT-II);金融交易Agent和安全Agent原始风险高(ARC 3.75/3.83),加上治理完备性低(G=2.0/1.5)、自主性高(L4),综合风险升到IAT-IV,需要人工审批才能部署。

原始风险(12维评分)回答"有多危险",GPA综合风险回答"治理与自主性综合下的风险水平",IAT分类回答"该管到哪一级"。三者联动才是完整的治理决策。


05 三级治理输出:从评分到行动 ​

ARC的最终产出不是一堆分数,而是三级治理输出:

第一级:Agent风险护照 ​

每个Agent获得一份标准化护照,包含:

  • ARC 12维雷达图(一目了然的风险画像)
  • GPA得分与IAT分级
  • 自主性等级
  • 关键风险关注点(得分≥4的维度)

第二级:治理行动矩阵 ​

基于IAT分级和自主性等级,生成差异化的治理要求:

治理措施L1L2L3L4L5
逐步审批✅————
实时监控✅✅✅——
异常熔断✅✅✅✅—
行为日志审计✅✅✅✅✅
权限沙箱—✅✅✅✅
红队测试——✅✅✅
人机协商机制———✅✅
战略委托协议————✅

第三级:持续监控看板 ​

风险评估不是一次性体检。ARC要求:

  • 动态重评:Agent升级、工具链变更、部署环境变化时触发重评
  • 运行时异常检测:GPA分数漂移超过0.5时自动告警
  • 事件记录:每次工具调用的风险日志写入不可篡改的审计链

06 数学文化:AI风险治理的三次范式跃迁 ​

AI风险治理框架的演进,可以从数学结构上分成三个阶段。

第一次跃迁:Asilomar AI Principles(2017)——原则时代 ​

2017年,Future of Life Institute在加州Asilomar会议发布23条AI发展原则,用定性原则框定底线:

AI必须是{安全的透明的负责任的人类可控的

这是AI治理的公理阶段——告诉世界"应该做什么",但不告诉"具体怎么做",类似欧几里得几何的五大公设:正确、优雅,但不足以解决所有问题。

第二次跃迁:EU AI Act(2021-2024)——分类时代 ​

EU AI Act(Regulation (EU) 2024/1689)把AI系统按风险分为四类:不可接受风险、高风险、有限风险、最低风险:

RiskClass(system)={Unacceptableif system ∈ social scoring, ...Highif system ∈ critical infra, education, ...Limitedif transparency obligations metMinimalotherwise

这是AI治理的分类阶段——把AI系统"装进盒子里"。局限在于分类法面向应用场景,而非技术能力结构:一个客服Agent可能被评为"有限风险",但它可能拥有完全自主的数据库写入权限——场景分类无法捕获这类风险。

第三次跃迁:ARC(2025)——量化评分时代 ​

ARC(本文示例框架)的思路是引入一个可计算的、多维的、动态的风险度量空间:

ARC: R12→[1,5]×[1,5]×{1,2,3,4,5}×{IAT-I, ..., IAT-V}

从12维特征空间到治理决策空间的可计算公式,而不是原则清单或场景分类。

三个时代的关键区别:

特征Asilomar原则EU AI ActARC框架
基础逻辑道德准则法律分类量化度量
粒度23条原则4个风险类12维×5级
可操作性低中高
覆盖Agent风险否部分是
可重复性不适用场景依赖工具保证
动态更新无立法修订实时重评

从数学结构看,三个范式对应不同工具:Asilomar是集合论(定义"好"AI的边界),EU AI Act是分类器(决策树式分类,但特征空间不足),ARC是度量空间加加权范数(在12维风险空间定义距离)。ARC本质是在学习一个从风险特征到治理策略的映射函数:

f:R12→G

这个映射由GPA聚合、IAT分级、自主性等级、治理矩阵复合而成,好处是"先度量、再分类、最后行动"的递推结构——每一步的输入都是上一步可验证的输出。


07 结论:Agent治理的PDCA循环 ​

ARC给AI治理从业者的启发,是风险管理闭环本身:

对于正在或计划部署Agent的企业,可以参考的行动路线:

短期(30天内)→ 建立Agent清单

  • 盘点组织中所有Agent系统(包括PoC和实验项目)
  • 用12维量表对每个Agent做初步评分
  • 识别出IAT-IV和IAT-V级别的"高危Agent"

中期(90天内)→ 实施分级治理

  • 根据IAT分级配置差异化的监控和审批流程
  • 部署运行时异常检测(关注GPA漂移)
  • 建立Agent风险护照制度

长期(180天+)→ 构建治理基础设施

  • 建立Agent工具调用的审计追踪系统
  • 把评估嵌入CI/CD管线(每次Agent更新自动触发重评)
  • 培养Agent风险评估能力(每个Agent配备"风险守护者")

Agent的部署节奏不会因为这篇文章停下来,也不该停。风险分类能做的,是让部署从"先跑起来再说"变成"先知道边界在哪"。


常见问题 ​

Q1:ARC框架是标准吗?能不能直接照搬?

ARC是本文构建的示例框架,用于演示"多维评分→聚合分级→治理行动"的完整思路,不是任何监管或行业标准。实际落地时,12个维度、权重和IAT阈值都应该根据你所在行业的监管要求(如EU AI Act、中国《生成式人工智能服务管理暂行办法》)和机构自身的风险偏好调整。

Q2:12维评分怎么打分?谁来打?

每维1-5分需要评估者结合Agent的设计文档、权限配置、部署环境给出判断。建议由模型治理团队牵头,联合安全、法务、业务三方打分,并对打分理由留档。评分的客观性取决于评估者是否掌握了Agent的实际能力边界——这正是"先盘点,再评估"的意义。

Q3:ARC评估多久做一次?

至少三个触发点:上线前必评;Agent升级、工具链变更、权限调整、部署环境变化时重评;定期(如季度)复评,结合运行监控数据(GPA风险分漂移、异常调用记录)动态调整。风险是动态的,评估不能是一次性的。


数据说明: 本文全部数字来自ARC框架模拟评估脚本 gen_figures.py(四个典型Agent的12维评分、GPA聚合与IAT分级,输出为脚本实际运行结果),图表由同一脚本生成,可复现。 代码环境: Python 3.12.3 / numpy 2.5.1 / matplotlib 3.11.0


**参考文献**
  1. Asilomar AI Principles. Future of Life Institute. 2017.
  2. European Union. EU AI Act (Regulation (EU) 2024/1689). 2024.
  3. NIST. AI Risk Management Framework (AI RMF 1.0). 2023.
  4. Russell, S. Human Compatible: AI and the Problem of Control. Viking, 2019.

ARC(Agent Risk Classification)为本文构建的示例框架,用于演示Agent风险分类的方法论,不声称来自任何外部机构标准。图表生成代码见同目录下的 gen_figures.py。

关注公众号:QIAN数据