微信
手机学习
  • 客服热线: 4008-000-428

从模型可信到系统可控:Agent时代的AI风险治理

发布时间:2026年09月16日| 作者:张卓| 来源:ISACA| 点击数: |字体:    |    默认    |   

  Agent正在改变AI风险的基本单位。过去,企业主要评估输入和输出;当Agent开始规划任务、调用工具、读写数据并持续运行,风险便存在于整条行动链中。模型可信是上线的基础,系统可控是规模化运行的前提。

  74%——受访企业AI负责人预计2027年前较大程度使用AI Agent

  21%——受访组织已建立成熟治理模型

  3,235——德勤2026年调查24个国家受访企业AI负责人

  德勤2026年对24个国家3,235名企业AI负责人的调查显示,74%的受访者预计企业将在2027年前较大程度使用AI Agent,只有21%的组织已建立成熟治理模型。德勤的分析说明,Agent扩张速度已经超过控制体系建设速度。当前缺口在于将治理原则落实为身份、权限、监控、证据和异常处置机制。

 

Agent把内容风险扩展为行动风险

  一次Agent任务可能跨越模型、记忆、外部工具、业务系统和其他Agent。更多Agent进入流程,行动链变长,人工确认减少,单次偏差的影响范围随之扩大。

  Token消耗只是“规模信号”。风险暴露取决于Agent的自主程度、持续时长、工具权限和系统可观测性。有效凭证证明Agent有权访问,却不能证明行动“符合最初批准的业务目的”。

  麦肯锡2026年对约500家组织的调查显示,近三分之二将安全和风险列为规模化部署Agent的首要障碍;对多数AI风险,主动缓解能力仍落后于风险认知。麦肯锡的调查说明,治理重点已经进入控制落地阶段。

 

系统可控需要覆盖四个运行面

  Ⅰ.身份与行动

  Agent需要独立身份、明确委托和最小权限,工具调用与数据访问必须限定范围。高影响操作应设置二次授权或人工确认;跨Agent、跨工具的任务转交,需要保留完整责任链。

  Ⅱ.上下文与记忆

  Agent持续处理KV Cache、工具结果和任务状态,并在显存、内存与SSD之间迁移。从高通AI200、Intel Crescent Island到曦望Sunrise的启望S3,国内外面向推理负载的芯片产品均将大容量LPDDR作为接下来的重要技术路线。不同产品选择背后的判断趋于一致:模型规模、长上下文和KV Cache驻留需求持续增长,正在推动推理系统的设计重心从峰值算力扩展到内存容量、数据移动效率和单位Token成本。大容量解决“装得下”,可观测、可隔离、可追溯的状态管理决定系统能否“管得住”。

  Ⅲ.配置与质量

  量化精度、推理框架、模型路由和降级策略都会改变质量边界。模型、软件栈与运行参数需要建立版本基线;精度变化必须按业务场景验证,超时、切换和降级必须显式记录,避免系统在业务无感知的情况下改变服务质量。

  Ⅳ.基础设施与韧性

  显存容量、任务调度、节点互联和故障域直接影响上下文完整性与业务连续性。治理指标需要从峰值TFLOPS延伸到p95/p99延迟、降级率、恢复时间,以及SLA约束下的goodput,用真实运行结果验证系统韧性。

 

控制必须写进技术栈

  Agent层:管理身份、权限、工具和关键动作。

  运行时层:管理版本基线、缓存生命周期、全链路trace和降级策略。

  基础设施层:管理隔离、容量、故障域和恢复。

  企业治理层:确定业务分级、风险容忍度和责任边界。

  上层治理受下层架构直接约束。缺少trace,审计没有完整证据;缺少身份和委托链,责任无法还原;缺少故障隔离和降级记录,韧性无法验证。

  Gartner研究提出,应将Agent运行时执行机制与法律、合规及业务风险对齐。ISACA分析也强调,应同时监测授权范围和实际行动范围。

  在近期一个推理平台项目中,基于某流行框架实现KV Cache跨节点传输与跨实例池化,通过复用满足匹配条件的缓存减少重复计算。这项优化也改变了风险评估的范围:缓存跨节点流转后,租户隔离与访问控制需要覆盖完整链路;新增的网络与存储依赖,则需要验证故障重试和恢复能否满足业务时限。

  因此,上线验收需要同时检查性能收益、缓存隔离和故障恢复表现,并为无法自动恢复的关键任务明确暂停或转人工的业务规则。业务负责人据此判断剩余风险是否可接受,确定上线范围。模型没有变化,数据流和系统依赖却已经改变,原有风险评估也必须随之更新。

 

风险、审计与安全从业者需要补齐的三项能力

  1 看懂系统

  沿任务链看清模型、缓存、推理运行时、工具和基础设施,识别控制点及上下游依赖。没有技术栈素养,风险判断很难进入真实架构。

  2 看见运行

  把控制目标转化为越权行动率、链路追溯完整率、配置漂移率、降级率和恢复时间,推动时点评审走向持续保证。

  3 推动闭环

  把技术风险翻译成业务影响、风险容忍度和资源优先级,推动产品、研发、安全、审计和业务共同完成控制设计和有效性验证。

  麦肯锡调查中,近60%的组织将知识和培训不足列为实施可信AI的首要障碍。专业能力和清晰的组织责任,已经成为AI治理落地的硬约束。

 

模型可信决定起点,系统可控决定规模

  模型评测通过,不代表业务风险可接受。从模型可信到系统可控,关键是把风险容忍度落实为授权边界、运行控制和停止条件。模型、架构或权限发生实质变化,都需要重新评估风险。上线时的结论,不能替代运行中的证据。

  风险、审计与安全从业者的专业价值,在于贯通技术机制与业务影响,用运行证据验证控制有效性,并明确剩余风险的接受与处置责任。AI风险管理必须贯穿部署、运行和变更全过程:以经过验证的控制能力,确定部署规模与自主权限,在创造业务价值的同时,将风险维持在企业能够识别、持续监测并明确接受的范围内。

上一篇:数字信任势在必行:多云架构的核心价值

下一篇:没有了!

热销商品推荐
学员心声