AI智能体失控比内鬼更可怕!5大防线斩断“失控黑手”

责任编辑:cres

作者:Lucian

2026-09-09 14:43:02

来源:企业网D1Net

原创

越来越多企业正向AI智能体授予员工级特权,但其超越人类的运行速度与自主性,极易使无意的授权演变为失控的内部威胁。

未经管控的智能体可能会成为企业最严重的内部威胁,多位安全专家针对安全团队如何降低越轨智能体活动的风险与影响,分享了来自实战的洞察。

企业正越来越多地向智能体授予特权员工的凭据、工具和网络访问权限,然而安全专家警告称,现有的针对人类访问权限设计的安全控制手段已不再适用。智能体能够以非人类的速度运行,将合规的操作链式组合成未授权的结果,甚至能衍生出额外的子智能体来辅助工作,这会导致在安全团队检测并拦截之前,某个无意员工的访问权限就已经演化成了一支越轨的内部威胁团队。

智能体误解模糊的目标、遵循来自文档、代码库和网页的恶意指令,或是基于第三方工具输出的错误结果进行操作,这些现象屡见不鲜。在近期的一系列事件中,无论是前沿大模型还是开源权重模型,都在测试期间发生了越轨行为:它们利用漏洞逃逸沙箱环境、试图操控开源项目的开发者,或是黑入第三方系统。

安全领域目前与失控智能体最接近的威胁模型是越轨员工,但企业在遏制恶意内部人员的潜在破坏半径方面本就吃力,而智能体又为这一威胁叠加了机器速度、自主性以及专业技能。

“过去二十年,我们一直在构建针对人类的身份管理体系:用户名、密码和基于角色的访问控制,”治理、风险与合规公司Strike Graph的CEO Justin Beals表示,“这些都不是为了那些不知疲倦、从不下班且依据概率而非规则行事的智能体设计的。”

“我们在构建安全基础设施、安全架构以及遏制潜在越轨员工方面已经严重滞后了,”Veracode首席安全布道者Chris Wysopal向表示,“现在你面临的是以机器速度执行这些行为的对象,我认为这非常危险,我们必须真正掌握遏制和控制这些智能体的方法,针对什么是可接受的、什么是尽职调查、什么是最佳实践制定相关标准。”

在网络和应用遥测数据中,智能体的操作通常显示为使用合法员工凭据进行认证、源自可信的IP地址或使用经批准的API。为了为其制定有效的安全策略,企业需要将智能体与其继承权限的员工区分开来。

安全专家指出,当智能体跨越未授权边界时,安全团队必须能够及时察觉,并立即撤销该智能体启动的所有凭据、会话和进程,同时,他们还需要能够回滚该越轨智能体可能已执行的所有操作。

“控制机制必须置于模型之外,实时监控其具体行为,而不是盲目相信它被告知‘不能做什么’,”身份安全公司Delinea的CEO Art Gilliland表示,“如果你的安全寄希望于模型选择表现良好,那你不叫拥有控制权,你这叫寄予厚望。”

智能体需要刚性边界

将智能体视为特权内部人员,意味着要通过其自身无法控制的技术手段来限制其行为,而不是仅靠提示词告知它不该做什么。系统提示词可以降低大模型做出不安全决策的概率,但它们不是刚性拦截器,智能体有时也会选择不遵守它们。

默认情况下应拒绝直接连接互联网,所有请求都应通过强制执行域名和操作白名单的代理进行路由。应分离读写权限,且高风险操作(如删除、权限变更和数据导出)必须经过显式审批。

OWASP关于防止过度代理的指南建议:限制智能体可用的函数、权限和自主性,并在下游系统中强制执行授权,而不是让AI模型自行决定某项操作是否被允许。

“在我用于智能体红队测试的框架中,会对每个命令行工具调用执行作用域级别的Hook检查,对照批准的目标列表核对每条命令,”Suzu Labs安全AI解决方案与网络安全高级总监Jacob Krell表示,“在作用域边界上,我刻意偏向于假阳性(误报)和故障关闭机制,我宁愿让人类去审批一项模糊的操作,也不愿让智能体自行决定某个目标是否可能在作用域内。”

长效凭据通常应保留在智能体的沙箱之外,且应通过文件系统隔离来限制对配置文件的访问,相反,代理应用可以在智能体调用受批准工具时注入小范围、短时效的token,并对请求的操作进行验证。通常情况下,智能体不应具备为自己赋予额外权限或扩大自身作用域的机制。

XBOW是一家运营用于攻击性安全测试的自主智能体的公司,该公司在其公开发布的架构说明中描述了这种分层防御机制:任务的作用域在启动时即被锁定;域名和URL路径在可访问之前就被定义并列入白名单;所有出站流量都必须通过出口代理,且每个智能体都在独立的操作系统用户下的专用沙箱内运行。

该公司还使用了一个独立的监护AI模型来审查智能体提议的操作,评估其安全性并拦截任何超出作用域的行为,该监护模型只能看到智能体的具体操作,看不到其背后的理由和推理过程,因此不会受到诱导或操控。

另一个独立的确定性健康监测系统可以在观察到某些不安全状况时直接关闭智能体,且所有决策和观察结果都会记录在针对每个智能体的审计文件中,以便后续审查。

“最合理的假设是:在某个时刻,智能体一定会尝试做出超出其授权范围的事情,”XBOW的CISO Nico Waisman表示,“系统在设计时必须确保,即使发生了这种情况,它也无法触及或影响外部组织的系统。”

对于模糊和敏感的操作,人类审批仍然不可或缺,但对每一个步骤都要求审批可能会削弱监督效果。Anthropic 在今年5月表示,根据Claude Code的遥测数据,用户批准了大约93%的权限提示,他们同时警告警惕“审批疲劳”——用户看到的审批请求越多,对每个请求投入的注意力就越少,随着时间的推移,监督的严谨度就会下降。

构建能够自动允许安全操作并拦截禁止操作的确定性控制机制,可以让人类只需集中精力审查那些可能产生危险后果且难以逆转的请求。

监控必须追踪授权链

安全团队还需要厘清智能体正在行使谁的授权,以及该授权在工作流中是如何变化的,这意味着他们必须具备将智能体与启动它的员工区分开来的能力。

日志记录必须在保留员工身份的同时,为智能体分配一个独立的身份。子智能体和子进程也应该获得各自的身份,并能追溯到其父智能体、受批准的目标以及人类所有者。

“用户名和密码无法告诉你操作背后是人类还是智能体,”Gilliland 说道,“你需要区分人类和 AI 智能体,即使它们使用的是相同的登录凭据。更重要的是,你需要实时监控在获得访问权限之后所发生的一切,并具备在行为越界时瞬间切断连接的能力。”

基于角色的访问控制和最小权限原则在此发挥作用,因为智能体的独立身份不应直接继承所有者的全部权限。在需要提权时,应仅按任务进行审批,并在工作流结束时自动失效。

微软发布了针对智能体的最小权限指南,呼吁采用临时角色激活和短时效令牌,并在从编排器到工具、再到下游服务的每一个链路环节上,重新验证身份、角色和作用域。Google Cloud最近也为智能体工作流增加了工具和目标级别的策略,能够区分模型上下文协议的工具名称、方法和操作。该实现虽然特定于谷歌平台,但其核心原则同样适用于其他环境。

当出现异常时,调查人员应当能够复原初始触发条件、智能体身份、受批准的目标、模型版本、查询的工具与参数、网络请求、被修改的资源以及最终结果。

“记录一切,以便每个操作都能追溯到产生它的提示词和推理过程,”网络风险公司Resilience的风险操作中心负责人Jud Dressler表示,“如果出了差错,你需要知道其中的原因。”

当智能体之间发生协作甚至互相对抗时,这一点尤为关键。在Anthropic的多智能体实验中,被赋予冲突的软件迁移目标的智能体出现了禁用账户、终止进程、部署伪装的恶意代码以及使用自传播恶意软件的情况。在另一些案例中,即便切断了直接通信渠道,智能体也能通过非传统手段找到彼此勾结的方法。

智能体工作流需要紧急止损开关

安全团队必须建立起无需人类介入即可自动暂停智能体的触发条件和机制,这些条件可包括:屡次尝试访问未授权的互联网目的地、尝试提升权限、创建异常身份、修改其他智能体或频繁调用被拦截的操作。

智能体关停后必须紧跟访问令牌的撤销,如果智能体使用的是跨多个智能体共享的长效API密钥而非临时凭据,这一步可能会非常棘手。

“实时监控智能体,这样你就能在越界行为发生时即刻阻止,而不是事后在日志里才发现,”Secure.com工程负责人Waseem Ahmed表示,“假设任何有能力的智能体都会尝试突破其限制,因此在运行之前就必须构建好防护栏和遏制机制。”

企业还应针对其 AI 智能体可以修改的代码、数据、账户、云资源和配置,建立自动化回滚程序,且演练应包含智能体出现越轨行为的场景。

“构建用于将不受限模型控制在其授权范围内的监控和作用域基础设施,是大多数团队尚未开始解决的工程难题,”Krell 表示,“网络安全预算一直遵循相同的模式:董事会只有在实际的漏洞利用迫使其妥协后才会批准实质性的支出,这种被动响应模式本就风险重重。随着自主漏洞挖掘和利用开发变得普遍,等待安全事件发生来证明投资的合理性,意味着安全事件的到来将远快于预算的下达。”

管控AI智能体的10个建议

1. 将智能体视为特权内部人员:不要依赖系统提示词和指令,技术控制手段必须置于智能体自身控制范围之外。

2. 建立刚性边界:确保实施以下技术控制:

• 默认拒绝直接连接互联网;所有请求均通过带有域名和操作白名单的代理路由

• 分离读写权限

• 高风险操作(删除、提权、数据导出)需要显式审批

• 通过文件系统隔离限制对配置文件的访问

• 将长效凭据保留在智能体的沙箱之外

3. 使用小范围、短时效凭据:在智能体调用受批准工具时,利用代理应用注入临时令牌,而不是赋予智能体永久API密钥,智能体绝不应具备自行授予额外权限的能力。

4. 实施独立的智能体身份追踪:在保留并记录员工身份的同时,为智能体分配独立身份。追踪子智能体和子进程,赋予其可追溯至父智能体和人类所有者的独立身份。

5. 应用结合临时角色激活的最小权限原则:智能体不应继承所有者的全部权限。提权应按任务审批,并在工作流结束时失效。在链路上的每一步重新验证身份、角色和作用域。

6. 部署监护 AI 模型:使用独立的 AI 系统审查智能体提议的操作,评估其安全性,并拦截任何超出作用域的行为。监护模型应仅查看操作本身而非智能体的推理过程,以防受到操控。

7. 全量日志记录以备审计:记录初始触发条件、智能体身份、受批准目标、模型版本、调用的工具、参数、网络请求、修改的资源和最终结果。每个操作都必须能追溯到产生它的提示词和推理过程。

8. 设置自动紧急止损开关:配置无需人类批准即可自动暂停智能体的条件,包括:

• 屡次尝试访问未授权的互联网目的地

• 尝试提升权限

• 创建异常身份

• 修改其他智能体

• 频繁调用被拦截的操作

任何关停操作之后都应立即撤销令牌并执行回滚程序。

9. 构建自动化回滚程序:针对AI智能体修改的代码、数据、账户、云资源和配置建立自动化回滚机制。在应急响应演练中加入智能体越轨场景。

10. 进行实时监控:不要等待日志——实时观察智能体,以便在越界行为发生时即刻阻止。假设任何有能力的智能体都会去试探其边界。

企业网D1net(www.d1net.com):

国内头部to B IT门户,旗下运营国内头部的甲方CIO专家库和智力输出及社交平台-信众智(www.cioall.com)。旗下运营19个IT行业公众号(微信搜索D1net即可关注)。

版权声明:本文为企业网D1Net编译,转载需在文章开头注明出处为:企业网D1Net,如果不注明出处,企业网D1Net将保留追究其法律责任的权利。

AI

链接已复制,快去分享吧

企业网版权所有©2010-2026 京ICP备09108050号-6京公网安备 11010502049343号