生产级 Agentic AI 系统,并不是简单地给模型连接更多工具。它是一套受控的决策与执行系统,即使面对恶意输入、依赖故障、权限变化和模型异常行为,也能够安全运行。可靠性、安全性、可审计性和恢复能力必须被设计到架构中。
这份生产级 Agentic AI 安全清单聚焦于真正区分演示系统与可信生产系统的控制。团队应在上线前、增加高影响工具后,以及模型、提示、检索来源或审批流程发生变化时使用它。
1. 写明允许的运行范围
定义谁可以使用 Agent、它能够访问哪些数据、调用哪些工具、哪些外部目的地被允许,以及哪些操作必须审批。同时记录明确禁止的行为。“帮助客服团队”不是可执行的安全边界;“可以根据已批准知识生成回复草稿,但不能发送、退款、导出或修改权限”才是。
把范围关联到具体发布版本和责任人。新增能力不能静默扩大已经批准的边界。
2. 按信任等级分离指令
系统和开发者指令、用户请求、检索文档、工具输出、邮件和网页不应拥有相同权威。应标注来源信任等级,并在编排层强制执行指令优先级。
测试直接和间接提示注入。即使文档或网页中的文字伪装成安全通知或管理员命令,Agent 也应把它视为不可信数据。
3. 在模型之外执行身份和租户边界
让经过认证的用户、租户、角色和委托权限贯穿整个工作流。绝不能让模型判断用户是否有权执行操作。授权必须在检索和工具执行时,基于可信应用上下文完成。
测试跨租户文档 ID、重复使用的浏览器会话、猜测的资源标识、缓存结果,以及引用其他账户的工具参数。
4. 为每个工具配置最小能力
优先使用范围狭窄的工具,而不是通用 Shell、无限制浏览器或宽泛数据库接口。分离读写操作、限制参数、设置目的地允许列表、限制交易规模,并使用短期凭证。
维护工具清单,记录用途、责任人、权限范围、审批策略、速率限制、日志行为和失败模式。审查真实 API 权限,而不只是展示给模型的友好工具描述。
5. 确定性地校验每个操作
把模型生成的参数视为不可信输入。在执行前校验 Schema、类型、长度、对象所有权、目的地、数据分类、交易限额和业务规则。
高影响操作必须产生确定性的允许、拒绝或需要审批决定。第二个模型或更强提示可以帮助发现风险,但不能成为唯一执行边界。
6. 把人工审批绑定到准确 Payload
审批人应看到操作、目标、重要参数、数据目的地、受影响账户和预期结果。审批必须与准确 Payload 绑定,并在较短时间后过期。
如果 Agent 在批准后修改金额、接收者、目的地或操作,必须重新审批。测试重放、过期审批、误导性摘要、批量操作、拒绝和超时行为。
7. 控制数据外发
绘制数据可能离开的所有路径:回答、工具参数、URL、Webhook、邮件、文件、浏览器表单、分析系统、日志、记忆和第三方模型供应商。对敏感数据进行分类并定义允许的目的地。
测试明文、编码、拆分、转换和多步骤外泄。强制执行目的地允许列表,在记录日志前脱敏密钥,并阻止向不需要敏感数据的工具传递 Payload。
8. 保护检索与记忆
认证知识来源、保留租户权限、记录来源版本,并把检索内容视为证据而不是策略。测试被污染的文档、过期指导、冲突来源、恶意元数据和未授权文档。
对于记忆系统,定义可以保存什么、谁可以召回、保留多久和如何删除。测试跨用户召回、敏感值持久化,以及早期对话中植入的指令。
9. 隔离代码、文件和浏览器会话
执行代码或控制浏览器的 Agent 需要强化沙箱。限制网络目的地、文件系统路径、进程、下载、密钥访问、已认证会话和执行时间。
浏览器测试应覆盖恶意页面、弹窗、下载、欺骗性控件、跨域跳转,以及诱导 Agent 泄露数据或确认不可逆操作的尝试。模型指令不能替代浏览器或网络层强制控制。
10. 设计幂等性和受限重试
Agent 可能在超时后重复调用,即使第一次请求已经成功。写操作应使用幂等键、稳定交易 ID、重试限制、退避和重复检测。
测试多步骤工作流的部分失败。系统必须知道哪些步骤已经完成、哪些可以安全重试,以及哪些需要补偿操作或人工复核。
11. 让行为可观测且可审计
使用稳定关联 ID 连接请求、模型版本、提示版本、检索来源、工具调用、校验参数、策略判断、审批、错误和最终副作用。
除了监控延迟和可靠性,还必须保存足够证据来解释重要决策。防止普通用户修改审计数据,并通过结构化脱敏减少敏感内容。
12. 检测滥用与运行漂移
对重复拒绝操作、异常导出量、新目的地、权限失败、提示注入模式、工具调用分布变化,以及重试或人工覆盖突然增加进行告警。
持续审查权限漂移、工具 Schema 变化、检索来源变化和模型行为。即使没有代码发布,外部权限或内容变化也可能使系统变得不安全。
13. 提供安全降级
定义模型、检索服务、审批系统、策略引擎或外部 API 不可用时的行为。安全响应可能是只读模式、只生成草稿、升级人工处理或完全停止。
不能因为安全依赖故障而关闭控制。例如审批服务不可用时,Agent 不能把操作视为默认已批准。
14. 建立回滚与控制路径
团队必须能够快速禁用工具、撤销凭证、阻止目的地、隔离租户、回滚提示或模型、暂停记忆并停止排队操作。在事件发生前分配责任人并演练这些动作。
尽量让业务操作可逆。如果操作无法撤销,就应加强执行前的校验和审批。
15. 使用安全回归测试控制发布
维护一套版本化测试集,覆盖提示注入、授权、租户隔离、工具限制、数据外发、审批绑定、重试、日志和历史问题。模型、提示、工具、检索、记忆、策略或界面发生变化后都应运行。
记录发布版本、测试夹具、预期结果、实际结果、例外和责任审查人。生产级流程不能依赖某个人想起来手动尝试几个提示。
上线前的最低证据要求
- 已批准的运行范围和架构图。
- 包含责任人的工具清单与数据流清单。
- 授权和租户隔离测试结果。
- 提示注入和数据外泄测试 Trace。
- 审批界面和 Payload 绑定证据。
- 一次成功、一次拒绝和一次部分失败工作流的审计链。
- 监控告警、回滚流程和事件联系人。
- 与发布版本关联的回归测试结果和残余风险。
如何使用这份清单
把每项标记为已实施、部分实施、缺失或不适用,并要求“已实施”必须附带证据。为每个缺口分配责任人和目标日期。高影响控制缺失时,应限制运行范围,而不是把它留作非正式的未来任务。
生产级并不意味着 Agent 永远不会失败,而是失败受到约束、重要操作受到治理、证据可以获得,并且团队能够发现、控制、解释并持续改进系统。
相关资源
通过 AI Agent 就绪度自测识别优先缺口,或在高影响生产上线前申请一次独立就绪度审计。