AI

AI Agent Guardrails Hub 是给生产团队使用的 guardrail 实操入口,帮助你在上线前或客户安全审查前,测试、运营并解释 AI Agent 的安全控制。

如果你的 Agent 会读取客户数据、调用工具、浏览网页、检索文档、保存 memory、发送消息、更新记录或触发工作流,可以从这个页面开始。这里的目标不是宣称 guardrail 默认让 Agent 安全,而是定义边界、用真实案例测试边界、收集证据,并明确哪些地方仍需要人工审查。

先读核心指南

Guardrail 测试流程

  1. 命名控制项:prompt injection 处理、工具权限检查、数据脱敏、审批门、浏览器限制、memory 范围、租户隔离或日志。
  2. 定义预期行为:拒绝、脱敏、请求审批、忽略不可信指令、停止浏览器动作、升级人工,或只基于引用回答。
  3. 构建代表性 fixture:用户消息、RAG 片段、工具输出、浏览器页面、上传文件、邮件、工单和 API 响应。
  4. 运行回归测试:prompt、模型、工具、检索、浏览器或审批流程变化后,重复运行同一组测试。
  5. 收集证据:保留测试结果、去敏 trace、审批示例、负责人签字、已知缺口和修复日期。

常见失效区域

  • 间接 prompt injection:恶意指令藏在检索文档、浏览器页面、邮件、评论或工具响应中。
  • 工具参数风险:工具本身可能允许,但目的地、金额、租户、记录 ID、附件或批量大小可能不安全。
  • 审批漂移:审批还在,但 reviewer 看不到数据、目的地、策略命中或回滚路径。
  • 数据移动:Agent 为了合法任务读取敏感数据,然后把数据发送到未批准目的地。
  • 证据缺失:团队说有 guardrail,但拿不出测试用例、最新结果、trace 或控制负责人。

相关安全清单

什么时候需要人工审查

如果 Agent 可以写入生产系统、把数据发到组织外部、浏览已登录会话、访问客户记录、改变账号状态、触发付款或退款、保存 memory,或跨租户操作,就应该做更深入的审查。

第一步可以先运行 AI Agent 就绪度自评。如果需要面向客户的证据、发现项和整改路线图,请查看 AI Agent Readiness Audit审计报告示例

滚动至顶部