选择安全护栏服务提供方
安全护栏可在请求到达上游模型之前、模型返回响应之后,或在两个钩子点执行内容策略。选择安全护栏时,需要考虑可以在何处评估内容、必须检测什么,以及是否应阻止或脱敏匹配内容。
AISIX Cloud 和开源 AISIX 网关提供相同的网关安全护栏,两者判定作用范围的方式也一致:由 Attachment 把安全护栏绑定到环境或选定资源,没有任何 Attachment 的安全护栏不检查任何流量。AISIX Cloud 在你选定范围时写入 Attachment;资源文件则在 guardrail_attachments 集合中声明。
配置服务提供方前,请阅读安全护栏行为,以选择钩子点、执行方式、作用范围和失败策略。然后使用服务提供方指南了解其配置字段、检测规则和验证请求。内置关键词和 PII 指南为两种产品提供完整步骤。
服务提供方比较
使用下表确定安全护栏在何处评估内容,以及是否支持策略所需的操作:
| 类型 | 服务提供方 | 评估位置 | 检测内容 | 操作 |
|---|---|---|---|---|
keyword | 内置 | AISIX 内部 | 字面量和正则表达式模式 | 阻止 |
semantic | 内置 | AISIX 在本地比较向量嵌入;所选文本会发送到配置的 embedding 模型端点 | 与示例语义相近的文本,包括不含相同关键词的改写表达 | 阻止 |
pii | 内置 | AISIX 内部 | 基于规则的 PII,例如电子邮件地址、电话号码、ID、卡号、密钥和自定义模式 | 脱敏或阻止 |
presidio | Presidio | 自托管 Presidio 服务 | 基于规则和 NER/ML 的 PII 实体,例如 PERSON 和 LOCATION | 使用 replace(替换)、mask(掩码)、hash(哈希)或 redact(移除)操作符进行脱敏;或阻止 |
lakera | Lakera Guard | Lakera API | 提示词注入、越狱、不安全内容和 PII | 阻止;仅检测到 PII 时脱敏 |
azure_content_safety | Azure AI Content Safety | Azure API | 通过 Prompt Shield 检测提示词注入和越狱 | 阻止 |
azure_content_safety_text_moderation | Azure AI Content Safety | Azure API | 仇恨、性、自残和暴力严重性类别,以及阻止列表 | 阻止 |
openai_moderation | OpenAI Moderation | OpenAI API | 骚扰、仇恨、暴力、性、自残和其他内容类别 | 阻止 |
bedrock | AWS Bedrock Guardrails | AWS Bedrock 服务 | 内容过滤器、禁止主题、敏感信息和字词过滤器 | 阻止;对配置了 ANONYMIZE 的 PII 进行脱敏 |
aliyun_text_moderation | Alibaba Cloud Content Moderation | 阿里云 API | 基于风险等级的内容审核 | 阻断 |
aliyun_ai_guardrail | Alibaba Cloud AI Guardrails | 阿里云 API | 由控制台策略管理的组合检查:内容合规、提示词攻击和敏感数据 | 阻断;根据控制台策略对敏感数据脱敏 |
custom | 你自己的脚本 | 在你的网关内部,访问脚本指定的任何服务 | 由你实现的任意逻辑,用于 AISIX 尚未内置集成的检查服务 | 由脚本决定阻断或脱敏 |
表中每个安全护栏都可以检查调用方请求、模型响应或两者。安全护栏行为说明了它们共用的钩子点、执行模式、作用范围、流式行为、失败处理和调用方响应。
根据目标选择安全护栏
缩小可用服务提供方范围后,将策略目标与实际起点匹配:
| 目标 | 优先考虑 | 其他选项 |
|---|---|---|
| 检测或脱敏 PII | 内置 PII,它在 AISIX 内部运行,并支持基于规则的检测器和自定义模式。 | 使用 Presidio 检测姓名、位置或国籍等正则表达式无法表示的实体。Presidio 还支持自托管评估以及哈希或占位符替换。如果已使用 AWS Bedrock 或 Lakera,也可以考虑它们。 |
| 检测提示词注入和越狱 | Lakera Guard 或 Azure Prompt Shield。 | 当安全审查要求使用独立服务提供方时,可同时附加两者。两者都能检查对话中检索文档或工具结果所携带的间接注入。 |
| 审核内容类别 | 使用 OpenAI Moderation 检查其标准类别集。 | 使用 Azure Text Moderation 配置按类别的严重性阈值和服务端阻止列表;在阿里云生态中,可使用 AI Guardrails 配置由控制台管理、支持敏感数据脱敏的组合策略,或使用 Content Moderation 配置 AISIX 侧风险阈值。 |
| 执行组织自定义规则 | 内置关键字安全护栏。 | 无需外部依赖即可匹配字面量或正则表达式模式。 |
| 捕获为绕过模式列表而改写的尝试 | 内置语义筛查安全护栏。 | 按语义而非措辞匹配;一个钩子的候选文本会通过一次批量 embedding 请求发送。 |
| 对接 AISIX 尚未集成的检查服务 | 自定义脚本安全护栏。 | 把转换逻辑写成网关运行的脚本,而不是在自有服务前再部署一个适配器。参见 Qwen3Guard 安全护栏,其中给出了使用自建开源安全检查模型的完整示例。 |
基于检测的安全护栏可能产生误报和漏报,因此在生产流量上强制执行新策略前,请先使用监控模式进行评估。请参阅安全护栏行为。
网关记录的内容
用量记录会标识已应用的安全护栏、监控模式观测结果、阻断决策以及开放式失败的绕过原因。所有路由的用量事件都会携带绕过原因,其余安全护栏证据则因端点而异。参见绕过原因。
调用方可见的错误响应不会包含匹配的请求或响应体。包含当前遥测行为的网关所创建的用量记录中,安全护栏专属字段不会复制匹配内容,也不会复制脚本提供的原因和计数。如果遥测导出器配置了 content_mode: full,输入侧安全护栏阻断请求时,导出器仍可能捕获请求正文;请把该目的地视为包含内容的数据源并加以保护。AISIX Cloud 会原样存储安全护栏用量详情,因此由旧版网关创建的记录可能保留从请求内容或密钥派生的脚本值;升级不会改写这些记录。请相应限制对旧版用量数据的访问。对于内置关键字阻止,操作员日志可能包含匹配的字面量或正则表达式规则。 各服务提供方指南展示了对应安全护栏类型的脱敏 Token 和阻止响应格式。
后续步骤
阅读安全护栏行为,然后在比较表中打开所选服务提供方的配置指南。