选择安全护栏服务提供方
安全护栏可在请求到达上游模型之前、模型返回响应之后,或在两个钩子点执行内容策略。选择安全护栏时,需要考虑可以在何处评估内容、必须检测什么,以及是否应阻止或脱敏匹配内容。
配置服务提供方前,请阅读安全护栏行为,以选择钩子点、执行方式、作用范围和失败策略。然后按照服务提供方的配置指南,配置凭证、检测规则和验证请求。
服务提供方比较
使用下表确定安全护栏在何处评估内容,以及是否支持策略所需的操作:
| 类型 | 服务提供方 | 评估位置 | 检测内容 | 操作 |
|---|---|---|---|---|
keyword | 内置 | AISIX 内部 | 字面量和正则表达式模式 | 阻止 |
pii | 内置 | AISIX 内部 | 基于规则的 PII,例如电子邮件地址、电话号码、ID、卡号、密钥和自定义模式 | 脱敏或阻止 |
presidio | Microsoft Presidio | 自托管 Presidio 服务 | 基于规则和 NER/ML 的 PII 实体,例如 PERSON 和 LOCATION | 使用替换、脱敏、哈希或编辑操作符进行脱敏;或阻止 |
lakera | Lakera Guard | Lakera API | 提示词注入、越狱、不安全内容和 PII | 阻止;仅检测到 PII 时脱敏 |
azure_content_safety | Azure AI Content Safety | Azure API | 通过 Prompt Shield 检测提示词注入和越狱 | 阻止 |
azure_content_safety_text_moderation | Azure AI Content Safety | Azure API | 仇恨、性、自残和暴力严重性类别,以及阻止列表 | 阻止 |
openai_moderation | OpenAI Moderation | OpenAI API | 骚扰、仇恨、暴力、性、自残和其他内容类别 | 阻止 |
bedrock | AWS Bedrock Guardrails | AWS Bedrock 服务 | 内容过滤器、禁止主题、敏感信息和字词过滤器 | 阻止;对配置了 ANONYMIZE 的 PII 进行脱敏 |
aliyun_text_moderation | Alibaba Cloud Content Moderation | 阿里云 API | 基于风险等级的内容审核 | 阻断 |
aliyun_ai_guardrail | Alibaba Cloud AI Guardrails | 阿里云 API | 由控制台策略管理的组合检查:内容合规、提示词攻击和敏感数据 | 阻断;根据控制台策略对敏感数据脱敏 |
表中每个安全护栏都可以检查调用方请求、模型响应或两者。安全护栏行为说明了它们共用的钩子点、执行模式、作用范围、流式行为、失败处理和调用方响应。
根据目标选择安全护栏
缩小可用服务提供方范围后,将策略目标与实际起点匹配:
| 目标 | 优先考虑 | 其他选项 |
|---|---|---|
| 检测或脱敏 PII | 内置 PII,它在 AISIX 内部运行,并支持基于规则的检测器和自定义模式。 | 使用 Presidio 检测姓名、位置或国籍等正则表达式无法表示的实体。Presidio 还支持自托管评估以及哈希或占位符替换。如果已使用 AWS Bedrock 或 Lakera,也可以考虑它们。 |
| 检测提示词注入和越狱 | Lakera Guard 或 Azure Prompt Shield。 | 当安全审查要求使用独立服务提供方时,可同时附加两者。两者都能检查对话中检索文档或工具结果所携带的间接注入。 |
| 审核内容类别 | 使用 OpenAI Moderation 检查其标准类别集。 | 使用 Azure Text Moderation 配置按类别的严重性阈值和服务端阻止列表;在阿里云生态中,可使用 AI Guardrails 配置由控制台管理、支持敏感数据脱敏的组合策略,或使用 Content Moderation 配置 AISIX 侧风险阈值。 |
| 执行组织自定义规则 | 内置关键字安全护栏。 | 无需外部依赖即可匹配字面量或正则表达式模式。 |
基于检测的安全护栏可能产生误报和漏报,因此在生产流量上强制执行新策略前,请先使用监控模式进行评估。请参阅安全护栏行为。
网关记录的内容
不同端点的安全护栏遥测数据不同。在受支持的场景中,用量记录会标识已应用的 安全护栏、监控模式观测结果、阻止决策和远程失败开放绕过原因。并非每个端点都会填充所有字段。
用量记录和调用方可见的错误响应不会包含匹配的请求或响应体。对于内置关键字阻止,操作员日志可能包含匹配的字面量或正则表达式规则。各服务提供方指南展示了对应安全护栏类型的脱敏 Token 和阻止响应格式。
后续步骤
阅读安全护栏行为,然后在比较表中打开所选服务提供方的配置指南。