跳到主要内容

选择安全护栏服务提供方

安全护栏可在请求到达上游模型之前、模型返回响应之后,或在两个钩子点执行内容策略。选择安全护栏时,需要考虑可以在何处评估内容、必须检测什么,以及是否应阻止或脱敏匹配内容。

配置服务提供方前,请阅读安全护栏行为,以选择钩子点、执行方式、作用范围和失败策略。然后按照服务提供方的配置指南,配置凭证、检测规则和验证请求。

服务提供方比较

使用下表确定安全护栏在何处评估内容,以及是否支持策略所需的操作:

类型服务提供方评估位置检测内容操作
keyword内置AISIX 内部字面量和正则表达式模式阻止
pii内置AISIX 内部基于规则的 PII,例如电子邮件地址、电话号码、ID、卡号、密钥和自定义模式脱敏或阻止
presidioMicrosoft Presidio自托管 Presidio 服务基于规则和 NER/ML 的 PII 实体,例如 PERSONLOCATION使用替换、脱敏、哈希或编辑操作符进行脱敏;或阻止
lakeraLakera GuardLakera API提示词注入、越狱、不安全内容和 PII阻止;仅检测到 PII 时脱敏
azure_content_safetyAzure AI Content SafetyAzure API通过 Prompt Shield 检测提示词注入和越狱阻止
azure_content_safety_text_moderationAzure AI Content SafetyAzure API仇恨、性、自残和暴力严重性类别,以及阻止列表阻止
openai_moderationOpenAI ModerationOpenAI API骚扰、仇恨、暴力、性、自残和其他内容类别阻止
bedrockAWS Bedrock GuardrailsAWS Bedrock 服务内容过滤器、禁止主题、敏感信息和字词过滤器阻止;对配置了 ANONYMIZE 的 PII 进行脱敏
aliyun_text_moderationAlibaba Cloud Content Moderation阿里云 API基于风险等级的内容审核阻断
aliyun_ai_guardrailAlibaba Cloud AI Guardrails阿里云 API由控制台策略管理的组合检查:内容合规、提示词攻击和敏感数据阻断;根据控制台策略对敏感数据脱敏

表中每个安全护栏都可以检查调用方请求、模型响应或两者。安全护栏行为说明了它们共用的钩子点、执行模式、作用范围、流式行为、失败处理和调用方响应。

根据目标选择安全护栏

缩小可用服务提供方范围后,将策略目标与实际起点匹配:

目标优先考虑其他选项
检测或脱敏 PII内置 PII,它在 AISIX 内部运行,并支持基于规则的检测器和自定义模式。使用 Presidio 检测姓名、位置或国籍等正则表达式无法表示的实体。Presidio 还支持自托管评估以及哈希或占位符替换。如果已使用 AWS Bedrock 或 Lakera,也可以考虑它们。
检测提示词注入和越狱Lakera Guard 或 Azure Prompt Shield。当安全审查要求使用独立服务提供方时,可同时附加两者。两者都能检查对话中检索文档或工具结果所携带的间接注入。
审核内容类别使用 OpenAI Moderation 检查其标准类别集。使用 Azure Text Moderation 配置按类别的严重性阈值和服务端阻止列表;在阿里云生态中,可使用 AI Guardrails 配置由控制台管理、支持敏感数据脱敏的组合策略,或使用 Content Moderation 配置 AISIX 侧风险阈值。
执行组织自定义规则内置关键字安全护栏。无需外部依赖即可匹配字面量或正则表达式模式。

基于检测的安全护栏可能产生误报和漏报,因此在生产流量上强制执行新策略前,请先使用监控模式进行评估。请参阅安全护栏行为

网关记录的内容

不同端点的安全护栏遥测数据不同。在受支持的场景中,用量记录会标识已应用的安全护栏、监控模式观测结果、阻止决策和远程失败开放绕过原因。并非每个端点都会填充所有字段。

用量记录和调用方可见的错误响应不会包含匹配的请求或响应体。对于内置关键字阻止,操作员日志可能包含匹配的字面量或正则表达式规则。各服务提供方指南展示了对应安全护栏类型的脱敏 Token 和阻止响应格式。

后续步骤

阅读安全护栏行为,然后在比较表中打开所选服务提供方的配置指南。