请求生命周期
AISIX 位于应用和 AI 服务提供方之间。应用携带调用方凭证和模型别名向代理 API 发送请求,AISIX 会据此执行访问控制、解析上游目标、应用 AI 流量策略,并记录请求过程中发生的事件。
每个请求都会经历以下阶段:
调用方认证
每个代理请求都会提供调用方 API Key,或由已配置的 OIDC 提供方签发的 JWT。对于明文 Key,AISIX 会通过其哈希值查找;对于 JWT,AISIX 会验证签发者、签名和必需 Claim,再将外部身份映射到与之绑定的调用方 API Key。
完成身份认证后,两条路径都会使用解析出的调用方 API Key 作为授权身份。该 Key 控制调用方可以使用哪些模型别名以及应用哪些流量控制,因此应用团队不需要直接持有服务提供方凭证。明文网关凭证请参阅调用方 API Key,外部身份提供商凭证请参阅 JWT 身份认证。
模型解析
请求中的 model 值是面向调用方的别名。AISIX 会将该别名解析为以下四种分发形态之一:
- 直接模型:通过一个服务提供方凭证指向一个上游模型。当语义路由器使用直接模型进行相似度比较时,该模型还可以包含向量嵌入元数据。
- 路由模型:允许 AISIX 通过故障转移、加权轮询、一致性哈希、成本、延迟或负载选择一个目标模型。
- 语义模型:通过比较请求文本和配置的路由示例选择目标模型。
- 合议模型:将聊天请求发送给多个合议成员,并使用评审模型综合生成最终响应。
一个模型资源只能配置一种分发形态。有关完整资源关系,请参阅模型和服务提供方。
请求控制
AISIX 可以在请求到达服务提供方之前将其停止。输入安全护栏可以检查并拒绝不安全内容,AISIX Cloud 部署可以执行请求预算,调用方 API Key 和模型别名也可以携带限流策略。响应缓存可以在调用上游前直接返回已保存的聊天补全结果。如需按阶段了解各项控制的作用位置,请参阅流量控制中的请求链路图。
服务提供方转发
请求被允许后,AISIX 会 使用运维人员配置的服务提供方密钥和适配器,将请求调度到选中的服务提供方。应用可以保持面向网关的 API 形态,而由 AISIX 处理服务提供方凭证、上游模型名称、base URL 和服务提供方专属请求行为。
响应处理
服务提供方响应会经由 AISIX 返回。输出安全护栏可以在响应到达调用方之前检查生成文本。调用方通过身份认证且请求解析完成后,无论请求成功还是失败,AISIX 都会记录用量和遥测。运维人员可以查看请求别名、解析后的模型、服务提供方尝试、Token 用量、延迟和错误。
部署边界
对于开源 AISIX 网关,运维人员可以在 resources.yaml 文件中声明网关资源。使用 AISIX Cloud 时,控制面负责资源管理,并将已接受的配置投射到 AISIX 网关。从调用方视角看,代理请求生命周期保持一致:应用调用代理 API,AISIX 应用已配置的模型访问、路由、控制策略和可观测性行为。