跳到主要内容

发布说明

本页汇总 AISIX 网关、控制面、控制台和部署包中面向用户的变更,按版本从新到旧排列。

发布产物包括 docker.io/api7/aisix 网关镜像、docker.io/api7/aisix-cp-* 下的控制面镜像、aisix-cp Helm Chart 和离线安装包。

0.6.0

发布日期: 待打标签时确认

此版本将视频生成端点扩展到另外两个模型服务提供方,并为下载时需要服务提供方凭证的场景引入网关流式视频交付。

新功能

视频生成

  • 视频生成端点新增两个模型服务提供方:Runway(runwayml,覆盖 Gen 系列和由 Runway 托管的 Veo)以及 OpenAI Sora(openai)。
  • 内容路由现在使用两种方式交付成品视频。对于返回签名下载 URL 的模型服务提供方,内容路由仍返回 302 重定向,文件会直接从服务提供方存储传输到客户端。OpenAI 要求使用其凭证下载文件,因此网关会使用配置的模型服务提供方密钥获取文件并流式返回,不会将完整文件保存在内存中,也不会向调用方暴露服务提供方凭证。
  • 对于 OpenAI Sora,progress 现在会返回真实完成百分比。不提供百分比的模型服务提供方仍会在任务完成前返回 0,完成后返回 100
  • OpenAI 是唯一具有内置默认 Base URL 的视频模型服务提供方。其他四个服务提供方仍要求在密钥上配置 api_base

0.5.0

发布日期: 2026 年 7 月 24 日

此版本新增统一视频生成端点、向外部系统发送通知的预算阈值告警,以及 Anthropic 模型的自动提示词缓存;同时修复重试、超时、限流和用量核算未覆盖所有请求路径的多个问题。

新功能

视频生成

  • 新增视频生成端点,通过 /v1/videos 接受文生视频任务、轮询状态并返回成品视频,遵循 OpenAI 视频 API 的三阶段形态。当前映射的模型服务提供方包括 Alibaba Cloud Model Studio、Zhipu AI CogVideoX 和 Volcengine Ark Seedance。
  • 视频请求现在会经过与聊天流量相同的网关控制:模型别名、调用方 API Key 访问检查、客户端 IP 白名单、模型级限流和提示词输入安全护栏扫描。此前,视频流量只能通过透传到达模型服务提供方,不会应用这些模型级控制。
  • 网关不存储任务状态。返回的视频 ID 携带路由信息,因此状态和下载调用可由任意网关实例处理。
  • 视频提交以零 Token 记录在用量日志中。此版本尚未应用按时长计费,因此视频流量不会消耗预算。

安全护栏

  • 新增 Alibaba Cloud AI Guardrails 类型,调用 MultiModalGuard 服务并执行其建议判定。当服务返回脱敏内容时,网关会将脱敏文本写回请求,而不是直接拒绝。
  • 网关记录 aisix_guardrail_latency_seconds,这是按每次执行统计的延迟直方图,可将安全护栏开销与上游模型延迟区分开。参见指标
  • Alibaba 安全护栏服务的响应会保留其上游请求 ID,网关会将该 ID 与自身请求 ID 关联,便于跨系统排查。

预算和告警

  • 预算阈值告警会在支出达到预算配置百分比时通知外部系统。通知渠道支持通用 Webhook 和 Slack。
  • 控制台预算页面现在可以在同一位置管理所有作用域的预算,预算也已纳入 AISIX Cloud Admin API 契约。

提示词缓存

  • 模型可以启用自动提示词缓存,由网关向符合条件的请求插入 Anthropic 缓存断点。调用方无需修改客户端代码即可获得提示词缓存折扣,也可以在控制台中按模型配置此选项。

用量上报

  • 当上游未返回用量块时,网关现在会在本地估算 Token 数,而不再记录为零。估算记录会在用量上报和控制台日志页面标记,因此可与模型服务提供方报告的用量区分。
  • aisix_llm_tokens_by_client_total 指标新增 model 标签,并开始为 Responses 端点记录。
  • 内置客户端类型检测覆盖更多编程 Agent,运维人员也可为网关无法识别的客户端添加 User-Agent 映射规则。

部署

  • 新增 aisix export 命令,可从正在运行的 etcd 存储导出 resources.yaml,作为现有部署切换到独立模式时的初始配置。
  • 对于使用声明式配置且不希望暴露写入 API 的部署,可通过 admin.enabled 设置禁用 Admin 监听器。
  • 状态监听器会报告每个模型的运行时健康状况,无需发送模型请求即可检查上游可达性。
  • 网关会在心跳中报告已应用配置的哈希值,控制面公共规范会公开网关节点和被拒绝资源,从而确认哪些网关已经应用配置变更。参见配置传播

改进

  • 模型服务提供方密钥的上游 Secret 现在可以原地轮换,无需重新创建密钥或重新关联使用它的模型。
  • 控制台模型服务提供方选择器支持搜索,并使用正确的显示名称列出服务提供方。
  • 控制台日志页面会显示完整上游错误消息,不再截断;上游筛选器也不再提供不属于上游的模型组。
  • 日志查询窗口会遵循组织的用量保留设置,不再使用固定范围。
  • 控制面会报告请求被拒绝的原因,而不是返回通用失败。
  • Admin API 写入路径已弃用,推荐使用声明式配置。此版本中它仍可使用。参见 Admin API 参考

修复

  • retries 设置现在适用于流式聊天请求;此前独立的流式代码路径不会重试。
  • 对 Azure 模型,stream_timeout 现在按文档限制分块间隔,不再限制整个响应,因此耗时较长但健康的流不会被提前截断。
  • 连接失败会报告底层传输原因,而不是通用上游错误;连接层也开始应用显式限制,不再依赖库默认值。
  • 调用方提供的 cache_control 标记在 OpenAI 到 Anthropic 的桥接过程中会保留,因此使用 OpenAI 客户端访问 Anthropic 模型时仍能获得提示词缓存折扣。
  • 合议成员和评审模型子调用会在后端未报告用量时进行估算,避免合议请求少报 Token。
  • 透传隧道会执行请求正文中指定模型的限流。
  • 组分发会应用每个路由目标自身的模型限流和客户端 IP 白名单,而不再只检查组入口。
  • 每次尝试的错误消息不再截断到 256 个字符,使上游故障在日志中保持可读。
  • 将凭证交换为短期 Token 的服务提供方,其已签发 Token 缓存会按完整凭证建立键,因此密钥轮换会立即生效,无需等待旧 Token 过期。
  • 控制台 Pod 会挂载可写缓存目录,修复 Helm 部署中图片请求可能无限挂起的问题。
  • Playground 只接受控制台会话,个人访问 Token 无法再通过它消耗模型服务提供方配额。

0.4.0

发布日期: 2026 年 7 月 16 日

此版本引入基于角色的访问控制、自定义角色和环境范围内的管理权限,增加基于状态码的路由故障转移,并通过延迟直方图和更丰富的失败诊断扩展可观测性。

新功能

访问控制

  • 组织可以定义自定义角色,按资源类型授予细粒度 readwrite 权限,替代固定的所有者、管理员和成员划分。
  • 环境范围内的访问权限允许成员管理单个环境,而不授予组织范围内的权限。
  • SCIM 组到角色映射会根据身份服务提供方的组成员身份自动分配角色。
  • 控制面对每个 Admin API 请求执行这些权限检查。

路由

  • fallback_on_statuses 可将选定的上游 HTTP 状态码纳入重试和故障转移,使 408409 等服务提供方特定的临时状态码尝试其余目标,而不是直接返回调用方。

可观测性

  • 分桶的首 Token 时间和端到端延迟直方图支持为服务级目标计算 p90p99 等延迟分位数。详见指标
  • 网关会在 Chat、Messages 和 Responses 端点的失败请求中采集请求体,并通过保留结构的截断限制大型载荷。
  • 新的 /status/config 端点会报告已加载的可观测性配置,网关也会发出配置指标。

部署

  • 独立模式可以从 resources.yaml 加载资源,使网关无需控制面或 etcd 即可运行。

改进

  • AISIX Cloud Admin API 现在暴露缓存策略、可观测性导出器和限流。
  • 控制台可以为定价目录中没有的模型设置价格覆盖项,使其用量仍能计费。
  • API Key 和限流列表支持分页与搜索。
  • 安全护栏配置错误现在会记录服务提供方的错误响应体,便于排查问题。
  • 阿里云内容安全护栏表单会显示 output_fail_open 选项。

修复

  • 监控模式的输出安全护栏不再延迟或关闭流式响应。
  • aisix_deployment_state 指标现在根据目标的服务状态派生。
  • SCIM POST /Users 会返回持久化后的身份,而不是回显身份服务提供方的载荷。

0.3.1

发布日期: 2026 年 7 月 9 日

此维护版本增加 SCIM 目录同步,并改进可观测性、核算、自托管 Playground 访问和控制面可靠性。

新功能

  • SCIM 2.0 目录同步可以通过新的 /scim/v2 端点,从 Okta、Microsoft Entra ID 等任意 SCIM 2.0 身份服务提供方自动预配和取消预配组织成员。

改进

  • 网关构建现在会在 Server 响应头、aisix --version 输出和控制台显示的数据面版本中报告发布版本,不再报告静态构建版本。
  • 按客户端统计的 Token 指标现在包含计入缓存的 total 序列。当前指标目录请参见指标
  • 健康状态变化时会发出部署冷却指标。
  • 安全护栏管理 API 现已加入 AISIX Cloud Admin API 契约。

修复

  • 每个代理响应现在都包含 x-aisix-request-id 响应头,用于关联日志和用量事件。
  • Anthropic 提示词缓存 Token 现在会计入原生 /v1/messages/v1/responses 端点的 Token 限流
  • 单个格式错误的遥测事件不再阻止同一用量批次中的其它事件投递。
  • 启用 AISIX_PLAYGROUND_ALLOW_PRIVATE_IPS 后,自托管控制台 Playground 可以访问私有或内部 LLM 端点。
  • 登录现在接受部署自身的 Origin 和对应的回环 Origin,并为限流或不受信任 Origin 的尝试返回更明确的消息。
  • 成员列表分页不再在视图加载后很快跳回第一页。
  • 控制面重启不再产生无害的重复约束错误日志。

0.3.0

发布日期: 2026 年 7 月 9 日

此版本引入 MCP 网关和 Agent 网关,扩展代理 API 与安全护栏目录,并增加基于指标的路由。

新功能

MCP 网关

  • 新的聚合 /mcp 端点使用一个 AISIX 调用方 API Key 代理多个上游 MCP 服务器。
  • 上游 MCP 服务器成为一等资源,支持在控制面和控制台中注册、完整 CRUD、启用或禁用以及配置上游超时。
  • 工具访问控制将每个调用方 API Key 限定到指定 MCP 工具。
  • 上游认证支持 API Key 和 OAuth 2.0 客户端凭证。
  • MCP 工具调用与模型流量使用相同的限流、预算以及输入和输出安全护栏,同时发出用量事件和访问日志。

Agent 网关

  • 新的 Agent 网关代理由控制面和控制台管理、作用域为组织的 A2A Agent。
  • allowed_agents 字段将每个调用方 API Key 限定到指定 Agent。

API

安全护栏

路由

  • 多目标模型支持最低成本、最低延迟和最低负载目标选择。
  • 条件路由可按标签或元数据选择目标,通配符别名可路由 provider/* 等模型名称。
  • 粘性加权路由支持 A/B 测试和灰度发布。

流量控制与 API Key

  • 调用方 API Key 生命周期控制可以设置过期时间、禁用 Key,或通过单次操作完成轮换。
  • 集群限流可以使用共享 Redis 存储,并在现有每分钟(rpm)和每天(rpd)限制之外增加每秒(rps)和每小时(rph)请求限制。

可观测性

  • 请求和响应内容采集现在覆盖 Embeddings、Rerank、Images 和 Audio。

控制台

  • 可以在控制台中管理 MCP 服务器,并在限流、预算和安全护栏视图中配置 MCP 治理。
  • 可以按组织配置用量日志保留时间。

改进

  • 容器镜像以非 root 用户运行,并通过 CAP_NET_BIND_SERVICE 文件能力绑定端口 80443
  • 控制台提供统一、可筛选的模型视图,并在创建模型时使用单一模型类型选择器。
  • 路由目标可通过拖动重新排序,最低成本目标会显示每个目标的成本标记。
  • 成员和团队列表支持分页。

修复

  • 缓存和限流 Key 按环境划分作用域,共享 Redis 存储不会混合不同环境的状态。
  • 透传端点现在会为成功和失败请求发出用量事件,并归因到调用方 API Key。