用量上报
使用 Usage 视图比较各 AISIX 网关环境和模型的请求量、Token 消耗与支出。该视图还汇总组织范围内的语义缓存节省量,可用于调查异常支出或确认用量记录已到达控制面。
用量如何上报
AISIX 网关在你的运行环境中承载 AI 流量,并将用量事件上报到控制面。它会根据控制面 URL 推导遥测端点,并将用量数据发送到固定的 /dp/telemetry 路径。运维人员无需为控制面用量上报单独配置目标。
每个事件可以包含请求状态、延迟、Token 用量和成本。事件还会区分调用方请求的模型别名与实际处理某次尝试的解析模型,这有助于理解路由流量和合议模型流量。流式聊天请求也可以上报首 Token 时间。
当模型服务提供方上报非零 Token 数时,AISIX 会采用该数据。对于流式请求,AISIX 还会要求 OpenAI 兼容上游在最后一个流式数据块中包含用量数据。
Chat Completions、Completions、Messages、Responses 和 Embeddings 端点返回的响应可能会省略部分或全部用量数据。例如,OpenAI 兼容中继从不上报用量、客户端在流式传输中途断开,或上游在返回部分响应后发生错误。此时,AISIX 会使用本地分词器估算缺失或为零的 Token 字段。输入 Token 按发送给上游的请求估算,输出 Token 按传递给调用方的内容估算,同时保留模型服务提供方上报的非零值。
AISIX 会使用估算值发送用量事件,因此请求仍会计入遥测、支出、预算和 Token 限流统计。本地计算的事件会标记为估算值,请求日志视图会在对应行显示 estimated 标记。估算值与 OpenAI 系列模型高度接近;对于使用专有分词器的模型,该值为近似值。估算不会改变返回给调用方的模型服务提供方响应,也不适用于其他端点类型或模型服务提供方透传。
解读用量
Usage 视图按滚动 30 天窗口汇总各环境中的 AISIX 网关流量,所有总计和表格都使用同一时间窗口。

| 信号 | 可帮助解释的内容 |
|---|---|
| 请求数 | 流量规模和需求变化。 |
| Token 总量 | 服务提供方上报的输入与输出消耗。 |
| 支出 | 根据 Token 数和匹配的模型价格计算的成本。 |
| 缓存节省 | 语义缓存命中避免的上游输入和输出 Token 消耗。 |
| 按环境统计的用量 | 哪个部署环境产生了流量和支出。 |
| 热门模型 | 按支出排序的前 10 个环境与调用方请求模型别名组合;缺少请求模型值的旧记录回退到解析后的模型。 |
| 热门 API Key | 按支出排序的前 10 个环境与调用方 API Key 组合。 |
服务提供方响应上报 Token 数时,系统会显示该数据;否则由网关在本地估算(参见用量如何上报)。支出还需要与事件的 (provider, model name) 匹配的价格。Usage 会把支出四舍五入到两位小数,因此即使存在匹配价格,低流量也可能显示 $0.00。
使用模型定价添加或检查价格,并在请求日志中以六位小数检查事件或尝试成本。价格变更只影响变更后记录的事件。
用量与预算执行
控制面使用 AISIX 网关用量记录评估预算。每个预算都定义作用范围、支出上限、周期和执行模式。
滚动 30 天的 Usage 窗口与预算所配置的周期彼此独立,因此两者的总额可能覆盖不同时间范围。
当硬停止预算被超出时,AISIX 网关可以对匹配的请求返回 HTTP 429。仅告警预算会显示预算超支状态,但不会阻断流量。
如果预算拒绝不符合预期,请检查返回的预算作用域、配置上限,以及决定团队或成员预算适用范围的调用方 API Key 绑定。完整执行路径请参见预算。
排查缺失或异常用量
按以下顺序检查上报路径:
- 确认请求经过连接到预期环境的 AISIX 网关。同一组织中经过其他环境的流量会显示在对应环境下;其他组织中的流量会显示在该组织自己的 Usage 视图中。
- 确认请求已完成并出现在 Request Logs 中。网关会批量刷新遥测,新完成的请求可能需要几秒才会出现。
- 确认 AISIX 网关有最新心跳。
- 确认网关能够访问控制面遥测端点。
- 如果出现 Token 数但没有支出,请检查 Model Pricing 是否与模型服务提供方和模型名称精确匹配。
在控制面短暂失联期间,实时流量可以继续使用最近投射的配置。失联期间发送失败的遥测批次会被丢弃而不会重试,因此连接恢复后相关记录仍可能缺失;新记录会在连接恢复后继续上报。导出器健康、心跳和新的预算决策也依赖控制面连接。预算检查可暂时复用缓存决策,之后再应用配置的失败模式;详见可用性与缓存。