用量上报
使用 Usage 视图比较各 AISIX 网关环境和模型的请求量、Token 消耗与支出。该视图还汇总组织范围内的语义缓存节省量,可用于调查异常支出或确认用量记录已到达控制面。
用量如何上报
AISIX 网关在你的运行环境中承载 AI 流量,并将用量事件上报到控制面。它会根据控制面 URL 推导遥测端点,并将用量数据发送到固定的 /dp/telemetry 路径。运维人员无需为控制面用量上报单独配置目标。
每个事件可以包含请求状态、延迟、Token 用量和成本。事件还会区分调用方请求的模型别名与实际处理某次尝试的解析模型,这有助于理解路由流量和合议模型流量。流式聊天请求也可以上报首 Token 时间。
当模型服务提供方上报非零 Token 数时,AISIX 会采用该数据。对于流式请求,AISIX 还会要求 OpenAI 兼容上游在最后一个流式数据块中包含用量数据。
Chat Completions、Completions、Messages、Responses 和 Embeddings 端点返回的响应可能会省略部分或全部用量数据。例如,OpenAI 兼容中继从不上报用量、客户端在流式传输中途断开,或上游在返回部分响应后发生错误。此时,AISIX 会使用本地分词器估算缺失或为零的 Token 字段。输入 Token 按发送给上游的请求估算,输出 Token 按传递给调用方的内容估算,同时保留模型服务提供方上报的非零值。
AISIX 会使用估算值发送用量事件,因此请求仍会计入遥测、支出、预算和 Token 限流统计。本地计算的事件会标记为估算值,请求日志视图会在对应行显示 estimated 标记。估算值与 OpenAI 系列模型高度接近;对于使用专有分词器的模型,该值为近似值。估算不会改变返回给调用方的模型服务提供方响应,也不适用于其他端点类型或透传路由。
解读用量
Usage 视图按滚动 30 天窗口汇总各环境中的 AISIX 网关流量,所有总计和表格都使用同一时间窗口。

| 信号 | 可帮助解释的内容 |
|---|---|
| 请求数 | 流量规模和需求变化。 |
| Token 总量 | 服务提供方上报的输入与输出消耗。 |