监控 AI 流量并跟踪大语言模型成本
本指南介绍如何使用内置 AI 日志、APISIX 上下文变量和标准可观测性集成,观察 AI 流量并估算大语言模型成本。
概览
AI 可观测性不同于传统 API 可观测性。对于大语言模型工作负载,需要具备 Token 级可见性、模型归因,以及首 Token 延迟等延迟细分数据。
通过 API7 AI 网关,可以收集:
- 请求和响应模型元数据。
- 提示词和补全 Token 数。
- 端到端及上游耗时信号。
- 可选的请求/响应内容载荷级日志。
网关不会直接计算账单。成本跟踪通过将 Token 用量映射到服务提供方定价得出。