使用基于 Token 的限流控制 AI 成本
本指南介绍如何使用 ai-rate-limiting 插件对大语言模型流量实施基于 Token 的限流,包括按路由和模型实例设置 Token 预算。
概览
传统的基于请求的限流不足以治理大语言模型流量:根据提示词和响应的不同,单个请求可能消耗 10 到 100,000 个 Token。基于 Token 的限流根据实际 Token 消耗分配预算,从而控制成本。
前置条件
-
安装 Docker。
-
安装 cURL,用于发送请求并验证服务。
-
拥有一个正在运行的 API7 网关实例。
-
从控制台获取令牌,并保存到环境变量:
export API_KEY=your-dashboard-token # 请替换为你的控制台令牌 -
将
{gateway_group_id}替换为网关组 ID。如果正在按照快速入门操作,请使用default。 -
如果使用 Admin API 示例,请创建或复用一个服务。如果尚无服务,请按照创建或复用服务操作,然后保存其 ID:
export SERVICE_ID=your-service-id # 请替换为你的服务 ID