vLLM
vLLM 是一个开源推理服务器,可为你运行的模型提供 OpenAI 和 Anthropic 兼容 API。vLLM 继续提供推理服务,AISIX 则为其添加调用方身份认证、稳定的模型别名、用量报告和流量控制。
准备工作
开始前,请准备以下内容:
- 一套 AISIX 环境:
- 对于 AISIX Cloud,需要一个已关联网关的环境和具有写入作用域的 Admin Token。对于 On-Premises,请按照 AISIX Cloud 快速入门操作。如需申请 Hybrid Cloud 访问权限,请联系 API7。
- 对于开源 AISIX 网关,请准备本地 AISIX 安装,或使用开源 AISIX 网关快速入门中的 Docker 环境。配置网关以加载声明式资源文件。
- 一台已安 装 vLLM 0.10.0 或更高版本,并且拥有足够算力和存储空间来运行所选模型的主机。该版本开始提供本指南使用的原生 Responses 路由。
- AISIX 网关与 vLLM 之间网络连通。
curl和jq。
准备推理服务器
启动官方示例模型,并启用 API Key 检查:
vllm serve NousResearch/Meta-Llama-3-8B-Instruct \
--dtype auto \
--api-key token-abc123
导出上游密钥,以及可从 AISIX 网关访问的 API 根地址:
export VLLM_API_KEY="token-abc123"
export VLLM_API_BASE="http://vllm.internal:8000/v1"
请将 vllm.internal 替换为可解析的主机名或服务名称。如果使用 Docker Desktop 且 vLLM 位于主机上,通常可使用 http://host.docker.internal:8000/v1。如果两个服务共享 Docker 或 Kubernetes 网络,请使用 vLLM 服务的 DNS 名称。
警告
vLLM 文档说明,--api-key 保护的是其 OpenAI 兼容 API 路由,而不是服务器可能公开的所有端点。请将 vLLM 服务保留在私有网络中;如果管理或诊断路由需要保护,请应用网络策略或带身份验证的反向代理。