vLLM
vLLM 是一个开源推理服务器,可为你运行的模型提供 OpenAI 兼容 API。vLLM 继续提供推理服务,AISIX 则为其添加调用方身份验证、稳定的模型别名、用量报告和流量控制。
准备工作
开始前,请准备以下内容:
- 一套 AISIX 环境:
- 对于 AISIX Cloud,需要一个已关联网关的环境和具有写入作用域的 Admin Token。对于 On-Premises,请按照 AISIX Cloud 快速入门操作。如需申请 Hybrid Cloud 访问权限,请联系 API7。
- 对于开源 AISIX 网关,请准备本地 AISIX 安装,或使用开源 AISIX 网关快速入门中的 Docker 环境。配置网关以加载声明式资源文件。
- 一台已安装 vLLM,并且拥有足够算力和存储空间来运行所选模型的主机。
- AISIX 网关与 vLLM 之间网络连通。
curl和jq。