语音 Agent 平台
语音应用由多个对延迟敏感的环节组成:音频传输、语音识别、轮次检测、语言模型推理、工具执行和语音合成。语音 Agent 平台负责协调这些环节,使应用能够通过网页、应用程序或电话进行实时对话。
语言模型只是这一运行时的一部分,但它通常也是组织需要集中治理的环节。当语音平台支持兼容 OpenAI 的 LLM 端点时,其文本模型请求可以通过 AISIX 完成调用方身份认证、模型别名解析、路由、策略应用和遥测记录。团队因此可以在 AISIX 中管理模型访问,而无需替换负责提供语音体验的平台。
语音应用或托管平台仍负责媒体会话,并在调用 AISIX 前将语音转换为对话内容。它会把这些内容和所有工具定义发送到网关。AISIX 随后验证调用方身份、解析模型别名、应用已配置的策略、记录遥测数据,并将请求分发给选定的模型服务提供方。
选择平台指南
所有指南都使用相同的 AISIX 值,但各平台提供这些值的方式不同:
| 平台 | 集成接口 | 指南 |
|---|---|---|
| ElevenLabs Agents | 托管的 Custom LLM 配置 | ElevenLabs Agents |
| LiveKit Agents | Python OpenAI LLM 插件 | LiveKit Agents |
| Pipecat | Python OpenAILLMService | Pipecat |
| Vapi | 托管的 custom-llm 模型配置 | Vapi |
ElevenLabs Agents 和 Vapi 托管语音运行时。LiveKit Agents 和 Pipecat 是应用框架,因此应用还需要配置传输、语音转文本服务、文本转语音服务和轮次检测。
准备 AISIX
每个平台都需要以下面向网关的值:
- 平台或应用能够访问的 AISIX HTTPS 代理 URL。
- 专用于语音应用的 AISIX 调用方 API Key。
- 调用方 Key 可以通过
POST /v1/chat/completions访问的模型别名。
如果组织中已经部署 AISIX,请向管理该部署的团队获取这些值。否则,请完成开源 AISIX 网关快速入门或 AISIX Cloud 快速入门,或联系 API7申请混合云访问权限。
调用方 Key 应仅获准访问语音应用需要的别名。根据预期对话量配置请求和 Token 限制,并为临时评估设置过期时间。
了解边界
AISIX 在语音平台把语音转换为对话内容后接收模型请求。因此,AISIX 不会取代平台的音频传输、语音识别、语音合成、音色选择、打断处理或电话服务。
网关 Guardrails 可以检查 Chat Completions 路径上受支持的请求和响应文本,但不能检查仍留在语音平台内的音频。有关端点和内容的准确覆盖范围,请参阅 Guardrails 行为,并分别检查各平台的录音、对话文本、保留和区域处理设置。
语音应用通常以流式方式接收模型响应,使语音合成可以在完整答案生成前开始。请确认模型别名支持 Chat Completions 流式传输,并在测量响应 延迟时考虑语音运行时、AISIX 网关和模型服务提供方之间的网络距离。
验证集成
使用一段简短对话确认完整链路:
- 语音平台接受一条语音或文本测试消息。
- AISIX 为预期的调用方 Key 和模型别名记录
POST /v1/chat/completions。 - 平台收到流式模型文本,并以音频或文本形式返回给用户。
首次成功后,请测试打断行为以及应用依赖的所有函数工具。工具调用要求选定的上游模型和平台集成都能保留兼容 OpenAI 的工具调用流。
后续步骤
- 兼容 OpenAI 的 API:查看面向网关的请求格式。
- 流式传输:了解流的传输和故障转移边界。
- 工具调用:验证工具定义和流式工具调用。
- API Key 和模型限流:限制语音应用流量。