语音 Agent 平台
语音应用由多个对延迟敏感的环节组成:音频传输、语音识别、轮次检测、语言模型推理、工具执行和语音合成。语音 Agent 平台负责协调这些环节,使应用能够通过网页、应用程序或电话进行实时对话。
语言模型只是这一运行时的一部分,但它通常也是组织需要集中治理的环节。当语音平台支持兼容 OpenAI 的 LLM 端点时,其文本模型请求可以通过 AISIX 完成调用方身份认证、模型别名解析、路由、策略应用和遥测记录。团队因此可以在 AISIX 中管理模型访问,而无需替换负责提供语音体验的平台。
语音应用或托管平台仍负责媒体会话,并在调用 AISIX 前将语音转换为对话内容。它会把这些内容和所有工具定义发送到网关。AISIX 随后验证调用方身份、解析模型别名、应用已配置的策略、记录遥测数据,并将请求分发给选定的模型服务提供方。
选择平台指南
所有指南都使用相同的 AISIX 值,但各平台提供这些值的方式不同:
| 平台 | 集成接口 | 指南 |
|---|---|---|
| ElevenLabs Agents | 托管的 Custom LLM 配置 | ElevenLabs Agents |
| LiveKit Agents | Python OpenAI LLM 插件 | LiveKit Agents |
| Pipecat | Python OpenAILLMService | Pipecat |
| Vapi | 托管的 custom-llm 模型配置 | Vapi |
ElevenLabs Agents 和 Vapi 托管语音运行时。LiveKit Agents 和 Pipecat 是应用框架,因此应用还需要配置传输、语音转文本服务、文本转语音服务和轮次检测。
准备 AISIX
每个平台都需要以下面向网关的值:
- 平台或应用能够访问的 AISIX HTTPS 代理 URL。
- 专用于语音应用的 AISIX 调用方 API Key。
- 调用方 Key 可以通过
POST /v1/chat/completions访问的模型别名。
如果组织中已经部署 AISIX,请向管理该部署的团队获取这些值。否则,请完成开源 AISIX 网关快速入门或 AISIX Cloud 快速入门,或联系 API7申请混合云访问权限。
调用方 Key 应仅获准访问语音应用需要的别名。根据预期对话量配置请求和 Token 限制,并为临时评估设置过期时间。
了解边界
AISIX 在语音平台把语音转换为对话内容后接收模型请求。因此,AISIX 不会取代平台的音频传输、语音识别、语音合成、音色选择、打断处理或电话服务。
网关安全护栏可以检查 Chat Completions 路径上受支持的请求和响应文本,但不能检查仍留在语音平台内的音频。有关端点和内容的准确覆盖范围,请参阅 安全护栏行为,并分别检查各平台的录音、对话文本、保留和区域处理设置。
语音应用通常以流式方式接收模型响应,使语音合成可以在完整答案生成前开始。请确认模型别名支持 Chat Completions 流式传输,并在测量响应延迟时考虑语音运行时、AISIX 网关和模型服务提供方之间的网络距离。
验证集成
使用一段简短对话确认完整链路:
- 语音平台接受一条语音或文本测试消息。
- AISIX 为预期的调用方 Key 和模型别名记录
POST /v1/chat/completions。 - 平台收到流式模型文本,并以音频或文本形式返回给用户。
首次成功后,请测试打断行为以及应用依赖的所有函数工具。工具调用要求选定的上游模型和平台集成都能保留兼容 OpenAI 的工具调用流。
相关指南
选择上方的平台指南进行配置。以下指南介绍各集成共用的网关行为:
- 兼容 OpenAI 的 API:查看面向网关的请求格式。
- 流式传输:了解流的传输和故障转移边界。
- 工具调用:验证工具定义和流式工具调用。
- API Key 和模型限流:限制语音应用流量。