跳到主要内容
版本:1.2.0

语音 Agent 平台

语音应用由多个对延迟敏感的环节组成:音频传输、语音识别、轮次检测、语言模型推理、工具执行和语音合成。语音 Agent 平台负责协调这些环节,使应用能够通过网页、应用程序或电话进行实时对话。

语言模型只是这一运行时的一部分,但它通常也是组织需要集中治理的环节。当语音平台支持兼容 OpenAI 的 LLM 端点时,其文本模型请求可以通过 AISIX 完成调用方身份认证、模型别名解析、路由、策略应用和遥测记录。团队因此可以在 AISIX 中管理模型访问,而无需替换负责提供语音体验的平台。

语音应用或托管平台仍负责媒体会话,并在调用 AISIX 前将语音转换为对话内容。它会把这些内容和所有工具定义发送到网关。AISIX 随后验证调用方身份、解析模型别名、应用已配置的策略、记录遥测数据,并将请求分发给选定的模型服务提供方。

选择平台指南

所有指南都使用相同的 AISIX 值,但各平台提供这些值的方式不同:

平台集成接口指南
ElevenLabs Agents托管的 Custom LLM 配置ElevenLabs Agents
LiveKit AgentsPython OpenAI LLM 插件LiveKit Agents
PipecatPython OpenAILLMServicePipecat
Vapi托管的 custom-llm 模型配置Vapi

ElevenLabs Agents 和 Vapi 托管语音运行时。LiveKit Agents 和 Pipecat 是应用框架,因此应用还需要配置传输、语音转文本服务、文本转语音服务和轮次检测。

准备 AISIX

每个平台都需要以下面向网关的值:

  • 平台或应用能够访问的 AISIX HTTPS 代理 URL。
  • 专用于语音应用的 AISIX 调用方 API Key。
  • 调用方 Key 可以通过 POST /v1/chat/completions 访问的模型别名。

如果组织中已经部署 AISIX,请向管理该部署的团队获取这些值。否则,请完成开源 AISIX 网关快速入门AISIX Cloud 快速入门,或联系 API7申请混合云访问权限。

调用方 Key 应仅获准访问语音应用需要的别名。根据预期对话量配置请求和 Token 限制,并为临时评估设置过期时间。

了解边界

AISIX 在语音平台把语音转换为对话内容后接收模型请求。因此,AISIX 不会取代平台的音频传输、语音识别、语音合成、音色选择、打断处理或电话服务。

网关安全护栏可以检查 Chat Completions 路径上受支持的请求和响应文本,但不能检查仍留在语音平台内的音频。有关端点和内容的准确覆盖范围,请参阅 安全护栏行为,并分别检查各平台的录音、对话文本、保留和区域处理设置。

语音应用通常以流式方式接收模型响应,使语音合成可以在完整答案生成前开始。请确认模型别名支持 Chat Completions 流式传输,并在测量响应延迟时考虑语音运行时、AISIX 网关和模型服务提供方之间的网络距离。

验证集成

使用一段简短对话确认完整链路:

  1. 语音平台接受一条语音或文本测试消息。
  2. AISIX 为预期的调用方 Key 和模型别名记录 POST /v1/chat/completions
  3. 平台收到流式模型文本,并以音频或文本形式返回给用户。

首次成功后,请测试打断行为以及应用依赖的所有函数工具。工具调用要求选定的上游模型和平台集成都能保留兼容 OpenAI 的工具调用流。

选择上方的平台指南进行配置。以下指南介绍各集成共用的网关行为: