DC娱乐网

LiveKit Agents:搭建实时语音 Agent 项目地址:实时语音 Ag

LiveKit Agents:搭建实时语音 Agent
项目地址:实时语音 Agent 要同时处理音频传输、说话检测、语音识别、大模型、语音合成、打断和任务调度。
LiveKit Agents 的功能是将这些环节放进一个 Python 框架,客户端只负责采集和播放音视频。
会话结构框架有四个主要对象:
Agent:指令、工具和对话行为;AgentSession:一名用户的一次会话;entrypoint:新会话进入时执行的函数;AgentServer:接收任务并启动会话。媒体传输使用 LiveKit 的 WebRTC 服务器。模型层可以混用不同供应商,例如 Deepgram 做 STT、GPT 做 LLM、Cartesia 做 TTS。也可以使用 LiveKit Inference 进行统一调用。
运行安装常用插件:
pip install "livekit-agents[openai,deepgram,cartesia]"可以先用终端模式验证,不需要部署 LiveKit 服务器:
python myagent.py console接入服务器后有三个运行方式:
python myagent.py console 本地音频测试python myagent.py dev 连接服务器,支持热重载python myagent.py start 生产运行AgentSession 通过 vad、stt、llm、tts 参数选择模型。工具函数用 @function_tool 声明。接入 Cloud 或自托管服务器时,需要配置 LIVEKIT_URL、LIVEKIT_API_KEY 和 LIVEKIT_API_SECRET。
实时机制项目提供语义轮次检测,用 transformer 判断用户是否说完,减少 Agent 抢话。它也支持 MCP 工具、SIP 电话、RPC、结构化数据传输、会话内 Agent 交接和视频虚拟形象。
内置测试框架可以检查事件顺序,比如下一步是否调用函数。回复内容带有不确定性时,还能用 LLM judge 判断意图是否符合要求。延迟主要受到模型、地区和服务器影响。
除了 console,其他模式都需要 LiveKit Cloud 或自托管服务器。STT、LLM 和 TTS 可能来自不同供应商,会产生多份费用和数据处理条款。
语义轮次检测模型使用单独的 LiveKit Model License,虚拟形象也依赖 Tavus、Bithuman。
这套框架比较适合电话客服、预约、实时语音助手和音视频互动。普通文字问答用常规 Web 服务更简单,没有必要引入 WebRTC 和媒体调度。
来源