语音到语音不再需要语音到文本!
到目前为止,我们的技术栈是 VAD -> STT -> LLM -> TTS。现在它可以直接将音频发送到多模态 LLM:
VAD → MLLM → TTS
没有 STT。模型能理解你的声音。
现在去构建更好的语音代理吧!网页链接

语音到语音不再需要语音到文本!
到目前为止,我们的技术栈是 VAD -> STT -> LLM -> TTS。现在它可以直接将音频发送到多模态 LLM:
VAD → MLLM → TTS
没有 STT。模型能理解你的声音。
现在去构建更好的语音代理吧!网页链接
