DC娱乐网

语音到语音不再需要语音到文本!到目前为止,我们的技术栈是 VAD -> STT

语音到语音不再需要语音到文本!

到目前为止,我们的技术栈是 VAD -> STT -> LLM -> TTS。现在它可以直接将音频发送到多模态 LLM:

VAD → MLLM → TTS

没有 STT。模型能理解你的声音。

现在去构建更好的语音代理吧!网页链接