Leo Xiang 0 关注者 关注 2个月前 端到端音频模型 和 三段式(asr/llm/tts) 语音技术栈本质的区别是:端到端方案本身有更完备的上下文。 如果提供更多的上下文给到asr 和 tts,理论上可以做到更好,上限更高以及更灵活。 前往原网页查看