自己想做一个产品,跟这个紧密相关。
早在 23 年 GPT 刚发布的时候,我用它当时的 Whisper 模型尝试过,基础体验很差(很明显,当时的技术还不成熟)。
现在我体验豆包、跟 GPT 的实时语音聊天,感觉已经非常好了:语气、延时、对用户打断的判断、实时的智能输出。
我跟 GPT 最新大模型聊了大概几天,最后的方案简单描述就是:
- 客户端收集录音并上传至语音模型服务,获取文字解析结果(输入内容可能是模糊或复杂的,所以需要语言模型识别,而不是单纯的语音转文字)。
- 将文字结果加上特定上下文,发送给语言模型,获取回答。
- 将回答发送给语音模型获取音频,并播放给用户。
这种方案会有很多细节需要注意,例如延时、用户打断、意图判断、上下文管理等。
延时也会很高,所以想请教:还有其他方向吗?