rangoBen
V2EX  ›  问与答

好奇想了解豆包、GPT 语音实时对话是如何做的,体验上除了智能外,其他因素还蛮多的。

  •  
  •   rangoBen · 1 day ago · 431 views

    自己想做一个产品,跟这个紧密相关。

    早在 23 年 GPT 刚发布的时候,我用它当时的 Whisper 模型尝试过,基础体验很差(很明显,当时的技术还不成熟)。

    现在我体验豆包、跟 GPT 的实时语音聊天,感觉已经非常好了:语气、延时、对用户打断的判断、实时的智能输出。

    我跟 GPT 最新大模型聊了大概几天,最后的方案简单描述就是:

    1. 客户端收集录音并上传至语音模型服务,获取文字解析结果(输入内容可能是模糊或复杂的,所以需要语言模型识别,而不是单纯的语音转文字)。
    2. 将文字结果加上特定上下文,发送给语言模型,获取回答。
    3. 将回答发送给语音模型获取音频,并播放给用户。

    这种方案会有很多细节需要注意,例如延时、用户打断、意图判断、上下文管理等。

    延时也会很高,所以想请教:还有其他方向吗?

    No Comments Yet
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   5564 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 29ms · UTC 01:51 · PVG 09:51 · LAX 18:51 · JFK 21:51
    ♥ Do have faith in what you're doing.