Voice Engine – OpenAI公布的AI语音合成和声音克隆模型

AI工具资讯2年前 (2024)发布 SUYEONE

11.4K 0 0

Voice Engine是什么

Voice Engine是OpenAI最新公布的一项AI语音合成和声音克隆技术，能够利用简短的15秒音频样本和文本输入，生成接近原声的自然听起来的语音。该项技术自2022年底开发以来，已经被应用于OpenAI的文本到语音API和ChatGPT的语音功能中。Voice Engine的应用前景广泛，包括为儿童和非读者提供阅读辅助、翻译内容以触及全球听众、支持非言语交流者、帮助恢复患者的声音等。同时，为确保技术的安全使用，OpenAI制定了严格的使用政策，防止声音冒充，并采取了包括水印追踪在内的多项安全措施。

官方博客介绍：https://openai.com/blog/navigating-the-challenges-and-opportunities-of-synthetic-voices

Voice Engine的应用场景和案例

教育与阅读辅助：Voice Engine可以为儿童和非读者提供自然听起来的语音，帮助他们更好地接触和理解书面内容。例如，教育技术公司Age of Learning利用这一技术生成预设脚本的语音内容，并与GPT-4结合，创造实时、个性化的互动响应，以提高学生的学习体验。
内容翻译与全球化：通过Voice Engine，视频和播客等内容可以被翻译成听众的母语，同时保留原始说话者的口音，使得创作者和企业能够以更加地道和亲切的方式触及全球听众。例如，AI视觉叙事平台HeyGen使用Voice Engine进行视频翻译，使其内容能够跨越语言障碍，触及更广泛的受众。
改善偏远地区的服务提供：Voice Engine能够通过提供本地语言的服务，改善偏远社区的基本服务，如健康咨询等。Dimagi公司正在开发工具，使用Voice Engine和GPT-4为社区卫生工作者提供互动反馈，帮助他们提高技能。
支持言语残障人士：对于有交流障碍的个体，Voice Engine可以提供独特且非机械性的声音，使他们能够通过增强和替代通讯（AAC）设备进行交流。Livox公司就是利用这一技术，为其用户提供多种语言的自然听起来的声音，让他们能够更好地表达自己。
恢复患者的声音：对于那些因疾病或神经问题而失去语言能力的患者，Voice Engine可以帮助他们恢复或重建自己的声音。例如，Norman Prince Neurosciences Institute正在探索如何使用Voice Engine帮助因肿瘤或神经原因导致语言障碍的个体。