生成式音频大模型的多模态“产模结合”

所属专题:多模态大语言模型的前沿应用与创新

嘉宾 : 叶剑豪 | 喜马拉雅珠峰 AI 算法负责人

会议室 : 钻石厅 C

讲师介绍

专题演讲嘉宾:叶剑豪

喜马拉雅珠峰 AI 算法负责人

硕士毕业于英国爱丁堡大学,长期从事生成式 AI 工作,主要研究和应用方向:语音合成、音频大模型、数字人视频生成、语音信号处理、语音识别;致力于将低成本、高可用的生成式 AI 应用于内容创作生态、互联网产品、IOT 等领域。开发的语音交互算法运行于多个汽车车机交互系统、智能家用电器以及互联网产品中;研发了第一代投入有声书生产的跨语言、多情感语音合成系统;并主持研发超拟人和可极速克隆声音的音频大模型,以及可极速克隆形象的数字人大模型。在顶级学术会议上发表多篇论文,发明专利 20 多项。

议题介绍

演讲:生成式音频大模型的多模态“产模结合”

在当前人工智能快速发展的背景下,文本大模型已经展现出巨大的应用潜力。然而,大模型不会局限于文本的生成,其他模态以及多模态大模型也正在开辟更广阔的想象空间。

本次演讲将以生成式音频大模型为切入点,深入探讨音频以及多模态大模型的构建过程、应用场景及未来展望。我们将首先回顾生成式音频大模型的发展历程,分析其与文本大模型的关系,并详细介绍其能力与构建方法。随后,我们将探讨生成式音频大模型在多模态领域的应用,特别是在音频内容AIGC“产模结合”、音视频内容生成、数字人技术方面的创新应用。最后,我们将展望多模态大模型的未来发展方向,探讨其潜在的突破性应用。

演讲提纲

1. 生成式音频大模型

  • 生成式音频大模型的前世今生
  • 文本大模型和音频大模型的关系
  • 音频大模型能力介绍与构建

2. 生成式音频大模型的多模态应用

  • 音频内容AIGC“产模结合”
  • 多模态与数字人应用

3. 统一视角下的多模态大模型构建与展望

听众收益

  1. 了解生成式音频大模型的前世今生
  2. 理解生成式音频大模型以及多模态大模型的构建过程
  3. 了解到生成式音频大模型在内容生产上的最佳实践以及多模态应用场景结合点

交通指南

上海中谷小南国花园酒店

China Grain Hotel
地址:上海市杨浦区佳木斯路777号(近营口路口)
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手