硕士毕业于英国爱丁堡大学,长期从事生成式 AI 工作,主要研究和应用方向:语音合成、音频大模型、数字人视频生成、语音信号处理、语音识别;致力于将低成本、高可用的生成式 AI 应用于内容创作生态、互联网产品、IOT 等领域。开发的语音交互算法运行于多个汽车车机交互系统、智能家用电器以及互联网产品中;研发了第一代投入有声书生产的跨语言、多情感语音合成系统;并主持研发超拟人和可极速克隆声音的音频大模型,以及可极速克隆形象的数字人大模型。在顶级学术会议上发表多篇论文,发明专利 20 多项。
在当前人工智能快速发展的背景下,文本大模型已经展现出巨大的应用潜力。然而,大模型不会局限于文本的生成,其他模态以及多模态大模型也正在开辟更广阔的想象空间。
本次演讲将以生成式音频大模型为切入点,深入探讨音频以及多模态大模型的构建过程、应用场景及未来展望。我们将首先回顾生成式音频大模型的发展历程,分析其与文本大模型的关系,并详细介绍其能力与构建方法。随后,我们将探讨生成式音频大模型在多模态领域的应用,特别是在音频内容AIGC“产模结合”、音视频内容生成、数字人技术方面的创新应用。最后,我们将展望多模态大模型的未来发展方向,探讨其潜在的突破性应用。
演讲提纲
1. 生成式音频大模型
2. 生成式音频大模型的多模态应用
3. 统一视角下的多模态大模型构建与展望
听众收益



微信咨询

电话咨询
微信联系我们

