本次专场将聚焦 LLM 在多模态领域的应用和创新,探讨如何将 LLM 与图像、音... 展开 >




自然语言处理和人工智能领域的专家和创业者。本科毕业于南京大学电子系,硕士在荷兰格罗宁根大学(自然语言处理和统计学)和德国萨尔兰德大学(计算语言学),并于美国约翰霍普金斯大学取得博士学位,主要致力于机器学习领域的自然语言处理和语音技术研究。论文在自然语言理解和机器学习的顶级会议上多次发表。曾创立了语音唤醒和自然语言交互公司 KITT.AI,致力于语音唤醒和自然语音交互技术的研究开发,公司曾被 CBInsights 评选为首届 AI 100公司,并获得微软联合创始人保罗·阿兰旗下的阿兰人工智能研究所、亚马逊 Alexa 基金等投资。
本次专场将聚焦 LLM 在多模态领域的应用和创新,探讨如何将 LLM 与图像、音频、视频等多媒体数据融合,实现更智能、更自然的交互体验。本次专场将分为以下几个模块:
本次演讲主要介绍可图大模型基座研发的关键技术创新,分享大模型时代的开源价值,剖析娱乐场景与商业化场景视觉生成模型落地差异,探索图像生成与视频生成的能力联动方式。
演讲提纲
听众收益
在当前人工智能快速发展的背景下,文本大模型已经展现出巨大的应用潜力。然而,大模型不会局限于文本的生成,其他模态以及多模态大模型也正在开辟更广阔的想象空间。
本次演讲将以生成式音频大模型为切入点,深入探讨音频以及多模态大模型的构建过程、应用场景及未来展望。我们将首先回顾生成式音频大模型的发展历程,分析其与文本大模型的关系,并详细介绍其能力与构建方法。随后,我们将探讨生成式音频大模型在多模态领域的应用,特别是在音频内容AIGC“产模结合”、音视频内容生成、数字人技术方面的创新应用。最后,我们将展望多模态大模型的未来发展方向,探讨其潜在的突破性应用。
演讲提纲
1. 生成式音频大模型
2. 生成式音频大模型的多模态应用
3. 统一视角下的多模态大模型构建与展望
听众收益
随着大模型的不断发展,所有通用智能问题都在走向“端到端”,高质量的闭环数据成为了核心。过去的数据采集方式都存在各种各样的瓶颈,世界模型是未来通用智能最重要的闭环数据来源。本次演讲主要介绍极佳科技在世界模型和闭环模拟器方面的技术研发和进展。
演讲提纲
1. 从视频生成到世界模型,相关领域发展现状;
2. 世界模型为中心,打造新一代闭环数据引擎;
3. 通过世界模型,推动端到端自动驾驶和具身智能的发展;
4. 总结和展望
听众收益
1. 了解视频生成和世界模型的最新进展;
2. 了解世界模型的应用场景;
3. 了解世界模型未来发展趋势。
随着大语言模型的兴起,多模态大模型也取得了显著进步,推动了复杂的视觉语言对话和交互,弥合了文本与视觉信息之间的鸿沟。然而,现有的开源模型与商用闭源模型(如GPT-4o和Gemini 1.5 Pro)之间的能力差距仍然显著。本报告将探讨图文多模态大模型的基本原理和技术,探索如何利用开源套件构建强大的多模态大模型,研究如何通过渐进式策略扩展开源多模态模型的性能边界,以缩小开源模型与商业闭源模型在多模态理解方面的能力差距。
演讲提纲
1. 大语言模型&多模态大模型的研究现状:大语言模型和多模态大模型的发展现状介绍以及代表性工作的介绍与分析。
2. 视觉基础模型在大模型时代的角色:讨论在大模型时代视觉基础模型的作用及未来可能的发展方向。
3. 基于开源套件的强多模态大模型实现:以 InternVL 2 为例,探讨如何通过纯开源模型逐步实现媲美 GPT-4o 的强通用图文问答、文档理解、多学科理解等能力。
听众收益
1. 了解多模态大模型的最新进展;
2. 了解多模态大模型的应用场景;
3. 了解多模态大模型的未来发展趋势。



微信咨询

电话咨询
微信联系我们

