本专题将通过深入探讨多模态大语言模型的核心优势与实际应用案例,介绍多模态技术如何... 展开 >





博⼠毕业于中国科学院声学研究所,有 20 年语⾳处理、⾃然语⾔处理和机器学习的相关⼯作经验。现任蔚来座舱⼈⼯智能研发负责⼈。历任腾讯搜索部⻔语⾳研究员,负责语⾳搜索研发⼯作;任微软 STC 语⾳科学家,负责基于分布式计算平台的超⼤规模语⾳识别模型训练系统,语⾳助⼿ Cortana 研发⼯作;任阿⾥巴巴资深算法专家,是达摩院语⾳实验室创始团队成员,负责阿⾥巴巴⾃然对话系统 NUI 核⼼算法研发、平台化、产品化和商业化的⼯作,负责各 AIoT 各种场景下的落地:包括汽⻋、电视领域、⼿机 App 领域(⾼德 /⼿机淘宝 /⽀付宝)等的落地。
本专题将通过深入探讨多模态大语言模型的核心优势与实际应用案例,介绍多模态技术如何通过处理和融合多种数据类型,推动行业创新,优化业务解决方案,并加速实际业务场景中的落地与实践。聚焦多模态大语言模型在电商、营销、设计、视频创作、动画制作、和文本分析等领域的应用。
Aquila-VL-2B 是 2B 级别 SOTA 的多模态模型。该模型基于 Llava-onevision 的训练思路,引入多分辨率来提升对图像内容的理解。在本次分享中,主要介绍了模型数据集的构建和处理过程,包括多种数据来源数据的格式统一以及数据选择,针对弱项的数据合成等。此外,还讨论了对训练效率和框架的提升,在 FlagScale 框架上实现了相对 Deepspeed 训练效率 1.7 倍的提升。Aquila-VL-2B 的创新之处在于系统化的构建了多模态模型的数据,训练以及评测的 pipline。
演讲提纲:
听众收益:
多模态内容资产,包括以“视频、图像”为主要形态的商业传播内容与广告等,不仅是中国品牌的宝贵资产,也是其出海传播,讲述品牌故事、输出情感文化的载体。这些内容能否被全球消费者们所正确理解,是企业亟待解决的问题。
一方面,中国品牌成功出海,需要理解品牌内容在不同文化背景下所产生的情感反应,并采用全球消费者可以接受的方式,讲述中国品牌和中国故事。
另一方面,中华文化走向世界,也需要借助国际受众易于理解的方式,对外讲述和传播我们的文化精髓。
要实现上述的目标,中国品牌已经开始应用生成式人工智能 (GenAI) 技术,构建面向全球的多模态内容的生产能力,但由于目前 AI 在解读人类的主观情感方面有较大空白,在全球化的传播应用中,仍面临着现实中的技术挑战。最基础的问题是缺少中国品牌全球化的“内容资产数据集”。
目前缺乏这方面的研究,没有可以进行评测的基础,大多数现有的基准都存在几个缺点:1)模态数量有限,题目多为选择题,难以测量逻辑推理过程;2)视频中的内容和场景过于单调,仅涉及对视频内容的客观描述;3)对于视频的理解停留在客观层面,无法量化评估人在观看视频时的主观感受。
为了弥合与实际应用的差距,明略科技引入大规模的视频主观多模态评估数据集 Video-SME。通过收集不同人群在观看相同视频内容时脑电图 (EEG) 和眼动追踪区域的真实变化,设立了新的任务和协议,分析和评估不同受试者对相同视频内容的认知理解程度。
技术层面上,目前国内外对于 AI 的研究大多停留在解析客观事物的层面,比如解析视频中的人物、场景、故事情节等,但是缺乏有效的手段让 AI 理解人的主观感受,比如年轻人观看某段视频时会产生何种情绪,老年人观看某段视频时是否能够准确理解内容,不同国家用户观看某段视频时是否能够理解文化含义等。让 AI 理解和模拟人类的主观感受,是 AI 产生自我意识的开端,是通用人工智能(AGI)重要的组成部分。在该领域投入科研力量,探索能够让 AI 感知到人类主观感受的有效手段,有机会实现对于国外 AI 技术的弯道超车。
依托于新的评测标准,明略科技创新研发了超图多模态大语言模型 (HMLLM) ,探索不同人口统计、视频元素、脑电图和眼动追踪指标之间的关联。HMLLM 可以弥合丰富模态之间的语义差距,并集成帧与帧之间的信息以执行逻辑推理,我们在 Video-SME 和其他基于视频的生成性能基准上设计了实验,大量实验评估证明了该方法的有效性。
演讲提纲:
听众收益:
在过去的一年里,多模态大模型因其广泛的潜在应用而受到了前所未有的关注。此次演讲旨在概述当前多模态模型的发展状况,遇到的问题和挑战,并通过具体案例深入探讨该领域的最新进展。将结合团队近期的两个工作——CityLLava(2024CVPR AI city challenge Track 2 winner)与IVTP(ECCV2024),来详细介绍行业多模态模型的迭代范式及其训练与推理过程中的加速优化技术。希望通过本次分享,能够为参会者提供一个多模态大模型领域的全面视角,激发更多关于未来发展方向和技术革新的思考。
更多详细内容可参考:
演讲提纲:
听众收益:
从2023年6月开始,蔚来座舱智能化团队开始研发面向智能座舱应用场景的多模态大模型的技术预研工作,经过1年多的系统搭建、数据集构建和训练部署方案的实践,取得了一些技术进展和一定的多模态大模型的应用认知。分享包括对于车载场景的算法适配的训练流程、数据采集筛选和清洗方法、多分辨率以及多VIT encoder的模型改进方法、端侧部署的具体实践情况。同时作为多模态模型的一部分也会简要介绍在语音大模型方面的一些最新进展。本次分享主要涉及多模态大模型技术落地车载场景的业务实践和技术挑战。
演讲提纲:
听众收益:



微信咨询

电话咨询
领取往期热门演讲视频

