专题演讲嘉宾:赵晨旭

明略科技多模态大模型部门负责人

在 CVPR,ICCV,AAAI,TPAMI,KBS,ACMMM,TIFS,IJCV 等国际顶级会议和期刊上发表论文 20 余篇,他引数千。荣获 ACMMM24 Best paper nomination award,并获得过 CVPR2020 第二届国际活体检测竞赛多模态冠军和单模态亚军,曾包揽 CVPR2020 人脸领域全部 Oral 论文。担任国家发改委,国家科技部等多项重大国家项目课题负责人。

by 赵晨旭

明略科技
多模态大模型部门负责人

多模态内容资产,包括以“视频、图像”为主要形态的商业传播内容与广告等,不仅是中国品牌的宝贵资产,也是其出海传播,讲述品牌故事、输出情感文化的载体。这些内容能否被全球消费者们所正确理解,是企业亟待解决的问题。

一方面,中国品牌成功出海,需要理解品牌内容在不同文化背景下所产生的情感反应,并采用全球消费者可以接受的方式,讲述中国品牌和中国故事。

另一方面,中华文化走向世界,也需要借助国际受众易于理解的方式,对外讲述和传播我们的文化精髓。

要实现上述的目标,中国品牌已经开始应用生成式人工智能 (GenAI) 技术,构建面向全球的多模态内容的生产能力,但由于目前 AI 在解读人类的主观情感方面有较大空白,在全球化的传播应用中,仍面临着现实中的技术挑战。最基础的问题是缺少中国品牌全球化的“内容资产数据集”。

目前缺乏这方面的研究,没有可以进行评测的基础,大多数现有的基准都存在几个缺点:1)模态数量有限,题目多为选择题,难以测量逻辑推理过程;2)视频中的内容和场景过于单调,仅涉及对视频内容的客观描述;3)对于视频的理解停留在客观层面,无法量化评估人在观看视频时的主观感受。

为了弥合与实际应用的差距,明略科技引入大规模的视频主观多模态评估数据集 Video-SME。通过收集不同人群在观看相同视频内容时脑电图 (EEG) 和眼动追踪区域的真实变化,设立了新的任务和协议,分析和评估不同受试者对相同视频内容的认知理解程度。

技术层面上,目前国内外对于 AI 的研究大多停留在解析客观事物的层面,比如解析视频中的人物、场景、故事情节等,但是缺乏有效的手段让 AI 理解人的主观感受,比如年轻人观看某段视频时会产生何种情绪,老年人观看某段视频时是否能够准确理解内容,不同国家用户观看某段视频时是否能够理解文化含义等。让 AI 理解和模拟人类的主观感受,是 AI 产生自我意识的开端,是通用人工智能(AGI)重要的组成部分。在该领域投入科研力量,探索能够让 AI 感知到人类主观感受的有效手段,有机会实现对于国外 AI 技术的弯道超车。

依托于新的评测标准,明略科技创新研发了超图多模态大语言模型 (HMLLM) ,探索不同人口统计、视频元素、脑电图和眼动追踪指标之间的关联。HMLLM 可以弥合丰富模态之间的语义差距,并集成帧与帧之间的信息以执行逻辑推理,我们在 Video-SME 和其他基于视频的生成性能基准上设计了实验,大量实验评估证明了该方法的有效性。

演讲提纲:

  1. 无论有多少亿个参数,大语言模型都无法具有主观感知能力
    • 什么是主观感知能力
    • 机器模拟人的主观感受有什么意义
  2. Video Subjective Multi-modal Evaluation Benchmark(Video-SME)
    • 现有公开多模态视频评测标准的局限性
    • 真实采集人的脑电、眼动模态
    • 数据集构建与评测标准制定
  3. 超图多模态大模型
    • 超越Foundation Model
    • 超图多模态大模型构建
  4. 评测主观指标
    • Video-SME实验结果
    • Video-MME实验结果
    • 其他多模态与情感类数据集实验结果
  5. 机器模拟人类主观感受的应用
    • 实际应用效果展示
    • 未来工作介绍

听众收益:

  • 走进多模态视频理解全新的未知领域
  • 探索机器具备主观感受的全新课题

交通指南

北京丰大国际大酒店

Beijing Fengda International Hotel
地址:北京市大兴区荣华中路20号
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手