专题演讲嘉宾:赵波

上海交通大学人工智能学院 副教授

国家级青年人才。曾担任智源研究院数据智能研究中心负责人。博士毕业于英国爱丁堡大学。主要研究方向包括多模态大模型,具身智能,数据智能等。曾提出系列有影响力的数据蒸馏与合成算法。推出的多模态大模型 Bunny 已被下载数十万次。发表包括 ICLR Oral, NeurIPS Spotlight, CVPR Highlight 等数十篇顶会顶刊论文。曾获得 ICML 2022 杰出论文奖。担任 NeurIPS’24、BMVC’24 领域主席。

by 赵波

上海交通大学
人工智能学院 副教授

近年来,多模态大模型技术发展迅速,展现出强大的视觉理解能力。其中基于大模型的长视频理解任务受到了越来越多的关注,其在教育、影视、安防等领域具有广泛的应用前景。然后由于大语言模型的有效上下文长度有限,难以用有限的 GPU 计算资源实现长视频理解。

针对这一研究问题,课题组首先推出了面向长视频理解大模型的测评基准:MLVU,提供了丰富的评测任务,揭示了主流大模型在长视频理解任务上的能力缺陷。针对长视频数据 Token 数量过多的问题,课题组提出利用可学习 Token 来自适应地压缩视频 Token,从而实现单张卡处理 1 小时以上视频的能力。

演讲提纲:

  1. 基于大模型的长视频理解任务与挑战
  2. 主流的视频理解模型与能力测评
  3. 基于可学习 Token 的视频 Token 压缩技术
    • 可学习的压缩 Token 
    • 自适应切片算法
    • 训练数据扩增方法
  4. 应用实例分析
  5. 总结与展望

听众收益:

  • 了解最新的长视频理解大模型性能和局限性
  • 了解最新的长视频理解大模型 Token 压缩技术

交通指南

上海中优城市万豪酒店

Shanghai Marriott Hotel Pudong South
地址:上海市浦东新区沪南公路7688弄1号
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手