书生万象大模型的技术演进与应用探索

所属专题:多模态大语言模型的前沿应用与创新

嘉宾 : 王文海 | 上海人工智能实验室青年科学家

会议室 : 钻石厅 C

讲师介绍

专题演讲嘉宾:王文海

上海人工智能实验室青年科学家

王文海,南京大学博士,香港中文大学博士后,上海人工智能实验室青年科学家,研究方向为视觉基础模型研究,上海人工智能实验室“书生”系列视觉基础模型核心开发者。主要成果发表在顶级期刊和会议TPAMI、CVPR、ICCV、ECCV、ICLR、NeurIPS等共43篇论文,其中19篇为一作/共一/通信。研究成果获得了总共超2万次引用,单篇最高引用紧4000次。研究成果分别入选CVPR 2023最佳论文,世界人工智能大会青年优秀论文奖,CVMJ 2022最佳论文提名奖,两次入选ESI高被引论文(前1%)和热点论文(前0.1%),6次入选Paper Digest CVPR、ICCV、NeurIPS、ECCV年度十大最具影响力论文,一次入选Zeta Alpha 2022年百篇最高引AI论文。入选斯坦福大学2023年度全球前2%顶尖科学家,世界人工智能大会云帆奖,CSIG优博提名。担任CSIG VI编委,IJCAI 2021的高级程序委员会委员,以及TPAMI、IJCV、CVPR、ICCV、ECCV等多个顶级国际会议/期刊的程序委员会委员/审稿人。

议题介绍

演讲:书生万象大模型的技术演进与应用探索

随着大语言模型的兴起,多模态大模型也取得了显著进步,推动了复杂的视觉语言对话和交互,弥合了文本与视觉信息之间的鸿沟。然而,现有的开源模型与商用闭源模型(如GPT-4o和Gemini 1.5 Pro)之间的能力差距仍然显著。本报告将探讨图文多模态大模型的基本原理和技术,探索如何利用开源套件构建强大的多模态大模型,研究如何通过渐进式策略扩展开源多模态模型的性能边界,以缩小开源模型与商业闭源模型在多模态理解方面的能力差距。

演讲提纲

1. 大语言模型&多模态大模型的研究现状:大语言模型和多模态大模型的发展现状介绍以及代表性工作的介绍与分析。

2. 视觉基础模型在大模型时代的角色:讨论在大模型时代视觉基础模型的作用及未来可能的发展方向。

3. 基于开源套件的强多模态大模型实现:以 InternVL 2 为例,探讨如何通过纯开源模型逐步实现媲美 GPT-4o 的强通用图文问答、文档理解、多学科理解等能力。

听众收益

1. 了解多模态大模型的最新进展;

2. 了解多模态大模型的应用场景;

3. 了解多模态大模型的未来发展趋势。

交通指南

上海中谷小南国花园酒店

China Grain Hotel
地址:上海市杨浦区佳木斯路777号(近营口路口)
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手