多模态大模型技术与应用

会议室:万豪宴会厅 2
出品人:孟二利

本专题将深入解析多模态大模型的技术核心,探讨其如何高效处理文本、图像、音频等多种... 展开 >

专题出品人:孟二利

小米AI 实验室机器学习团队技术主管

先后在百度、小米担任技术主管,曾带领团队获得百度最高奖,和业务部门合作获得小米百万美金技术大奖。在搜索推荐、自然语言处理、多模态等人工智能领域有十年以上研发经验及管理经验,致力于将人工智能技术赋能至智能营销、汽车制造和新零售等小米核心业务中,提升小米核心业务运营、研发效率。

地点:万豪宴会厅 2

专题:多模态大模型技术与应用

本专题将深入解析多模态大模型的技术核心,探讨其如何高效处理文本、图像、音频等多种数据类型,并挖掘其在人工智能领域的独特价值。此外,我们会通过多个行业案例,如医疗诊断、教育辅助、金融分析等,展示这些模型在实际工作中的应用和成效。

by 王育军

小米
语音技术负责人

声音是人与人,人与自然交互的重要模态之一。对声音的理解和生成贯穿这个交互的过程,也是从声音种提炼信息并还原和展现成新信息的过程,可以用声音模态的编码和解码来表述。编解码范式已经是大模型时代的 Magic Word。这个范式已经造就了成功的各种语音应用案例,比如 OpenAI 或者字节的语音合成,OpenAI 和 Meta 的大模型语音识别,以及小米和 Meta 的声音理解。

这些应用需要不同层面和不同粒度的声音编解码。在编解码两端都需要模态内部更强的自我解释能力。为此,我们一直坚持探索声音基础模型的建设,来关注声音的自我解释能力,从而助力语音识别,语音合成以及声音的还原或降噪。

演讲提纲:

  1. 小米的声音基础模型的演进
  2. 声音基础模型如何从编解码两侧精准助力声音的理解与生成
  3. 挑战与展望

听众收益:

  • 了解声音基础模型如何从编解码两侧精准助力声音的理解与生成

by 姚远

面壁智能
研究员 & 清华大学计算机系博士后

多模态大模型的能力突破,正在成为人工智能发展的前沿制高点。尽管多模态大模型的能力在迅速增长,但在其迈向实用化过程中仍面临严峻挑战:(1)参数规模大,计算成本高;(2)图像感知分辨率严重受限;(3)英文多模态能力强,中文多模态能力弱;(4)幻觉频繁,难以置信。在本次分享中,我将简要介绍我们在这些方面的最新工作。基于这些技术,我们构建了高效端侧多模态大模型系列 MiniCPM-V。最新发布的 MiniCPM-V 2.0 总参数量 2.8B,具备以下特点:(1) 性能领先,在 OpenCompass 榜单总计 11 个常用评测基准上综合得分优于 17B-34B 主流模型;(2) OCR 能力突出,TextVQA 场景文字理解能力与谷歌 Gemini Pro 相当,OCRBench 性能取得开源社区最佳水平;(3) 高清图像编码,支持 180 万像素高清任意长宽比图像无损编码;(4) 可信行为,在 Object HalBench 达到和 GPT-4V 相当的低幻觉率;(5) 双语支持,具有领先的中英双语多模态能力;(6) 高效计算,可在安卓和鸿蒙系统手机端部署运行。MiniCPM-V 2.0 在国际开源平台 HuggingFace 60 万余模型中,连续多天登上 Trending 榜单前三名。自 2024 年 2 月发布以来,相关开源多模态大模型累计下载次数 10 万余次。

演讲提纲:

  1. 多模态大模型迈向实用化的挑战分析
  2. 团队近期前沿探索
    • 端侧基座大模型构建
    • 高清图多模态大模型
    • 多模态能力跨语言泛化
    • 多模态人类反馈强化学习
  3. 高效端侧多模态大模型系列 MiniCPM-V

听众收益:

  • 了解当前多模态大模型在实用化过程中所面临的挑战,包括参数规模、计算成本、图像感知分辨率、语言能力等方面的限制
  • 了解针对参数规模和计算成本的优化策略、图像感知分辨率的提升技术、语言能力的加强方法等

by 周思霁

火山引擎
金融解决方案总监 & 金融大模型负责人

大模型从单模态向多模态的重要转变不仅为各行各业带来了全新的生产力工具,还可能引发商业模式的革命性变革。在金融行业,我们可以利用多模态方法综合处理文本、数字、表格和视觉数据,全面理解金融专业文件,从而提升多模态大模型技术在金融领域的应用效果。
此外,在金融行业,多模态大模型技术有望进一步拓展大模型的能力边界,改变传统业务模式,为行业带来前所未有的发展机遇。例如在零售客户服务、对公信贷风控、智能投研分析等领域,多模态大模型技术将实现重大变革,推动金融行业的创新与发展。

演讲提纲:

  1. 海内外多模态大模型发展趋势洞察
  2. 多模态大模型技术深度解析
  3. 机遇与挑战,金融多模态大模型场景落地展望

听众收益:

  • 了解多模态大模型在金融行业的应用现状和发展趋势。
  • 认识到 AIGC 技术在金融行业中的优势和挑战。
  • 思考如何在金融行业中合理利用AIGC技术,以实现更高效、安全、可持续的发展。

by 李岩

快手
「可图」大模型负责人

这是快手首次公开发布自研「可图」文生图大模型,功能与效果直接对标 Midjourney,演讲将介绍自研中文文生图大模型的技术路径,并给出若干个文生图大模型在快手APP的应用实践与效果收益,启发行业。

演讲提纲:

  1. 文生图大模型的行业发展历程
  2. 快手文生图大模型的研发之路
  3. 快手文生图大模型的周边插件能力
  4. 快手文生图大模型在快手 APP 的落地应用与价值剖析
  5. 给中国文生图大模型从业者的建议

听众收益:

  • 如何从零研发中文文生图基座大模型
  • 如何准确客观评估一个文生图大模型的效果
  • 如何选择 ROI 最高的文生图大模型落地场景
  • 如何规避文生图大模型的应用风险
     

交通指南

北京乐多港万豪酒店

Beijing Marriott Hotel Changping
地址:北京市昌平区南口路29号
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手