本专题将深入解析多模态大模型的技术核心,探讨其如何高效处理文本、图像、音频等多种... 展开 >




先后在百度、小米担任技术主管,曾带领团队获得百度最高奖,和业务部门合作获得小米百万美金技术大奖。在搜索推荐、自然语言处理、多模态等人工智能领域有十年以上研发经验及管理经验,致力于将人工智能技术赋能至智能营销、汽车制造和新零售等小米核心业务中,提升小米核心业务运营、研发效率。
本专题将深入解析多模态大模型的技术核心,探讨其如何高效处理文本、图像、音频等多种数据类型,并挖掘其在人工智能领域的独特价值。此外,我们会通过多个行业案例,如医疗诊断、教育辅助、金融分析等,展示这些模型在实际工作中的应用和成效。
声音是人与人,人与自然交互的重要模态之一。对声音的理解和生成贯穿这个交互的过程,也是从声音种提炼信息并还原和展现成新信息的过程,可以用声音模态的编码和解码来表述。编解码范式已经是大模型时代的 Magic Word。这个范式已经造就了成功的各种语音应用案例,比如 OpenAI 或者字节的语音合成,OpenAI 和 Meta 的大模型语音识别,以及小米和 Meta 的声音理解。
这些应用需要不同层面和不同粒度的声音编解码。在编解码两端都需要模态内部更强的自我解释能力。为此,我们一直坚持探索声音基础模型的建设,来关注声音的自我解释能力,从而助力语音识别,语音合成以及声音的还原或降噪。
演讲提纲:
听众收益:
多模态大模型的能力突破,正在成为人工智能发展的前沿制高点。尽管多模态大模型的能力在迅速增长,但在其迈向实用化过程中仍面临严峻挑战:(1)参数规模大,计算成本高;(2)图像感知分辨率严重受限;(3)英文多模态能力强,中文多模态能力弱;(4)幻觉频繁,难以置信。在本次分享中,我将简要介绍我们在这些方面的最新工作。基于这些技术,我们构建了高效端侧多模态大模型系列 MiniCPM-V。最新发布的 MiniCPM-V 2.0 总参数量 2.8B,具备以下特点:(1) 性能领先,在 OpenCompass 榜单总计 11 个常用评测基准上综合得分优于 17B-34B 主流模型;(2) OCR 能力突出,TextVQA 场景文字理解能力与谷歌 Gemini Pro 相当,OCRBench 性能取得开源社区最佳水平;(3) 高清图像编码,支持 180 万像素高清任意长宽比图像无损编码;(4) 可信行为,在 Object HalBench 达到和 GPT-4V 相当的低幻觉率;(5) 双语支持,具有领先的中英双语多模态能力;(6) 高效计算,可在安卓和鸿蒙系统手机端部署运行。MiniCPM-V 2.0 在国际开源平台 HuggingFace 60 万余模型中,连续多天登上 Trending 榜单前三名。自 2024 年 2 月发布以来,相关开源多模态大模型累计下载次数 10 万余次。
演讲提纲:
听众收益:
大模型从单模态向多模态的重要转变不仅为各行各业带来了全新的生产力工具,还可能引发商业模式的革命性变革。在金融行业,我们可以利用多模态方法综合处理文本、数字、表格和视觉数据,全面理解金融专业文件,从而提升多模态大模型技术在金融领域的应用效果。
此外,在金融行业,多模态大模型技术有望进一步拓展大模型的能力边界,改变传统业务模式,为行业带来前所未有的发展机遇。例如在零售客户服务、对公信贷风控、智能投研分析等领域,多模态大模型技术将实现重大变革,推动金融行业的创新与发展。
演讲提纲:
听众收益:
这是快手首次公开发布自研「可图」文生图大模型,功能与效果直接对标 Midjourney,演讲将介绍自研中文文生图大模型的技术路径,并给出若干个文生图大模型在快手APP的应用实践与效果收益,启发行业。
演讲提纲:
听众收益:



微信咨询

电话咨询
领取往期热门演讲视频

