专题演讲嘉宾:赵晨阳

矩阵起源研发副总裁

硕士毕业于Clark University,是一位在国际舞台上屡获殊荣的资深技术专家。曾在Google和电商巨头Shopee担任高级研发工程师,专注于遥感图像大数据和深度学习领域的研究与开发。精通深度学习Pipeline的构建,对中台技术的研发有着深刻的理解和丰富的实践经验。对AI与数据库应用的融合有丰富的实践经验。

by 赵晨阳

矩阵起源
研发副总裁

在当前大语言模型(LLM)和AI代理广泛应用的背景下,数据质量成为构建高效应用的核心。本次演讲将分享一套系统化的数据处理方法,专为企业应对其最大的技术挑战之一——如何将多源非结构化数据转换为适合LLM处理的高质量知识库。该流程集成了OCR、公式识别、多模态标注与嵌入生成等关键步骤,通过构建统一的管道,能够高效地处理来自PDF、DOCX、PPTX、XLSX、RTF等多种格式的数据文件。通过定制化训练的视觉语言模型(LLM)和专用嵌入模型,此流程显著提升了对复杂表格、图像和公式的识别与解析能力。

为了进一步优化数据处理效率,流程引入了MatrixOne的HSTAP架构,并结合GPU加速的向量化计算。该技术框架在透明的数据环境中,使得数据的标签、嵌入和结构信息能够通过自然语言查询快速检索,显著提高了数据使用的灵活性和响应速度。该方法论的核心在于通过深度处理企业现有数据,提供AI驱动的技术支持和洞察能力,以此提升决策的质量与精度。同时,这一方法显著简化了基于LLM的应用开发流程,在多个行业场景(如科技、智能制造、金融、教育、电商、法律和电信)中效果显著。

演讲提纲:

  1. 引言与背景
    • 多模态检索的需求及应用场景
    • 企业数据处理的挑战与痛点
  2. 多模态模型的混合检索架构
    • 多模态模型的架构与核心技术
    • 混合检索的实现策略:融合传统索引与向量化模型的结合
    • 多源数据的融合与标准化处理的挑战
  3. GPU加速的数据处理与模型优化
    • GPU在数据向量化与处理加速中的应用
    • 构建快速反馈与模型微调机制的难点
  4. LLM辅助的检索结果筛选与优化
    • LLM在检索结果筛选与重排序中的应用
    • 结合Reranker和LLM提高检索结果的相关性和用户体验
  5. 引导式数据标注与自动化数据洞察
    • 引导式标注Agent的自动化实现
    • Agent辅助下的数据洞察和提升搜索效率的方法
  6. 总结与展望

听众收益:

  • 了解如何充分挖掘和利用非结构化数据中的深度信息,进而提升数据驱动决策的精准性
  • 理解如何通过高效的数据处理流程加速基于LLM的应用开发,从而缩短企业AI项目的上线时间
  • 了解如何简化复杂的数据清洗与准备流程,帮助团队集中精力于更高价值的任务上,提升整体效率

交通指南

北京丰大国际大酒店

Beijing Fengda International Hotel
地址:北京市大兴区荣华中路20号
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手