硕士毕业于Clark University,是一位在国际舞台上屡获殊荣的资深技术专家。曾在Google和电商巨头Shopee担任高级研发工程师,专注于遥感图像大数据和深度学习领域的研究与开发。精通深度学习Pipeline的构建,对中台技术的研发有着深刻的理解和丰富的实践经验。对AI与数据库应用的融合有丰富的实践经验。

硕士毕业于Clark University,是一位在国际舞台上屡获殊荣的资深技术专家。曾在Google和电商巨头Shopee担任高级研发工程师,专注于遥感图像大数据和深度学习领域的研究与开发。精通深度学习Pipeline的构建,对中台技术的研发有着深刻的理解和丰富的实践经验。对AI与数据库应用的融合有丰富的实践经验。
在当前大语言模型(LLM)和AI代理广泛应用的背景下,数据质量成为构建高效应用的核心。本次演讲将分享一套系统化的数据处理方法,专为企业应对其最大的技术挑战之一——如何将多源非结构化数据转换为适合LLM处理的高质量知识库。该流程集成了OCR、公式识别、多模态标注与嵌入生成等关键步骤,通过构建统一的管道,能够高效地处理来自PDF、DOCX、PPTX、XLSX、RTF等多种格式的数据文件。通过定制化训练的视觉语言模型(LLM)和专用嵌入模型,此流程显著提升了对复杂表格、图像和公式的识别与解析能力。
为了进一步优化数据处理效率,流程引入了MatrixOne的HSTAP架构,并结合GPU加速的向量化计算。该技术框架在透明的数据环境中,使得数据的标签、嵌入和结构信息能够通过自然语言查询快速检索,显著提高了数据使用的灵活性和响应速度。该方法论的核心在于通过深度处理企业现有数据,提供AI驱动的技术支持和洞察能力,以此提升决策的质量与精度。同时,这一方法显著简化了基于LLM的应用开发流程,在多个行业场景(如科技、智能制造、金融、教育、电商、法律和电信)中效果显著。
演讲提纲:
听众收益:



微信咨询

电话咨询
领取往期热门演讲视频

