千帆大模型推理服务降本实践

所属专题:大模型在企业中的成本优化实践

嘉宾 : 胡鸣人 | 百度 AI 平台架构师

会议室 : 天山厅

讲师介绍

专题演讲嘉宾:胡鸣人

百度 AI 平台架构师

拥有 10 多年深厚技术研发背景,曾在全路通、腾讯及百度等科技企业担任核心研发角色。期间,深度参与了腾讯微博、百度司南、百度 AI 能力引擎及 EasyDL 平台的创新研发和优化升级,自 2023 年起,深度投身于百度千帆大模型平台的工作中,并亲自领导了该平台推理架构的设计与优化进程。

议题介绍

演讲:千帆大模型推理服务降本实践

这次演讲将介绍大模型推理服务的独特之处,并详细阐述千帆大模型推理架构建设的实践与探索过程。在这一过程中,团队面临了算力成本高昂、资源利用效率低等降本难题。为了解决这些挑战,千帆平台采用了多项创新技术:

  1. Prefix Caching:通过前缀缓存技术提升了模型推理的速度和集群吞吐量,显著提高了系统整体性能。
  2. PD分离技术:通过引入PD(Parameter Decoupling)分离技术,优化了资源分配,既提升了系统性能,又有效降低了成本。
  3. 量化压缩技术:采用量化压缩方法,减少了模型存储和计算需求,从而降低了硬件资源消耗。

此外,在架构设计方面,千帆平台还引入了高效的调度方案,能够动态调整请求和计算资源的分配,进一步提升了服务的性能和响应速度,实现了资源的高效利用。

演讲提纲:

  1. 大模型推理服务介绍
  2. 千帆大模型推理架构建设的实践与探索
  3. 我们遇到的降本挑战与应对策略
  4. 千帆平台降本的解决思路和方案
  5. 总结与展望

听众收益:

  • 了解百度千帆大模型推理的最新技术和成果
  • 了解到千帆平台大模型推理降本的实战经验

交通指南

北京丰大国际大酒店

Beijing Fengda International Hotel
地址:北京市大兴区荣华中路20号
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手