拥有超过20年IT及10年云计算行业经验。近年专注于AI基础设施领域,在AI应用的训练、推理、跨硬件平台(GPU/TPU等)部署适配及性能优化方面具有深厚的理论知识和丰富的实战经验,致力于推动AI算力在各行业的普惠化落地。

拥有超过20年IT及10年云计算行业经验。近年专注于AI基础设施领域,在AI应用的训练、推理、跨硬件平台(GPU/TPU等)部署适配及性能优化方面具有深厚的理论知识和丰富的实战经验,致力于推动AI算力在各行业的普惠化落地。
本次演讲将探讨如何在Google Cloud TPU上,以高性价比的方式部署开放的大语言模型和文生图模型。我们将基于TPU的发展历程及其硬件架构特性,深入剖析如 vLLM、JetStream、MaxDiffusion 等主流推理框架在TPU上的优化路径。
演讲将重点介绍围绕自动前缀缓存、分块预填充、连续批处理、分布式推理等关键技术手段,如何实现推理流程的深度调优,从而显著提升模型部署的吞吐效率与响应延迟。
演讲提纲:
听众收益:



微信咨询

电话咨询
微信联系我们

