中山大学博士,大模型技术专家,就职于阿里云。负责大模型在 B 端客户的算法应用场景方案设计实现,落地及优化。具有丰富的 AI,机器学习&优化算法技术研究&生产落地经验,目前专注于各类模型的训练推理技术,结合底层算力技术的研究和优化。

中山大学博士,大模型技术专家,就职于阿里云。负责大模型在 B 端客户的算法应用场景方案设计实现,落地及优化。具有丰富的 AI,机器学习&优化算法技术研究&生产落地经验,目前专注于各类模型的训练推理技术,结合底层算力技术的研究和优化。
本次演讲将带领大家逐层解析大模型推理的核心技术。从模型代码讲解 Transformer 前向传播的核心流程与关键模块设计;框架层解读主流推理引擎(如 vLLM/TensorRT)的加速原理与适用场景;深度学习框架揭示 PyTorch 动态图编译、算子优化等底层支持技术;硬件加速剖析 CUDA 并行计算与内存优化策略;最后结合 GPU 特性分析不同硬件对推理性能的影响规律,提供从代码优化到硬件选型的全链路实践指南,帮助开发者快速构建高效推理方案。
演讲提纲:
听众收益:



微信咨询

电话咨询
微信联系我们

