Agent 在演示环境中完成一次任务,并不意味着它能够在生产环境中持续可靠地工作... 展开 >

拥有丰富的大型互联网电商及金融科技行业经验,深耕高可靠、高稳定系统的质量保障体系十多年。曾历任淘宝会员、淘宝店铺、淘宝商品等核心业务,以及智能互联事业部技术质量负责人。近年来,紧跟技术前沿,在AI系统评测领域积累了深厚的实战经验,致力于探索智能化时代AI Native的质量保障新范式。

拥有丰富的大型互联网电商及金融科技行业经验,深耕高可靠、高稳定系统的质量保障体系十多年。曾历任淘宝会员、淘宝店铺、淘宝商品等核心业务,以及智能互联事业部技术质量负责人。近年来,紧跟技术前沿,在AI系统评测领域积累了深厚的实战经验,致力于探索智能化时代AI Native的质量保障新范式。
Agent 在演示环境中完成一次任务,并不意味着它能够在生产环境中持续可靠地工作。本专题聚焦智能体评测与生产可靠性,讨论如何定义任务成功、构建真实业务评测集,并通过 Tracing、Replay、回归测试和质量 SLO 持续发现系统退化。同时关注长任务中断、重复执行、状态污染、工具失效、人工接管、故障恢复与业务补偿,探索如何建立覆盖测试、运行、监控和事故响应的 Agent 可靠性工程体系。



微信咨询

电话咨询
微信联系我们

