格灵深瞳研发副总裁,拥有十余年AI工程化经验,曾带领团队研发推理引擎、向量数据库以及数据与训练平台等核心基础设施。现聚焦于AI Infra方向,负责AI模型的训推优化与应用落地工作。

格灵深瞳研发副总裁,拥有十余年AI工程化经验,曾带领团队研发推理引擎、向量数据库以及数据与训练平台等核心基础设施。现聚焦于AI Infra方向,负责AI模型的训推优化与应用落地工作。
当前企业级Agent评测面临两大断层:通用Benchmark脱离垂直场景业务目标,生成效果无法量化决策价值。本人在教育、金融、轨交运维等严肃场景中,探索出一套融合领域知识、多模态感知与决策链追溯的评测体系。本次分享将解析如何通过动态数据沙盒、决策链可解释性验证、业务指标映射模型,解决“高分低能”痛点,并推动Agent从对话能力向决策智能进化。
演讲提纲
您认为,这样的技术在实践过程中有哪些痛点?
严肃场景下,Agent评测过程和结论仍然需要业务专家的review,无法完全脱离人
您的演讲有哪些前沿亮点?
针对企业的Agent自动化评测的流程与方法
听众收益



微信咨询

电话咨询
微信联系我们

