蒋志伟,next.ai 创始人,OpenTelemetry 开源项目核心参与者。曾在阿里巴巴参与电商、交易系统的研发。曾从 0-1 搭建服务日均千万用户的美团 APP 基于机器学习的推荐、搜索服务。曾负责 Qunar.com 上亿用户的机票高并发分布式搜索、低价推荐系统,拥有多项技术专利。具有超过 14 年的国内互联网的技术和咨询服务经验,在 NLP 旅游推荐搜索、医疗口腔 AI 图像识别领域、电商知识图谱、AI 智能客服、AI 法律检索领域等有着落地项目经验。

蒋志伟,next.ai 创始人,OpenTelemetry 开源项目核心参与者。曾在阿里巴巴参与电商、交易系统的研发。曾从 0-1 搭建服务日均千万用户的美团 APP 基于机器学习的推荐、搜索服务。曾负责 Qunar.com 上亿用户的机票高并发分布式搜索、低价推荐系统,拥有多项技术专利。具有超过 14 年的国内互联网的技术和咨询服务经验,在 NLP 旅游推荐搜索、医疗口腔 AI 图像识别领域、电商知识图谱、AI 智能客服、AI 法律检索领域等有着落地项目经验。
基于 Transformer 和衍生的 GPT、BERT 出现,AI 对自然语言的上下文推理、一词多义理解能力有了重要的质变。这种质变让场景契合的辅助编程领域有了大的突破。以 Code LLama 为首的 Code LLM 带动了智能编程产品快速发展。但是目前的 Code LLM 测评工具非常简单,有的几年没有更新。测评只关注到性能和少部分运行结果,没有全面从实际编程场景看提效和辅助能力。同时,现在大模型评分公开的造假,需要更科学的方式评判 Code LLM 真实效果。本次演讲将从编程场景出发,结合真实的测评,比较市面上的工具产品,并分享落地案例及未来的发展趋势判断。
演讲大纲
1. 以 HumanEval、MBPP 代表代码模型评测标准十分落后
2. 一套原创测试集,从缺陷查找、代码调优、报错排查、代码解释等进行实际测评
3. 从API文档、单元测试、代码注释、工具类等辅助生成能力进行实际测评
4. 真实企业提效现状,如何最高做到 30%,未来的发展空间
听众收益



微信咨询

电话咨询
微信联系我们

