AI 辅助编程真实测评及企业落地实践

所属专题:大模型与企业工具集成的提效实践

嘉宾 : 蒋志伟 | next.ai创始人

会议室 : 钻石厅 D

讲师介绍

专题演讲嘉宾:蒋志伟

next.ai创始人

蒋志伟,next.ai 创始人,OpenTelemetry 开源项目核心参与者。曾在阿里巴巴参与电商、交易系统的研发。曾从 0-1 搭建服务日均千万用户的美团 APP 基于机器学习的推荐、搜索服务。曾负责 Qunar.com 上亿用户的机票高并发分布式搜索、低价推荐系统,拥有多项技术专利。具有超过 14 年的国内互联网的技术和咨询服务经验,在 NLP 旅游推荐搜索、医疗口腔 AI 图像识别领域、电商知识图谱、AI 智能客服、AI 法律检索领域等有着落地项目经验。

议题介绍

演讲:AI 辅助编程真实测评及企业落地实践

基于 Transformer 和衍生的 GPT、BERT 出现,AI 对自然语言的上下文推理、一词多义理解能力有了重要的质变。这种质变让场景契合的辅助编程领域有了大的突破。以 Code LLama 为首的 Code LLM 带动了智能编程产品快速发展。但是目前的 Code LLM 测评工具非常简单,有的几年没有更新。测评只关注到性能和少部分运行结果,没有全面从实际编程场景看提效和辅助能力。同时,现在大模型评分公开的造假,需要更科学的方式评判 Code LLM 真实效果。本次演讲将从编程场景出发,结合真实的测评,比较市面上的工具产品,并分享落地案例及未来的发展趋势判断。

演讲大纲

1. 以 HumanEval、MBPP 代表代码模型评测标准十分落后

  • 评分造假:行业大模型普遍都有水分、现场从底层源代码演示如何造假
  • 评测标准局限在性能,无法反映实际编程场景辅助能力

2. 一套原创测试集,从缺陷查找、代码调优、报错排查、代码解释等进行实际测评

  • 行业主流工具进行测评结果自动化打分和结果分析
  • 语言特性纳入测评:细分前后端、考虑不用语言特性

3. 从API文档、单元测试、代码注释、工具类等辅助生成能力进行实际测评

  • 偏主观判定,采用不记名随机抽样人工标注的方法判断结果打分
  • 业务辅助编程:SQL 建模的能力、RAG 检索本地代码库能力 

4. 真实企业提效现状,如何最高做到 30%,未来的发展空间

  • 企业提效充分条件:必须要团队协作,按照一定 Sop 项目拆解、开发分工 
  • 具备低代码平台的项目构建能力:辅助编程提效如何达到 50-70%  (现场举几个辅助编程贡献通用项目 80-90% 代码量的实际案例)

听众收益

  1. 了解智能编程大模型、通用大模型的一些前沿的技术和成果
  2. 开拓一些新思路,用新方法利用智能编程给企业和研发团队提效和个人技能成长
  3. 目前领域相关的挑战,对未来智能编程产品、技术发展的展望

交通指南

上海中谷小南国花园酒店

China Grain Hotel
地址:上海市杨浦区佳木斯路777号(近营口路口)
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手