专题演讲嘉宾:任磊达

腾讯高级后台开发工程师、项目组 Agent 落地负责人

推动百人规模项目组开发团队从 Token Maxing 向 Token Apocalypse 转型,将 Harness 的目标明确聚焦于 ROI。

基于事前、事中、事后的架构构建 Harness Loop,降低认知成本,实现单人月耗百亿 Token 的开发模式,并完成团队推广。

基于 18 年线上项目运营经验,持续探索 100% Coding Vibe 场景下的质量投入模式与 ROI。在实践中,可于 20 天内完成原本约 100 人天的需求,并通过后续 2–3 个月的质量工程化手段恢复系统的可控性。

by 任磊达

腾讯
高级后台开发工程师、项目组 Agent 落地负责人

AI 时代,研发提效的关键不再只是让 Agent 更快写代码,而是让团队能持续证明代码“做对了”、质量“兜得住”。本次分享以“事前-事中-事后”Harness Engineering 为主线,结合游戏后端质量验证实践,探讨如何把 Agent 执行、测试策略、集成测试、Review 沉淀与 Skill 评估组织成质量飞轮。分享将从“查杀分离”这一核心理念出发,说明为什么测试需要独立于实现路径,为什么 Agent 自写自测存在认知同源风险;随后展开 TDD、tester skill、lobbytest / ugctest、skill evaluator 四类实践,分别对应事前结构化、事中自动化验证和事后沉淀回灌。最终目标是让人聚焦业务边界、风险判断和质量标准,让 Agent 承担执行、验证与重复性修复,使同类问题越来越少,质量资产持续复利。

演讲提纲

  1. 引言:Agent 时代的质量焦虑
    • 最大的问题不再是“能不能写代码”,而是“怎么证明写对了”
    • 研发质量的目标:让问题更早暴露、更少重复、更容易回灌
    • 引出核心框架:事前结构化、事中自动化、事后沉淀
  2. 两层 Harness:执行托底与项目组织
    • Agent-CLI 侧 Harness:托住长程执行,控制失控风险
    • 项目侧 Harness:拆清需求、测试、Review 和沉淀入口
    • 最终目标:白天做判断,夜里跑执行,第二天复盘回灌
  3. 质量验证的核心理念:查杀分离
    • 类比机器学习:训练集与验证集必须分离
    • 类比业务安全:发现问题的“查”和线上处置的“杀”需要独立
    • 映射到研发质量:Development 与 Test 要形成独立验证路径
    • Test vs Review:测试通过真实执行路径验证,Review 更多依赖代码文本和经验判断
  4. 事前:把需求、验收和测试策略结构化
    • /workflow:clarify:把模糊需求变成边界、风险和验收条件
    • TDD 在 Agent 时代的新定位:测试即规格,先定义“怎么算做对”
    • Agent 自写自测的风险:认知同源,容易“用训练集验证训练集”
    • 解决方向:上下文隔离、跨模型验证、属性测试、不变量测试
    • tester skill repo:从“怎么测”升级到“该测什么”
    • Push vs Pull:从过度测试转向风险驱动的恰到好处测试
  5. 事中:Agent 执行,自动化测试与 Hooks 盯防
    • 按 plan.yaml 分 stage 执行:实现、验证、失败重试、提交
    • Hooks / linter / auto review:把确定性问题前移到执行过程中
    • lobbytest / ugctest:游戏后端集成测试的实践样本
    • 从 CLI 工具到插件化,再到服务化架构
    • 真实服务、模拟客户端、TraceID、日志分析共同支撑事中验证
    • 事中困惑:用例维护成本、并发测试资源、复杂场景定位成本
  6. 事后:Review、Issue 与 Skill Evaluator 沉淀闭环
    • Review 放到 MR:沉淀代码上下文、判断依据和处理结果
    • Test 放到 Issue:沉淀验收标准、失败案例和回归入口
    • 高频问题回灌为 Hook、Linter、Skill、Workflow
    • Skill Evaluator:验证对象从代码升级到流程本身
    • 两类评估:Skill 是否被正确触发,Skill 是否完成预期任务
  7. 开发自测的三阶段价值定位
    • 阶段一:手工测试最佳实践沉淀为可执行用例
    • 阶段二:风险评估驱动低风险变更直发
    • 阶段三:测试团队主导质量系统化,开发团队提供技术支撑
    • 风险模型:风险等级 = 失效影响 × 失效可能性
    • 低风险 + 集成测试通过,可以进入更轻量发布路径
  8. 效率飞轮:从质量验证到工程资产复利
    • 事前:clarify、TDD、tester skill 定义清楚输入
    • 事中:Agent、Hooks、lobbytest / ugctest 自动执行验证
    • 事后:MR、Issue、Skill Evaluator 沉淀判断并回灌
    • 观测指标:MR 评论数、重复评论占比、Harness 回灌率、自动放行率、事前澄清耗时
  9. 结语:让人的判断越来越值钱
    • 人负责业务边界、风险判断和质量标准
    • Agent 负责执行、验证、修复和重复性反馈处理
    • Harness 的价值不是让 Agent 一次写得更快,而是让团队越跑越稳、同类问题越来越少、质量资产越来越厚。

这样的技术在实践过程中有哪些痛点?

  • token消耗较大,会有一定认知成本和管理成本的压力。

听众收益

  1. 了解 token maxxing 的上限边界,掌握通过认知管控提升该上限的方法。
  2. 明晰 vibe coding 的质量保障路径,该路径并非局限于常规的 tdd、单元测试、接口测试,而是要实现功能覆盖度与维护 ROI 的平衡。
  3. 如果组织选择不缩减HC,以及保证相对稳定的组织架构的形态下,如何借力 AI 实现效能 ROI 的收益。

交通指南

深圳湾万丽酒店

Shenzhen Bay Marriott Hotel
地址:深圳南山区粤海街道高新区社区科技南路18号
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手