Agent 安全、评测与可信治理

会议室:祥源宴会厅 中厅
出品人:马传雷(岳立)

聚焦 Agent 在真实生产环境中的安全防护与可信落地,涵盖权限控制、行为审计、... 展开 >

专题出品人:马传雷(岳立)

支付宝业务风险技术部负责人

负责支付宝技术安全和业务风险治理能力建设,曾先后从0到1为支付宝“碰一下”支付、阿福健康AI客户端等产品构建技术安全体系。深耕安全领域超过十五年,在网络安全、业务风控、AI安全领域有所建树,带领团队建立的支付宝“AI4SDL”研发安全体系获中国互联网协会首届“AI领航杯”大赛金奖、“支付安全风险全链路智能对抗体系”获上海金融创新奖。在学术领域,获得过CCF产学合作基金优秀项目案例、国际软工顶会ASE Distinguished Paper Award等。曾任同盾科技反欺诈产研负责人、腾讯安全应急响应中心技术负责人、绿盟科技安全技术部总监等职位,亦为《风控要略:互联网业务反欺诈之路》作者之一。

地点:祥源宴会厅 中厅

专题:Agent 安全、评测与可信治理

聚焦 Agent 在真实生产环境中的安全防护与可信落地,涵盖权限控制、行为审计、敏感信息保护、对抗攻击防御、合规治理、自动化红队、风险评估与可信评测体系等方向

by 胡侠

上海人工智能实验室
领军科学家

随着智能体逐步进入企业生产环境,其安全问题已不再局限于模型本身,而是延伸至代码执行、数据访问、权限控制与业务流程协同等多个层面。尤其在涉及敏感数据和复杂系统交互的真实场景中,如何在提升智能化能力的同时,建立可控、可信的运行机制,成为产业落地的重要挑战。

本次分享将围绕上海人工智能实验室在“安全即服务”方向的探索展开,介绍书安智能体操作系统在产业场景中的设计思路与实践经验。报告将重点讨论如何将安全能力内嵌于智能体运行全流程,构建覆盖系统隔离、流程治理、行为约束与持续演化的安全机制,以支持智能体在复杂业务环境中的稳定运行。

同时,分享还将结合产业智能化过程中的典型需求,探讨智能体安全体系如何从底层基础设施逐步延伸至任务协同与业务治理层面,为AI规模化应用提供更加系统化的安全支撑。

听众收益:

  • 探索如何将安全能力内嵌于智能体全生命周期,实现Make AI Safe与Make Safe AI的互补融合,系统性降低智能体运行风险,全方位适配真实业务场景下的安全挑战
  • 沉淀产业级AI安全技术体系实践经验,依托“底层隔离—流程守护—认知进化”三层安全机制,构建从系统底层安全到智能体行为管控,到“Make Safe AI”内核安全进化的多层协同

by 盛锦辰(幻猫)

蚂蚁安全非攻实验室
AI 安全研究员

2026 年,Agent 框架(OpenClaw 等)大规模走入企业生产,攻击面横跨模型、框架、运行环境三层——记忆投毒、工具滥用、身份越权、沙箱逃逸接踵而至,单层切片的传统检测工具已无法覆盖。支付宝的解法是用 Agent 检测 Agent。本演讲分享从「人工审计」走向「智能化自主检测」的生产实践:如何构建 Agent 风险大图、如何构建漏洞检测 harness、如何让领域记忆驱动自进化、如何进行评测。

演讲提纲:

  1. 问题:Agent 攻击面横跨全栈,旧地图失灵
    • 复合风险: 模型、框架、运行环境三层叠加,跨层级联放大攻击面
    • 旧地图失灵: 从攻击路径系统性建模,把离散风险收敛为可治理结构
  2. 解法:构建 Agent 漏洞挖掘 harness 环境
    • 静态切面: harness 聚拢框架代码、Dockerfile 与工具配置,挖洞 Agent 一站扫描静态攻击面
    • 动态切面: harness 暴露模型 IO、工具调用与沙箱运行时,红队 Agent 注入对抗输入复现可利用性
  3. 演进:记忆驱动的自进化
    • 新瓶颈: 上线后质量触顶,差距在于对企业上下文(业务语义、组织权限、历史漏洞)的理解
    • 长期记忆: 每次确认与排除固化为安全知识与记忆资产,长期越用越懂业务场景
  4. 度量:让 Agent 可信落地
    • 评测重定义: 精度之外,加入稳定性、可解释性、对抗鲁棒性,全面量化可信度
    • 双向闭环: 对外是生产准入门槛,对内是记忆反馈信号,驱动 Agent 持续进化

听众收益:

  • Agent 跨层攻击面与威胁建模方法
  • 漏洞挖掘 harness 与领域记忆驱动自进化的工程实践
  • 多维可信评测与双向闭环的生产落地标准

by 宋奇钊(胖錿)

阿里巴巴
AAIG实验室AI红队负责人

当 AI Agent 出了事,怎么分类、怎么测、怎么治 — REAL 风险矩阵与自动化红队实践AI Agent 正在从"对话工具"演进为"执行系统"——它调用工具、读写数据、跨服务编排,这意味着一次 Prompt 注入不再只是"回答了不该说的话",而可能变成一条从交互层穿透到执行层的完整攻击链。行业不缺 AI 安全的风险列表,但缺一个能同时回答"为什么出事(根因)、出了什么事(影响)、在哪层出事(位置)"的结构化分类体系,更缺一套能把分类结果直接变成测试用例、再变成自动化红队能力的工程化链路。

本演讲以我们在生产环境中的 AI 红队体系建设为主线,分三个层次展开:首先介绍 REAL 风险矩阵(R×E@L 三维分类),如何用一个坐标系统覆盖 Agent 全场景风险并对齐国内外主流标准;其次通过一个脱敏的 Prompt 注入跨层攻击链案例,展示矩阵如何指导红队从"漫无目的挖洞"变成"按坐标打靶";最后介绍我们正在建设的基于矩阵驱动的自动化红队架构,如何将专家攻击经验转化为可规模化执行的 Agent 自动化测试。

演讲摘要:

  1. AI Agent 的风险为什么分不清
    • Agent ≠ Chatbot:工具调用、多步编排、跨系统权限让风险从"内容安全"扩展到"系统安全"
    • 行业现有框架的局限:
      • OWASP Top 10(LLM/Agentic AI):排名清单,不是分类体系,同一漏洞可归入多条,无法指导测试计划
      • MITRE ATLAS:攻击视角的 TTP 目录,覆盖不了幻觉、偏见、功能滥用等非对抗性失效
    • 核心矛盾:安全团队需要一个既能分类已知漏洞、又能生成测试计划、还能对接合规要求的统一坐标系
  2. REAL Matrix:一个三维坐标系统覆盖 Agent 全场景
    • R(Root Cause)— 为什么出事:4 类根因 × 9 子类
      • 决策树:外部注入(R1)vs 模型自身(R2)vs 基础设施(R3)vs 功能滥用(R4)
    • E(Effect)— 出了什么事:4 类影响 × 20 子类
      • CIA + S(Safety):系统自身受损(机密性/完整性/可用性)vs 系统输出伤害外部人员(安全性)
    • L(Layer)— 在哪层出事:4 层架构
      • L1 交互层 → L2 认知层 → L3 执行层 → L0 基础设施层
      • 攻击链跨层传播标注:同一攻击链的不同步骤在不同 R×E@L 坐标
    • 验证数据:69 条真实漏洞、37+ Agent 产品、0 遗漏;与 OWASP/MITRE/NIST/CSA 全量对齐;内置 16 部法规 128 条映射
    • 设计取舍:为什么是三维不是二维?为什么不直接扩展 OWASP?为什么 R2(幻觉)和 R4(滥用)必须独立成类?
  3. Case Study:一条 Prompt 注入如何从 L1 穿透到 L3
    • 攻击场景还原:
      • 起点:间接注入(R1.2)— 外部数据源中植入恶意指令,Agent 在 RAG 检索时读入
      • 穿透:认知层(L2)— 模型将恶意内容当作合法指令,推理链被劫持
      • 落地:执行层(L3)— Agent 调用工具执行非预期操作(数据外传 / 权限越界)
    • 用 REAL 坐标标注攻击链:R1.2×C@L2 → R1.2×I@L3,展示同一攻击在不同阶段的 R/E/L 变化
    • 矩阵如何指导防御定位:不是"加一条规则",而是按层级精确定位:L1 输入过滤、L2 上下文隔离、L3 工具权限最小化
    • 从个案到体系:这条攻击链映射到 R×E 16 格中的哪个格子?对应哪些法规条款?如何生成回归测试用例?
  4. 从矩阵到自动化红队:让专家经验变成可规模化执行的测试
    • 当前困境:一个产品一个红队专家,产品线越多人力越紧张,攻击经验无法复用
    • 架构设计思路:
      • 矩阵 → 测试条目库:R×E@L 每个格子对应一组测试用例模板
      • 测试条目库 → Agent 自动化:用 Agent 自动化执行测试用例,替代重复性手工测试
      • 自动化 → 竞对横评:同一测试集横向跑多个产品,统一标尺对比安全水位
      • 横评 → 态势感知:Leaderboard 可视化,业务和管理层直观看到水位变化
    • 技术选型考量:
      • 为什么用 Agent 做测试 Agent("以 Agent 测 Agent"):测试目标本身是 Agent,需要多步交互、工具调用、上下文维护
      • Mobile 端 vs CUA 端的差异化方案
      • 从攻击研究到自动化的知识转化:专家红队发现新攻击手法 → 编码为测试用例 → 自动化回归
    • 与人工红队的关系:自动化解决的是"已知风险的规模化覆盖",专家红队聚焦"未知风险的前沿探索",两条线并行、互相赋能
  5. 五合规映射:分类结果如何自动对接监管要求
    • R×E 16 格 × 128 条法规映射:测试结果打上 R×E@L 标签后,自动关联适用法规

听众收益:

  • 获得一个可直接落地的 AI Agent 风险三维分类方法(R×E@L),替代"对着 OWASP Top 10 逐条打勾"的低效模式
  • 通过真实攻击链案例,理解 Agent 场景下跨层攻击的传播机制和精确防御定位方法
  • 看到一条从风险矩阵到自动化红队的完整工程化链路设计,解决"攻击经验无法复用"的规模化难题
  • 了解如何将安全测试结果自动映射到合规要求,降低法规对接的人工成本

 

交通指南

上海虹桥祥源希尔顿酒店

Hilton Shanghai Hongqiao
地址:上海市红松东路1116号
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手