当前人工智能正从感知智能、认知智能向具身智能、世界理解深度演进,世界模型作为构建... 展开 >






智源青年学者,主导和深度参与融资超近 10 亿元,公司估值超过 100 亿元。 2019 年博士毕业于中国科学院自动化研究所; 2019 年至 2021 年在清华大学自动化系从事博士后研究。在 TPAMI、 CVPR、 ICCV、 ECCV、 NeurIPS 等顶级期刊和会议上发表论文 70 余篇,文章总引用 19000 余次 (Google Citations),连续 4 年入选全球前 2% 顶尖科学家榜单。获得 2025 年吴文俊人工智能自然科学奖一等奖、 2025 年度魔搭社区具身智能先锋人物(全国 20 人)、 PRCV2025 最佳学生论文奖、 CCF 杰出论文奖。代表作 SiamRPN 和 DaSiamRPN 是深度学习时代最具影响力的目标跟踪算法之一,开辟了区域候选孪生网络目标跟踪的研究方向,分别被引用 3500 余次和 1800 余次,并被集成进 OpenCV; BEVDet 是 BEV 感知领域的代表性算法,被多家车企和自动驾驶公司 3D 感知方案所采用,累计被引用 1100 余次; WebFace260M 是全球最大的人脸识别数据集,被 500 余家科研机构申请使用, DriveDreamer 世界模型入选 ECCV 最具影响力论文榜单。领导了身智能基础模型 GigaBrain 系列和世界模型 GigaWorld 系列工作的研发。曾获 NIST-FRVT、COCO、VOT 等顶级视觉竞赛冠军。多次在 CVPR、ICCV 上组织 Workshop 和比赛,多次担任 ICLR、 AAAI 的领域主席。
当前人工智能正从感知智能、认知智能向具身智能、世界理解深度演进,世界模型作为构建虚拟与现实统一映射的核心技术,已成为多模态大模型、视频生成(Video Gen)、智能驾驶、数字孪生等领域的关键突破口。专题聚焦世界模型、多模态智能、视频生成的技术交汇与产业落地,汇聚产学研一线专家与头部企业技术负责人,深度探讨多模态大模型如何为世界模型筑牢技术底座、Video Gen 与动态世界生成的前沿突破、世界模型在智能驾驶仿真、具身智能、数字孪生等场景的量产实践
随着以 Next-token prediction 为代表的大模型技术迅猛发展,其应用已从单一语言模型快速拓展至多模态领域。本次分享将以语言模型为切入点,系统介绍多模态场景下生成与理解技术的演进脉络,重点围绕语音、图像两大模态,探讨前沿多模态模型的架构设计思路,并展望未来核心研究方向。
演讲提纲:
听众收益:
了解多模态生成和理解的前沿进展
本次报告将分享混元团队在世界模型方面的技术探索与研发布局,涵盖 3D 世界模型与实时世界建模与两大主线。首先,我们将系统介绍世界模型的行业发展脉络与思考。接着,报告将阐述腾讯混元在世界模型方向的思考与研发布局,包括可兼容物理引擎、用于游戏研发的 3D 世界模型以及可实时交互的世界建模。最后,本报告将对世界模型的未来发展趋势进行展望,并探讨其发展过程中面临的开放性挑战与潜在的社会影响。
演讲提纲:
听众收益:
当大模型从数字世界走向物理世界,具身智能正成为人工智能的下一个主战场。让机器人在开放、非结构化的真实环境中实现自主感知、决策与行动,仍面临数据稀缺、技能泛化和可靠执行三大核心瓶颈。高德近期发布了面向具身智能的 ABot 全栈技术体系,由世界模型(ABot-World)、导航模型(ABot-N)、操作模型(ABot-M)与具身 Harness 架构(ABot-Claw)构成——以世界模型为想象引擎,以导航与操作模型为行动双核,打通从环境理解、路径规划到精细操作的全闭环技术链路。
本次演讲将聚焦 ABot 体系中世界模型这一核心基础设施层。报告将从支撑端到端生成的大规模时空数据基建讲起,剖析 DiT 与自回归等底层架构在处理真实场景多模态数据时的工程选型,介绍世界模型如何通过物理硬约束训练与 3DGS 空间基座实现物理级动力学建模,并重点分享世界模型如何批量合成高质量仿真数据,为具身导航与操作的下游任务提供规模化的数据泛化支撑,驱动 ABot 体系的持续进化与量产落地。
演讲提纲:
听众收益:
随着 AIGC 技术快速普及,违规素材的批量生成与变体攻击愈发频繁,传统以规则引擎与人工审核为核心的"识别-拦截-人工修改"安全模式正面临效率、误判与创作者体验的多重瓶颈,内容安全领域亟需系统性范式升级。本次分享将介绍快手在商业内容安全方向的大模型技术实践与组织演进经验。技术层面,快手自研商业安全大模型BLM,具备图文视频跨模态统一理解与细粒度营销意图感知能力,并构建"精细拒绝—AI修复—自动过审"的生成式安全闭环,将拦截终点转化为内容修复起点。
搭建AI Native原生架构,依托 Multi-Agent协同架构实现审核、回扫、验真全链路智能化,通过HITL设计将人工介入聚焦于高价值例外处理,形成持续自进化的增强型安全体系,为企业构建面向 AGI时代的智能化风控基础设施。
演讲提纲:
听众收益:
本次分享围绕开悟(Kairos)具身原生世界模型架构展开,详解开悟世界模型理解的物理AGI五层能力跃迁,并根据对于物理AGI的理解设计的 “多模态理解 - 视频生成 - 状态预测 - 自我进化” 的完整世界模型架构,实现“视频生成 - 物理认知 - 交互反馈 - 迭代优化” 的进化飞轮,让物理智能体真正具备理解、推演、交互与持续成长的能力,为物理 AGI 落地提供原生大脑级的技术底座。



微信咨询

电话咨询
领取往期热门演讲视频

