潘滢炜,现任智象未来(HiDream.ai)算法科学家、技术合伙人,曾获微软学者奖学金、ACM SIGMM China 最佳博士论文奖、ACM Multimedia 最佳开源项目奖、北京市科技新星计划创新新星等荣誉,并六次获得国际学术竞赛冠军。
潘滢炜,现任智象未来(HiDream.ai)算法科学家、技术合伙人,曾获微软学者奖学金、ACM SIGMM China 最佳博士论文奖、ACM Multimedia 最佳开源项目奖、北京市科技新星计划创新新星等荣誉,并六次获得国际学术竞赛冠军。
2026年,人工智能的叙事正在经历一次根本性的转向。主角从“大语言模型”变为了“世界模型”——AI的目标正从预测下一个Token变为“预测下一个状态”,这一本质差异决定了性能工程范式需要重构。
通往世界模型的技术路径,必须首先跨越让AI真正“看见”世界这道门槛。然而传统多模态模型本质上是“单模态拼接”,每一次跨模块传递都在损耗信息。这样的模型无法建立一个统一的、物理世界意义上的“状态”认知。
智象选择了一条不同路径:自研的UiT(Unified Transformer)原生全模态架构,它将图像像素、文本Token、视频、3D和动作等原始信号统一映射至共享表征空间,各个模态不单独编码,而是统一 tokenization,端到端地在同一套网络里完成。
本次演讲将立足智象原生全模态架构的实践,系统分享在模型设计、训练范式与推理架构等维度的思考。同时,也将深度探讨,从原生全模态迈向世界模型,技术演进的下一个决定性变量是什么?



微信咨询

电话咨询
领取往期热门演讲视频

