随着大模型进入教育核心链路,AI 系统不再只是若干模型和工具的串接,而逐步演变为一个持续感知、决策、执行、反馈的闭环控制系统。在教育业务核心场景中,面对 500+ 引擎、单应用上百节点、流式/非流式混合交互、跨云弹性扩缩和授权一致性等挑战,我们自研了WISH平台,将 Agent 调度、FaaS、引擎托管、权限管理、监控与扩缩容整合为统一运行时。
演讲将重点分享:如何用图灵完备的编排平台承接复杂 DAG、如何用节点状态机和消息驱动调度支撑混合交互、如何在工程上平衡“稳定流水线”与“局部闭环纠偏”、如何借助 CRDT、Distro 和 P2P 镜像分发解决分布式授权、水平扩展与大模型快速部署问题。我们也会讨论一个核心判断:在 Agent 系统里,决定上限的不只是模型能力,调度、工具、权限、记忆与监控这些 harness 设计同样关键。
演讲摘要:
- 为什么 AI 平台必须从”能力串联”升级为”自闭环系统”
- AI 应用从”单能力、短链路、短会话”演变为”多能力、复杂 DAG、长会话”
- 大模型并没有消灭系统工程,反而把 Observe / Orient / Act 的工程问题全部暴露出来
- 在复杂业务里,决定系统表现的往往不只是模型,而是整个运行时如何让系统更快感知、更快纠偏、更快恢复
- WISH平台的核心定位:不是一个画布,而是 Agent 时代的运行时底座
- 对标编程语言与 IDE 的设计思路:变量、分支、循环、子工作流、异常处理
- 为什么“harness 和模型同等重要”:调度、工具、权限、记忆、监控共同决定系统上限
- 不是所有问题都应该交给自由 Agent:教育场景更需要“稳定流水线 + 局部闭环纠偏”的混合架构
- 编排与调度:如何支撑复杂 DAG 的高效执行与调试
- 调度器内核:节点状态机设计(未调度→预备→就绪→执行→已执行)
- 基于消息驱动的数据传递:统一处理流式与非流式混合场景
- FaaS 落地:代码执行与调度解耦、命名空间隔离、字节码缓存、依赖管理
- 一个关键经验:循环速度比单次“完美决策”更重要,系统必须优先保证可观测、可调试、可回退
- 服务托管与治理:如何把数百个引擎纳入统一框架
- 统一托管框架:一次编写、无限次托管,启动自检 + 崩溃现场自动收集
- 结构化 action space 的工程价值:节点、工具、工作流比“代码即动作”更适合权限控制、审计和治理
- 负载均衡基础假设失效时的应对:基于授权限流的最大空闲调度策略
- 分布式授权精准控制:基于 CRDT PN-Counter 的无冲突并发解决方案
- 基于 Distro 协议的自组织集群:让水平扩展真正具备工程可行性
- 高并发下再小概率的事件也一定会发生:记一次高并发复杂场景下的踩坑经历——内存复用导致的请求串乱
- 高性能基础上的又一次性能飞跃:如何让服务发现性能翻倍
- 混合云弹性与线上稳定性:Agent 系统不能只会做题,还要能活在生产环境里
- 多云自动化构建、发布与扩缩容系统设计
- 基于 P2P 的高速镜像分发(提速 20 倍以上)
- 精准监控与应急三板斧:重启、迁移、扩容
- 从“人工盯系统”到“系统自我感知和自我恢复”的演进
- 未来规划:从运行时走向更严格的 Agent 基础设施
- 以整个AI链路为单位的整体弹性伸缩
- 工作流描述语言WDL的形式化与严格化验证
- “拉”模式大展身手,跳出复杂分布式授权的天花板
听众收益:
- 对于教育超复杂场景下,Agent运行与调度的清晰认知
- 对于Agent的能力边界认知
- 对于Agent时代下,对于底层AI基础设施超高要求的复杂度认知