当前服务机器人普遍存在任务链路割裂、Agent 决策不可控、环境记忆弱、具身技能难复用、业务闭环缺失等落地难题。多数系统能够完成导航、问答、巡检或抓取的单点演示,但很难支撑“理解用户意图 - 找到目标地点 - 感知现场 - 调用执行技能 - 验证结果 - 上报业务系统”的完整服务任务。
本次分享以酒店服务机器人为落地样例,介绍一套 Agent Harness + 原子 Skills 的服务机器人架构。系统由上层 Agent 负责意图理解、任务规划和技能编排,由 Harness 统一封装环境观测、状态门控、技能调用、执行反馈、自动验证和人工接管;巡检、语义导航、设施检查、靠近观察、物品抓取、递送和异常上报被抽象为可组合、可度量、可复盘、可演化的原子 Skills。算法层面结合 LLM/VLM、语义地图、任务图/行为树、工具调用,以及 LoRA 微调的 VLA/策略模型,支撑长时序导航 + 检查 + 操作一体化任务。
整套方案将服务机器人从“模块堆叠式 demo”升级为“Agent 可操作的物理世界接口”,可复用于酒店、养老、医院、园区、商场、办公楼等服务场景,为具身智能从 PoC 走向可运营系统提供可复制工程路径。
演讲提纲
- 开篇:服务机器人行业现状与 Agent 化落地痛点
- AGI 视角下服务机器人产业价值:从单点自动化走向可执行复杂任务的具身智能体。
- 当前服务机器人规模化落地核心瓶颈:
- 无法稳定完成长时序导航 + 感知 + 操作 + 上报复合任务。
- 环境感知缺少长效语义记忆,地点、设施、物体和业务状态无法统一表达。
- 多模态模型、ROS 导航、机械臂技能和业务系统之间缺少统一调度层。
- 大模型可以理解意图,但缺少真实机器人执行边界和安全约束。
- 案例引入:以酒店服务机器人为样例,拆解接待问询、路线引导、夜间巡检、设施检查、异常上报、物品取放与递送任务。
- 整体解决方案选型:Agent Harness + 原子 Skills 架构
- Agent 层:负责自然语言理解、任务拆解、技能选择、失败恢复和人工接管判断。
- Harness 层:封装环境观测、状态机/行为树、安全门控、技能执行、结果验证和日志记录。
- Skill 层:将巡检、语义导航、靠近观察、设施检查、抓取、放置、递送、通知上报封装为标准物理 API。
- Policy 层:确定性流程采用 FSM/行为树和工具调用,开放式具身动作接入 LoRA + VLA/策略模型。
- 闭环体系:参考 Environment、Rollout、Verification、Evolution 思路,把真实任务变成可记录、可评分、可复盘、可迭代的机器人 rollout。
- 核心技术细节拆解
- 长时序服务任务策略:
- 将“带我去前台”“检查消火栓”“去桌上取一瓶水”等请求拆解为导航、观察、检查、操作、上报等原子动作序列。
- 通过任务图/行为树管理任务阶段、状态切换、异常恢复和取消机制。
- 在巡检中处理视觉事件、语音指令、小程序指令和业务告警的优先级冲突。
- 机器人双体系内部记忆工程:
- 语义地图记忆:维护前台、电梯口、洗衣房、消火栓、吧台、桌子等地点和设施的可导航位姿。
- 物体/事件记忆:记录遗失物、垃圾、设施异常、服务请求等事件的时间、位置、置信度和处理状态。
- 动态更新机制:结合多帧观测、置信度、时间衰减和人工确认,减少临时物体对语义地图的污染。
- 原子技能库建设:
- 巡检 Skill:路线巡视、低频视觉检测、事件去重、告警投递。
- 检查 Skill:靠近目标、调整视角、OCR/视觉识别、结果回传。
- 操作 Skill:观察目标、靠近拍照、抓取、递送、放置,可接入 VLA/策略模型增强泛化。
- Agent Harness 的安全与验证:
- Agent 不直接控制底盘速度和机械臂关节,只能调用受控 Skill。
- Harness 负责执行前置条件检查、动作互斥、超时处理、失败原因归因和人工接管。
- 酒店服务机器人落地实施方式与效果评估
- 典型任务链路:
- 接待问询:结合门店知识库回答入住、退房、早餐、停车、洗衣房、Wi-Fi、寄存等问题。
- 语义引导:将“带我去前台”“洗衣房在哪里”转换为语义地图查询和导航 Skill。
- 夜间巡检:沿固定路线巡视,发现垃圾、遗失物、消防设施异常后自动分类处理。
- 设施检查:识别消火栓、消防器材、门牌或公共设施后,调用靠近观察与 OCR/视觉检查 Skill。
- 物品服务:组合导航、观察、抓取、递送和确认,完成“去桌上取物”“送到前台”等任务。
- 建议量化指标:
- 语义地点导航成功率、巡检覆盖率、告警到达延迟、设施检查准确率。
- 单次抓取/递送成功率、完整复合任务完成率、人工接管率。
- 任务平均耗时、失败恢复成功率、连续运行稳定性。
- 场景延伸:养老陪护、医院导诊与物品递送、园区巡检、商场导览、办公楼设施检查。
- 落地实践总结与行业演进方向
- Agent Harness 的价值:把真实机器人硬件、环境状态、业务系统和大模型能力组织成可控闭环。
- 原子 Skills 的价值:把一次性 demo 拆成可复用、可组合、可验证、可演化的具身能力。
- 未来技术演进路线:更强的长时序 Agent 规划、更轻量的端侧 VLA/世界模型、更动态的语义记忆、更自动化的 rollout 验证和策略演化。
- 商业化方向:从酒店 PoC 扩展到多服务场景,通过共享技能库和场景记忆模板降低复制成本。
实践痛点
- 长时序任务编排与安全边界难统一
- 服务任务步骤多、上下文长、异常分支复杂,既不能只靠固定脚本,也不能让大模型直接控制底盘、机械臂、门禁、电梯或安全停止。实际系统必须融合 Agent 推理、任务图/行为树、状态门控、权限控制和人工接管,把高层决策限制在受控 Skill 调用内。
- 动态语义记忆难以稳定维护
- 服务场景中的地点、设施、物体和事件持续变化,语义地图不能只是静态坐标表。系统需要维护“地点 - 可达位姿 - 物体/设施 - 最近观测 - 置信度 - 处理状态”的关联关系,并处理动态物体、遮挡、重复识别、临时摆放带来的记忆污染、检索延迟和错误导航。
- 原子技能泛化与稳定性难兼顾
- Skill 太粗会变成不可解释黑盒,失败后难以定位;Skill 太细又会导致 Agent 编排复杂、任务链路过长。抓取、靠近观察、设施检查、放置和递送还会受到光照、反光、深度噪声、外参偏差、人流干扰和底盘微动影响,需要传统控制、视觉伺服、VLA/策略模型和后置验证协同。
- Rollout 数据闭环与商业化复制成本高
- 机器人要持续变好,必须记录每次任务的输入意图、环境观测、技能调用、执行轨迹、失败原因和业务结果,但真实场景日志涉及隐私、存储、标注、回放、评估和模型迭代。不同场景的业务规则、空间布局、设施类型和服务流程差异也会带来部署、调试、平台对接和售后运维压力。
听众收益
- 掌握服务机器人 Agent Harness 落地方案:完整理解从 Agent 规划、Harness 状态门控、原子 Skills、语义记忆到 rollout 验证的系统架构,可复用于自有服务机器人项目。
- 获取真实服务场景的工程拆解方法:清楚知道酒店机器人在接待问询、语义引导、夜间巡检、设施检查、异常上报、物品取放与递送中的任务链路和技术边界。
- 理解 LLM/VLM、VLA/策略模型与传统机器人系统的协同方式:知道哪些环节适合大模型推理,哪些环节必须由 FSM/行为树、安全控制和受控 Skill 承担。
- 获得语义地图和动态记忆的设计思路:掌握如何把自然语言地点、设施、物体、事件和可达位姿组织成 Agent 可查询、可执行的环境记忆。
- 学习具身技能工程化避坑经验:了解任务抢占、事件风暴、模型冷启动、外参误差、深度噪声、动态物体污染、人工接管和失败恢复等高频问题。
- 理清服务机器人商业化复制路径:理解如何从酒店 PoC 扩展到养老、医院、园区、商场和办公楼等场景,通过共享 Harness、技能库和评估指标降低规模化落地成本。