2026 年上半年,AI 行业出现了一个新共识:模型能力够了,但模型不认识用户。OpenAI / Anthropic / Google 同时上线持久记忆,Letta / Mem0 / Zep / Hark 四家创业公司合计吸金 $110M+——记忆正在从大模型的可选配件,变成独立的基础设施层。与此同时,Apple M 系列芯片、NVIDIA RTX Spark 和 Jetson Thor 的发布,使消费级设备首次具备了本地运行多模态大模型的能力。
本次分享以端侧多模态记忆层的工程实践为主线,拆解模型自研、推理架构重造、知识图谱记忆系统三层技术栈的构建过程,以及在此过程中积累的核心经验——多模型协同调度、异构芯片适配、记忆的结构化存储与语义检索。核心不单讲算法优化,更讲记忆层作为一种新基础设施的工程解法。
演讲提纲
- AI 缺了一层基础设施
- Context Window 的物理极限:百万 token 能塞进去,但塞进去 ≠ 记住。Mem0 的 benchmark 数据:选择性检索 ~7000 token 准确率 91.6%,full-context 方案需要 26000+ token 且分数更低——效率才是瓶颈,不是容量
- Agent 都失忆:每次对话都是重新认识用户,缺跨会话的持久状态。这只是产品体验问题,更深层是一个架构缺失——在 Model 和 Agent 之间,没有一层负责「理解用户」
- 端侧多模态记忆层的工程挑战
- 多模型协同的资源竞争:消费级设备上同时跑 LLM、VLM、ALM、Embedding 四类模型,每一项都在争内存和算力。瓶颈不是单个模型跑不动,是调度策略跟不上——先加载谁、后释放谁、并行度开多少,决策差一档延迟就差数倍
- 多模态数据的联合理解:视频的人物/场景/动作、音频的对话/环境音/情绪、图片的语义——这三种信号在云端有充分的算力预算做独立处理再关联,但在端侧必须共享资源。工程上的核心问题:哪些计算可以复用、哪些必须独立、合并后精度损失多少可接受
- 记忆的结构化 vs 存储的扁平化:文件系统是扁平的,但记忆是结构化的——人物关系会变、偏好会演化、信息有重要和不重要的区别。把多模态数据转化为可推理的知识图谱,本质是一个持续的语义提取和关系维护问题,不是一次性的索引构建
- 全链路协同的长尾效应:模型训练 → 量化压缩 → 芯片适配 → 推理部署 → 记忆构建 → Agent 集成——每个环节的偏差都会向下传导,单点调优往往制造链路瓶颈
- 全栈工程实践:模型 → 推理 → 记忆
- 模型层:自研端侧多模态体系
- 行业现状:开源多模态模型在标准 benchmark 上表现优秀,但在真实业务场景中暴露短板——音频模态对噪音/环境音/非标准语音理解不足,视觉模型缺乏对专业影视语言(景别/机位/运动)的理解
- 自研的临界点:当业务数据积累到数 PB 级,继续依赖开源模型的边际收益递减——模型需要理解的不再是「这是一只猫」,而是「这是第三机位拍摄的中景镜头,人物正在从画面右侧移动到左侧」
- 实践案例:Clipto 自研了超过 10 个端侧模型(LLM / VLM / ALM / 多模态 Embedding),通过跨模态冗余消除和并行解码将总内存占用控制在消费级设备可承受范围内
- 推理层:消费级硬件的架构重造
- 不仅是模型量化:量化(INT4/INT8)解决「模型变小」的问题,但推理效率的瓶颈往往在内存布局、算子融合和任务调度——这些需要从推理框架层重做
- 向下兼容的工程代价:确保 M1 / 8GB 设备可运行完整管线,需要动态内存管理、模型分片加载和优先级调度三管齐下
- 异构芯片适配的技术细节:Apple M 系列 NPU/ANE 的算子支持列表、NVIDIA RTX Spark 和 Jetson Thor 的内存带宽与精度格式——每块芯片的适配工作量远超模型训练本身。关键是建立一套跨芯片的统一调度层,让上层模型不感知底层硬件差异
- 记忆层:从存储到知识系统
- 核心理念:文件系统解决「存什么」,RAG 解决「检索文档」,记忆层解决「理解后记住」——知道什么重要、什么变了、什么和什么有关
- 技术路线:多模态理解(人物/场景/语义/情绪)→ 时序知识图谱(关系演变可追溯,时间维度是关键差异)→ 向量化检索(自然语言 → 意图解析 → 多维定位)→ Memory Agent(基于记忆的对话与推理)
- 与业界方案的对比:Letta 做 memory paging(虚拟内存思路),Mem0 做 memory API(中间件思路),Zep 做 temporal graph(图谱思路)——端侧记忆层的独特性在于,不仅要解决「怎么记」,还要在有限算力下同时解决「看懂」和「记对」
- 工程实践中的关键判断与教训
- 2023 年的反共识押注:行业都在抢云端大模型时,基于「端侧算力与模型能力将在 2025-2026 交汇」的判断提前两年布局。这意味着在推理框架、芯片适配、多模态管线的基建上先发,但也意味着要自己趟过生态不成熟期的所有坑
- 什么时候从「调 API」切换到「全栈自研」:不是技术信仰驱动的,是业务数据驱动的——当开源模型在特定模态(含噪音频、长视频理解)的真实表现触碰产品体验底线时,继续依赖外部模型边际收益递减,自研投入陡增但形成长期壁垒
- 模型压缩是一个系统优化问题,不是算法问题:单独做量化掉精度,单独做剪枝可能破坏特定模态理解力,单独做蒸馏可能丢失边缘场景——需要通过 QAT + 稀疏化 + 动态调度的协同设计,在训练阶段一起做
- 记忆层不是升级版 RAG:RAG 从静态文档库检索,默认数据不变;个人记忆是动态的——偏好会变、关系会演化、旧信息会被新信息覆盖。核心能力是时序推理和状态追踪,而不是检索准确率
- 工程化 vs 学术 benchmark 的鸿沟:论文里的端侧推理跑在干净数据集上很漂亮,真实场景中用户数据是异构的、噪声大的、格式乱的——工程化的核心不是刷榜,是极端条件下的鲁棒性
- 核心教训:端侧工程最大的敌人不是算力不够,是管线协同——模型、推理、记忆三层各自优化 10%,凑一起可能负优化。系统效率永远比单点跑分重要。
- 行业对标与工程验证
- 端侧 AI 记忆类产品的行业现状:Rewind.AI 做屏幕录制的本地搜索(capture + retrieval),但理解层较浅;Microsoft Recall 做操作系统级截图记忆,但多模态深度有限;更多工具型产品停留在云端转录和关键词搜索阶段。记忆层的核心分水岭在于:是「记录过去」还是「理解过去并将其变成可运行的认知系统」
- 真实场景的工程验证:在一台 MacBook Pro M5 上,24 小时内完成 2TB 视频素材的索引,本地原生模型输出近亿 token,同等任务云端推理约 $400。这组数据不是单个产品的性能指标,而是端侧推理的成本结构已经可以和云端正面竞争的信号
- 用户数据透露的信号:已积累千万用户,其中付费用户仅约 1/3 是内容创作者,2/3 是金融、法律、医疗等领域的知识工作者。Product Hunt 社区 150+ 条评论中,最高频的关键词是「本地处理」和「记忆」——说明记忆层的需求不是垂直场景,而是一个通用基础设施
- 下一步的技术方向
- 从单机记忆到跨设备记忆网络:用户数据分散在电脑、手机、NAS、云盘,记忆系统需要连接这些数据孤岛而不是另外造一个
- Memory Layer 的标准化:四条创业路线在各自跑,但行业最终需要一个类似数据库 SQL 标准的记忆层接口——Memory API / SDK 化,让任何 Agent 都能接入统一的用户记忆底座
- 云端 Intelligence + 端侧 Memory 的协同架构:不是「本地替代云端」,而是云端模型提供世界知识,端侧模型管理个人记忆,两者互补——这可能是后续 3-5 年的主导架构
听众收益
- 端侧多模态模型的自研与优化:真实场景驱动的模型训练与持续演进
- 消费级 AI 推理系统设计:多模型协同、运行时优化与异构芯片适配
- Memory Layer的架构设计:并非升级版RAG,而是知识图谱、向量检索与 Memory Agent 的协同实现
- 下一代 AI 基础设施演进:Memory Layer 的技术路线与端云协同架构