跳到正文
非凡资本

访谈与对话 / UNIQUERESEARCH

当两家顶尖公司做出完全相反的判断,AI记忆的终局在哪里?

AI行业观察

“文本记忆会被模型吃掉”:两家做记忆基础设施的公司,押注了两个相反的未来


"拼到最后,拼的是'判断力'——该记住什么、该忘记什么、该不该信。"


Memory,是这半年 AI 圈最热的词之一,但 “memory 到底是什么” ,行业都还没达成共识。

在非凡大赏一场关于智能体记忆的圆桌上,盛大孵化的 EverMind、硅谷创业公司 Memories.ai、网络安全公司万径安全、教育科技公司世纪天鸿,四位嘉宾从底层技术到垂直场景,把这件事聊得很透。最有意思的地方不是大家达成了共识,而是两家做记忆基础设施的公司,做出了两个方向完全相反的判断 —— 而这背后,藏着一个所有做 “AI 基础设施” 的人都该想清楚的问题:你做的这层东西,会不会被模型自己吃掉?


一个大胆判断:文本记忆,终将被模型吃掉

Memories.ai 创始人沈俊潇,前 Meta 研究科学家,两年前就想清楚了一件事:文本记忆这件事,最终会被模型本身覆盖掉。

他的逻辑是这样的:三年前 ChatGPT 刚出来时,行业对 memory 的理解就是 “加一层 RAG”;后来 MemGPT(后来的 Letta)开始探索 personal memory;再到最近的 OpenClaw、Claude Code,做法已经变成了纯 Markdown 的 index file system—— 本质上就是给模型一个图书馆索引,告诉它所有东西在哪,让它自己去找。这条演化路径的驱动力,不是 memory 技术本身进步了,而是模型的上下文越来越长、能力越来越强。换句话说,你在模型之上搭的那层 memory 系统(“agent harness”),会随着模型变强而越来越薄。

当两家顶尖公司做出完全相反的判断,AI记忆的终局在哪里? · 原文图片 1

"如果这个判断成立,那对一家想做 '基础设施' 而非 '应用' 的公司来说,把宝押在文本记忆上是危险的 —— 这一层会不断被模型本身蚕食,而且做得好的往往不是基础设施公司,是真正懂业务的应用方。"

所以 Memories.ai 从第一天起就没做文本记忆,而是 all in 视觉记忆。理由很直接:视频不是大模型的原生输入,信息熵极高,必须先经过压缩、编码,变成结构化信息,模型才能理解和调用 —— 这一层足够 “基础设施”,而且不会随业务变化而变薄。两年时间,他们把视频编码从十个 embedding 压缩到一个 embedding,编码成本降了至少 100 倍,存储成本降了至少 50 倍,现在 1000 小时视频的存储成本只要 20 块钱,编码成本只要 100 美金。他们还和高通、英伟达做了战略合作,可以把编码模型直接部署在本地摄像头或终端,视频本身不上云,只有脱敏后的结构化信息进入云端的 “视频数据湖”。沈俊潇把这套定位成 physical AI 的第一步:机器人不是 physical AI 落地的起点,让 AI 先通过摄像头看懂真实世界,才是。


另一种赌注:干脆把 “通用记忆” 这件事做透

EverMind 走的是完全相反的路 —— 他们赌的恰恰是 “通用记忆” 这件事能被做出来,而且文本、结构化数据这条路还远没有走到头。

背后的公司是盛大集团,COO韩云芸的逻辑带一点哲学色彩:他们把智能拆成推理和记忆两个模块,推理对应 “逻辑性智能”,记忆对应 “主体性智能”。两年前盛大就发布过一份关于长期记忆的白皮书,预判智能体会成为 AI 最好的应用场景 —— 这个预判在今天被验证了。

当两家顶尖公司做出完全相反的判断,AI记忆的终局在哪里? · 原文图片 2

EverMind 的做法是自下而上搭一个四层架构:最底层是 interface 层,负责接收各种异构数据;往上是 memory 层,把 raw data 结构化,支持增删改查;再往上是 index 层,专门解决召回的准确率、时延和成本问题,为此还专门训练了模型;最上层是 agent 层,对接应用,并且刻意留出自定义空间,靠开源社区反哺 use case。这套体系已经孵化出好几个产品:开源框架 EverOs 破万星;把 memory 和十万个 skill 打包成完整 harness 的 Raven,发布三天破千星,并且已经能做到代码级重写、跟随使用不断优化调用路径;面向没有编程能力的普通用户的 Everme。最新的动作是把 “推理” 也整合进了记忆系统,做到了 400 步推理过程中 memory 的持续更新 —— 这意味着长链任务里 agent 不会中途 “失忆”,不需要从头再来。

"沈俊潇和韩云芸私下认识,彼此评价对方 '选了一条很有价值的路'—— 但两条路的分野说明,memory 这个赛道现在还远没有到收敛的阶段,谁在赌模型的天花板,谁在赌模型的地板,决定了完全不同的产品和商业模式。"


真正的痛点,不在模型聪不聪明,而在敢不敢信

如果说两家基础设施公司在辩论 “该造什么”,那两家做垂直场景应用的嘉宾,揭示的是为什么这些漂亮的记忆架构,到了真实业务里全都不够用。

网络安全公司万径安全的司红星讲了一个很扎心的现实:他们的客户是电力、能源、金融等这类国家关键基础设施单位,数据必须离线部署,不能用 Claude、GPT-5.6 这类最强模型,只能用 27B 级别的开源小模型。模型能力不够,执行长链任务时极容易陷入 “自旋”—— 反复调用一个工具却跳不出来,甚至开始产生幻觉。解决办法是做了一套反思和自旋检测机制:一旦检测到异常,强制中断,去记忆库里检索 “历史上是否遇到过类似问题”,把过去的经验重新注入上下文,再继续跑。记忆本身还有打分机制,从关联度、时效性、用户偏好等八个维度给每条记忆打分,越陈旧的记忆权重越低,召回时按权重加权。

当两家顶尖公司做出完全相反的判断,AI记忆的终局在哪里? · 原文图片 3

"他坦白:agent 目前还没有在网络安全一线真正普及,大部分还停留在实验室阶段 —— 原因不是技术不行,而是这类客户 '不允许试错',一旦 agent 做错决定关掉某个外网接口,可能直接影响居民用电用水。在容错率极低的行业里,记忆系统的核心价值不是 '更聪明',而是 '更可控'。"

世纪天鸿的张民松从教育场景给出了几乎同构的答案。他把 AI 在教学里的应用瓶颈归纳成两个词:边界和可信度;边界,是指教学的顺序性和阶段性不能被打破 —— 同一道题,三年级只能用算术方法解,不能提前用一元一次方程,哪怕后者 “更聪明”,在教学场景里也是超纲,是错误答案。可信度,是指内容合规性和学科准确性,合规性也是一个教育伦理的要求。而学科准确性上,模型普遍呈现 “高年级不如低年级、文科不如理科” 的分布规律 —— 比如数学学科小学阶段基本可用,初中就容易出错,到了高中基本 “面目全非”。他们的解法,目前是把内容边界作为约束直接注入记忆层,并且靠自己三十年积累的底层内容去降低模型输出的方差,而不是光依赖模型自身的能力。

当两家顶尖公司做出完全相反的判断,AI记忆的终局在哪里? · 原文图片 4


拼到最后,拼的是 “判断力” 这一层

把四位嘉宾的判断拼在一起会发现,这场关于 memory 的讨论,表面在争论 “记忆该怎么存、该用 RAG 还是 Markdown”,但真正的分歧和价值,其实都落在了同一件事上:该记住什么、该忘记什么、该不该信 —— 这个判断本身,才是稀缺的东西。

沈俊潇判断的是 “文本这层判断该交给业务方,基础设施该往视觉这类模型还够不着的领域走”;韩云芸判断的是 “通用记忆架构本身就值得被做出来,而且可以反过来让推理和记忆协同进化”;司红星的判断力体现在 “什么时候该强制打断 agent、去哪找类似经验”;张民松的判断力体现在 “这道题现在能不能教、这句话能不能说”。模型的推理能力越来越强、越来越便宜,几乎已经是行业共识,但谁来告诉模型 “这件事上你该谦虚一点、那件事上你该固执一点”,才是 memory 这个赛道真正在抢的位置。


更多对话细节

Speakers|嘉宾

EverMind COO 韩云芸

万径安全 创始人&董事长 司红星

Memories.ai CEO 沈俊潇

山东大学&世纪天鸿 特聘研究员 & AI负责人 张民松

Host |主持人

非凡资本 合伙人 赵亮Abner

当两家顶尖公司做出完全相反的判断,AI记忆的终局在哪里? · 原文图片 5

赵亮:今天的主题是智能体如何形成持续的上下文,也就是关于智能体 memory 的话题,最近热度非常高。我们请到了四位来自不同领域的嘉宾。第一个环节请四位嘉宾分别做简单自我介绍,每人一到两分钟,介绍公司的产品、服务和对象。

韩云芸:大家好,我来自盛大集团。盛大从三年前开始 all in AI,在做自己的 AI 业务孵化。目前我和搭档亚峰老师主要负责跟 AI memory 相关的团队。最近也在启动 memory 和reasoning两块技术的结合。盛大从脑科学视角,把人的智能分为推理和记忆两个大的模块,最近两个团队也在做一些并轨的工作。我们的产品主要是 EverOS、Raven 和 EverMe,欢迎大家去官网和 Github 查看,最近EverOS 已经过万星了,感谢大家的支持。

司红星:大家好,我是万径安全司红星。我们公司主要做网络安全,to 大 B,并且是超级大 B。客户主要是国家关键基础设施单位,在网络安全这一块有刚需的,像电力、能源、金融、运营商等等。我们主要的愿景和使命是用 AI 来完成网络攻击和网络防护的智能化改造。推出的 AI 产品,一个是 MemorFit,还有一个是基于 AI 的底座上面,自研了一门新的开发语言,也就是为网络安全而生的一个 DSL。基于这个开发语言再叠加 AI 的大脑,共同实现整个智能化攻防。在记忆层面,我们在工作过程中,或者说在 agent 构造过程中,发现记忆是非常非常重要的一个点。今天很开心能来这跟大家一块探讨关于记忆的事情。

沈俊潇:大家好,我叫沈俊潇,是 Memories.ai 的创始人兼 CEO。之前是 Meta 的研究科学家,团队大部分其实都是从 Meta 和 Meta Superintelligence Lab 出来的。我们是一家硅谷的初创公司,主要面对的客户是有很多摄像头或者有很多视频数据的公司。我们自己做的是视觉记忆,跟文本记忆不一样,文本记忆是建立在大量文字数据上面,我们是建立在大量视觉数据、视频数据上面。我们做的是把视频怎样能够变成 AI 能够理解的结构化信息,让 AI 和 agent 能够去调用。大家可以把我们想象成视频版的 Snowflake,把视频转成视频数据湖,然后在视频数据库上做三个事情:一个是 get insights,第二个是 build agent workflows,第三个就是做 data curation 去训练 models。这个就是我们做的视觉记忆。

赵亮:Memories 刚刚成立不久?

沈俊潇:没错,成立了一年半,在硅谷拿了一千多万美金的融资。

赵亮:非常年轻的创业者。你们现在跟高通、英伟达、微软都有战略合作,之前 Microsoft Build 上面微软 CEO 讲话的时候,你们的 logo 就在他身后。

沈俊潇:对。

张民松:大家好,我是世纪天鸿的 AI 负责人张民松,同时在山东大学做一些数学模型的应用探索。世纪天鸿是一家做了三十多年的老牌教辅上市公司,沉淀了海量的内容。我们从2023年开始探索 AI +教育的场景,陆续推出了像小鸿助教类似的一些 AI 产品,主要围绕着教、学、研、评场景去赋能学校。今天很高兴能在这跟大家做交流分享。

赵亮:张总其实也是互联网人出身,一直做技术,后来转型到教育赛道,开始深耕教育场景的 AI 应用。好,感谢四位嘉宾的介绍。今天四位嘉宾里,EverMind 和 Memories 是做底层技术创新的,司总和张总是做场景里 AI 应用的,都非常关注智能体 memory 的话题。所以几位嘉宾可以从不同角度一起聊聊 memory。

Memory 到底应该怎样被定义?

赵亮:第一个问题我想问沈总,因为从 Memories 这个名字来说,第一个问题就要向您请教。现在市场上大家对 memory 的定义还是有比较大的差异。有的人认为是超长的上下文,可能就是 memory,内嵌到大模型本身。也有人认为是要一个外部独立的架构,一个 memory layer 单独存在。也有人认为需要混合架构。从沈总您的角度,memory 到底应该怎样被定义,它需要这样被分层定义吗?

沈俊潇:我们当时在 Meta,其实就是 Meta 眼镜后面那个个人助手后面的多模态 memory。当时我们对 memory 的定义跟现在已经非常不一样了。那是三年多前,ChatGPT 刚出来的时候,后面出了一个 MemGPT,那个公司后面变成了 Letta,也是硅谷的一家创业公司。他们当时一开始对 AI memory 的定义其实就是 AI 加一层 RAG,那个就是当时的 memory。再到后面慢慢演变成怎样做 personal memory,再到后面的 OpenClaw,personal memory 从 RAG 变成了纯 Markdown 的 index file system。但在那之前,那些 memory 都是用来做 personalization 的,包括 Memories 那些 memory 都是用来做 personalization 的。但后面随着 self-improving agent 的产生,memory 开始用来做 self-improving 了。

所以我觉得目前大家对 memory 的定义其实有两个作用,第一个是用来做 personalization,第二个是用来做 self-improving。当然我说的这个 memory 更多是对 agent 本身的 memory。其他的 memory 还有比如企业的 memory,特别有代表性的一个公司叫 Glean,美国的一家创业公司,已经是一家独角兽了。他们把企业的数据全部变成向量数据库,转成企业的知识库,去给 agent 调用。所以 memory 是一个很大的概念,分企业里面的 agent memory、个人的 agent memory、agent 自身的 memory 和让他去 improving memory。剩下的就是我们做视觉记忆的 memory,视觉记忆就是给未来 physical AI 用的 memory。所以 memory 本身很大,其中有各种各样的商业路径和 business model。

赵亮:跟三年前相比已经有了非常大的变化和演进。

沈俊潇:对,这些变化其实来源于模型变得越来越强了。以前需要通过很多 RAG 的方式让 memory 变得更好,现在随着模型上下文越来越长,agent 能力越来越强,很多时候可能只需要把 indexing,就是 Markdown 这些 file system 给整理好就行,给他一个图书馆,告诉他所有东西都在哪里,他就能自己找到。虽然很耗 token,但准确性越来越高。所以后面延伸出来像 OpenClaw、Claude Code,都是用纯 Markdown 的方式组织 memory。但如果记忆越来越多,比如企业记忆越来越多,可能还是要有一个混合架构,就是 Markdown 文件形式加上 RAG 的形式。文件形式很好 token,很准确,但很耗 token;RAG 不好 token,是一个 spectrum,越 agent 就越耗 token,但越准,也可能越耗时间。RAG 非常快,纯 retrieval base,但不一定能做特别 general、特别 generic,可能没有那么准。所以一般来说,现在大家都会利用一个混合的 RAG 加上 Markdown 的方式,去做 agent personal memory。

Memory 为什么重要?EverMind 的初衷与定位

赵亮:第二个问题想请教韩总,memory 为什么重要。EverMind 的背景非常有意思,是盛大孵化的公司,陈天桥最近非常关注底层科学技术创新,包括脑神经科学、AI for science 等领域。所以成立 EverMind 的初衷是什么?EverMind 对自己的定位是怎样的?基于您对 memory 为什么重要的理解,请韩总分享。

韩云芸:我刚加入盛大时,是天桥脑科学研究院数据事业部的总经理,一开始职责在脑科学这块。陈总主要投资两个板块,一个是脑科学相关,一个是人工智能相关。我们做这两件事有同一个出发点:科技还是为人服务的。古希腊有一句话叫"人是万物的尺度",我们关注的是这种“丈量”的原理和方法。盛大做脑科学,是用技术帮助人类发现人脑的奥秘和人类智能的奥秘;做 AI 是希望 AI 帮助人类探索认知的边界,帮我们的认知做外延。我们做的是发现式智能,而不是生成式智能。生成式智能可能在替代人做的一些工作,但我们认为 AI 更大的潜能是帮助人类做目前还做不到的事情。

回到记忆这件事,我们认为记忆是人的智能的另一个侧面。相对于推理做的是某种逻辑性智能,记忆做的是主体性智能。未来的世界,在 AGI 到来之后,应该是人、AI 和世界三方交互的世界。所以我们希望用最好的资源去构建AGI 到来之前帮助人做好准备的一切工作,推动智能的演进从记忆这个维度推进。大概两年前,盛大发了一个关于长期记忆的白皮书,里面就预测到两年后的今天,智能体可能是 AI 最好的交互方式或应用场景。所以我们在那个时候就开始构建面向 agent memory 的所有基础设施。

EverMind 团队做的第一件事,是在内部帮助孵化的 AI 应用构建 memory 层,包括大家现在知道的 Tanka,是我们做的 AI native 企业协作平台。我们帮助这个复杂场景处理 memory,里面有 user memory、agent memory、group memory,有人的协作、人和 agent 的协作,甚至后面会有 agent 之间的协作,这些复杂场景下的 memory 处理。我们通过这样的方式找到未来给 agent 提供 memory 的各种范式和通用性在哪里,然后在底层用技术帮助 agent 更好地往前演进。这是我们做 memory 的脉络。跟 Memories.ai 有不同出发点,但最后殊途同归。两年后的今天,memory 果然成为了行业热点,但从这件事变得越来越重要的逻辑上,在业内大家是能够预见到的——对LLM的使用深度和复杂度越高,记忆的价值越显著;LLM应用走过回合制聊天阶段,进入任务执行阶段,于是memory的价值浮上水面。

我们还认为 memory 跟 LLM 是站在一个垂直线上的事情。LLM 构建的是一种通用智能,无所不知的智能,客观世界的智能。但 memory 构建的是一种有主体性的智能——也就是站在个体/组织视角对世界的“丈量”和收敛。最近AI领域一个比较热的赛道是世界模型,我们也做模型,我们做的这个模型可以类比为一种“人格模型”,是在基于你有一定主体性的基础之上去自进化的智能。

网络安全场景:为什么 memory 特别重要?

赵亮:接下来回到两个场景方的公司,先请教司总。网络安全领域有非常多复杂决策和超长上下文,你们推出 AI 智能体时也面临共同的问题。结合你们的场景,为什么 memory 特别重要?对于你们整个行业来说,最大的痛点是什么?

司红星:网络安全主要一个特点就是任务比较长,天然的长链任务。不像用 ChatGPT 或 Claude Code 去做一些日常生成 PPT 什么的。比如企业被攻击了,只有一条线索,要从各种日志里把所有任务跑通,各种网关、防火墙,各种日志都过来,可能有几个 G 的文件要分析,要调好多步。这种长链任务里如果没有记忆去管理,是没法做到的。

我们的记忆体现在三个方面:一个是短期在对话上下文里注入的临时记忆;一种是中长期的任务记忆,因为一次长链任务里涉及很多次 prompt 输入,任务里也需要从长期记忆里拉东西回来;还有就是长期记忆,是企业资产。网络安全一般都是团队作战,不是个人的。无论攻击还是防护,团队里个人的经验怎样被有效储存下来。比如一次溯源过程中,一个人发现很典型的经验,这个攻击者组织属于哪个国家,背景是什么,这就是一条很典型记忆。这个人发现了,怎样让另外一个人进来原生地引用过去。记忆的共享也是一个问题。这些都导致网络安全的 agent 天然需要结构化记忆的管理,不是简简单单一次任务、一次会话就没了,那样感觉很浪费。

赵亮:这是整个行业面临的痛点,还是万径安全发现的?

司红星:从网络安全行业肯定都需要,蛮通用的。无论攻击还是防护,无论网络安全行业还是金融什么,只要长链的高复杂度任务里,都需要记忆的标准化管理。但网络安全行业还比较落后,毕竟跟 C 端比应该说你比较先进。

我说落后是因为我们的客户都是国家关键基础设施单位,他们不会犯错,不允许试错,只允许小范围试错,不会允许大范围直接还没验证就开始上。因为牵涉到记忆的安全性,还有 agent 的安全性。如果 agent 做出错误决定,把外网某个接口关了,可能大家交电费都交不上,都要断水断电,这种就比较严重。所以 agent 还没有在真实一线很普及,现在都处在实验室阶段。

教育场景对 memory 的差异化需求

赵亮:接下来请教张总,世纪天鸿最近推出了教育赛道的 AI agent 小鸿助教。在 memory 这一层,教育场景对 memory 的要求或需求,跟其他场景有什么差异化?现在用大模型自己的 memory 能力,能不能完全覆盖你们目前的需求?

张民松:从技术上说实现路径一样,只是应用场景不一样,记忆工程的目的是为了更好决策。教育行业比较特殊,是高度制度化、体系化、组织化的场景,实施者是有明确目的、计划、组织的行为,这样也导致了来自外部决策空间相对其他是有限的,经验的固化程度要高于其他行业。对于模型应用,从学科属性角度我们关心两点:第一个是边界,也就是适用性;第二个是可信度。这两点制约着 AI 深入教育应用的核心瓶颈。 

什么是边界?教育是顺序与渐进的过程,有顺序性和阶段性,什么时候学什么东西是固定的,不能超越也不能落后。比如同一个题,小学三年级两步解决一个未知数,三年级时不能用一元一次方程去解,有些到了五年级或初中可以,不然就是超纲。解决此类问题,我们在底层记忆,不管动态还是静态,注入一些边界约束,像内容应用范围、学科、学段、课标范畴等来限制边界。 

什么是可信度?我们知道模型推理基于概率而非实际逻辑,那么幻觉率只是高低的问题。AI 应用于教学过程,我们凭什么信任它?涉及内容合规性和准确性。像合规性,比如问到一些敏感问题,像南海诸岛属于中国,但凡模型稍微犹豫或给出多余解释,就代表不合规,这是无可辩解、明确的。对于学科内容准确性,目前通用模型输出效果遵循高年级低于低年级、文科优于理科的分布。比如数学学科,小学阶段基本可用,初中特别容易出错,到高中基本就面目全非了。我们解决这个问题,不管记忆还是知识库检索,底层逻辑依靠已经固化的经验,也就是内容,来降低模型输出的方差。这是通用模型在学科领域现在碰到的一些问题,也是我们在探索实践中碰到的问题和解决思路,给大家做参考。

赵亮:听下来教育场景不是单纯追求更聪明,还需要更合规、更准确、更有边界,memory 在当中非常重要。

张民松:对。

为什么 all in 视觉记忆?

赵亮:下一个问题请教沈总。Memories 目前专注在视觉记忆这一块,但现在整个 AI 生态都是围绕文本记忆构建的。视觉记忆跟文本记忆本质上有什么差别?你们为什么 all in 视觉记忆?

沈俊潇:两年前我们做记忆的时候就笃定了一件事:文本记忆最终会被模型覆盖。你在上面做的记忆,文本记忆从某种程度上说就是 agent harness,随着模型能力越来越强,上面那一层会越来越薄。我们既然想做基础设施公司,不想做应用公司,就应该把 core 做好。如果 harness 越来越薄,很难形成 core,所以我们从一开始就不想做文本记忆。文本是大语言模型 native 的 input,随着模型能力越来越强,你在上面能做的 memory system 越来越少,而且那些东西非常业务导向。memory system 非常重要,但把 text memory system 做好的一定是业务方,不是基础设施公司。业务方真正理解业务,agent 要做什么、memory 该怎么存、user memory 怎么管理,他特别了解业务,所以能把那个做好。

所以我们决定要做视觉记忆。虽然现在可能比较早,但视觉是不一样的。人的本身记忆就是视觉。比如上一次去健身房什么时候?昨天见了谁?脑子里第一个出来的不是文字,而是健身房的片段,在片段里再做推理。那个更符合未来视觉模型的发展路径。而且视觉并不是现在大模型 native 的 input,视频是 raw 的,信息熵非常高,里面有很多特别杂的信息。需要通过非常基础的模型技术把视频做压缩,再做 indexing 或 encoding,编码成 AI 能够理解的结构化信息。这一层本身就已经非常基础设施了,而且这一层编码基础设施是不随着业务改变的。

视觉变成视频,变成结构化信息,存在视频数据湖里,也就是视觉记忆里。存在里面,最后要做的就是把搜和找做得足够准。再上面才是业务层。作为一家 infra 公司,我们做的就是怎么把视频更快更好更省地变成结构化数据,以及更快更好更省地,在想要找的时候,从视频数据库里把成千上万小时的视频相关结构化数据,大海捞针一样把相关信息找出来。找出来之后怎么组织,怎么形成 memory,怎么形成 agent 想要的组织层和信息,那是业务层。像我们本身是通过 FDE 的方式给大 B 合作,但我们的 infra 是下面那一层,视频和视频的编码和视频数据湖的这一层。

赵亮:听起来工程上非常复杂。这个事情是多长周期的事情?

沈俊潇:我们已经做了两年,到目前为止都没有特别多看到跟我们做一样事情的公司。我们在上面做了非常多优化。视频编码大家一听就觉得非常重非常贵,但我们的视频编码模型从一开始就走世界模型路线。我们叫 only input,可以输入视频、音频、文字、context,进去之后都变成 embedding 向量。这个模型现在已经能做到一个 embedding,两年前是十个 embedding,现在一个 embedding 已经让整个视频 encoding 成本降了至少一百倍,视频存储成本也至少降了五十倍。这些都是我们两年做的优化。

现在跟企业客户聊,他们说视频很贵、存储很贵、编码很贵。我说不不不,我们已经做了很多优化。现在一千个小时存储成本只有二十块钱,一千个小时编码成本只有一百美金,非常非常便宜。而且高通和英伟达都是战略合作伙伴,已经做了两年合作,所有编码模型都可以放在本地。比如楼里可以有个本地算力中心,甚至所有模型都可以直接放在手机上面。视频不会上云,本地编码完之后,只把结构化信息、去敏的信息上云,在云端形成视频数据湖。

这个事情是我们一直笃定的。我觉得这个时代可能真的是在往 physical AI 过渡。physical AI 来到真实世界的第一步其实并不是机器人,而是让 AI 先通过摄像头理解真实世界,告诉 agent 真实世界现在发生了什么事。比如零售场景,怎么知道今天有多少人来、多少人走、来的是哪些人、有没有偷盗;工厂场景工人做得怎么样;建筑工地等等。这些数据都是去做 physical AI 非常重要的养料。我们现在做的第一步就是先把这些数据放到视频数据湖里,让 AI 通过视频数据湖真正理解真实世界,让这些公司变成 future physical AI first company。

赵亮:感觉再聊下去又延伸到世界模型 physical AI 这个话题了,但确实非常息息相关。听下来沈总他们做的事情也是一个 heavy duty 的工作。

EverMind 的通用记忆架构与商业模式

赵亮:其实 EverMind,陈天桥也一直希望解决一些 heavy duty 的事情。包括 EverMind 可能很类似,跟 Memories 都是采用类脑的架构。这个问题想请教韩总,咱们这个架构是面向通用型的记忆架构,还是针对某一场景的?另外关于智能体 memory 的商业模式,您觉得将来会是什么样的?

韩云芸:刚才沈总分享了很多真知灼见,我们早就认识。沈总选择了一条非常有技术价值的路,在硅谷有很好的口碑,得到很多客户认可验证。从 EverMind 来讲,我们恰好选择另外一条路,试图去构建通用的 memory。这个非常难定义,就像沈总讲的,每一个搭建 agent 的个人或企业,都有自己对 memory 的理解和需求,五花八门,要抽象出来有很大难度。但我们恰恰有条件提前去面对这个挑战。

我们分几个阶段来做。第一个阶段从内部几个应用共性出发抽象处理记忆的架构,内部有做健康的、做未来预测的、做企业协作的。把共性抽象出来。去年开源发布时,先定义了四层结构,有类脑的启发在里面。底层是 interface,就像人的五感。先把大量数据——context、本地化数据、异构数据湖数据、流式数据(各种应用不断流进来的数据)——把这个 interface 定义出来,然后给到 AI。内部再有一个 memory 层,把 raw data 变成更结构化的记忆,这个记忆有增删改查更新的机制。再往上定义成 index 层,方便提取。所有记忆最后要面向 agent 去召回,召回的准确率、时延、成本,都是使用当中大家会有体感的。所以在记忆召回效率上做了很多事情,甚至后来专门做了模型,做了MSA(稀疏注意力机制)。再往上做了 agent 层,试图跟应用层握手。这一层主要做两件事:一是定义各种 agent 开发和应用当中可能会用到 memory 的各种方式和接口;另外留下充分自定义空间,主动暴露出来,让别人通过自己的二开、自定义更好地反向使用我们的能力。通过开源方式我们跟很多开发者和客户共建 use case,不断完善更通用的 memory infra,在这套架构基础上,我们在公认的benchmark上把召回准确率做到SOTA,延迟和成本降到最低(LLM full-context的1/10),并且把通过模型层创新把上下文扩展到100M。并且这些工作都通过严谨的学术论文发表和开源工作分享出来,陆续在今年的业界顶会ACL和KDD得到Oral Presentation的邀请。这是第一步。

第二步围绕重点行业和重点场景,基于memory提供让客户或开发者社区更有使用体感的价值。一周多前刚刚发布了 Raven,是一个完整的memory-native的harness。我们发现只做 memory,要让别人充分使用 memory 能力,开发者还要做大量工作,还要调研各种 agent 框架,自己整合各种 skill 和 tool;并且其他harness框架本身也会限制memory能力的发挥。后来我们下决心干脆做一套更好的harness。我们做了全市场包括自研的所有 skill 测评,经过测评验收、数据对比,选了将近十万个 skill 做了 skill hub,封装到跟 memory 一起的 harness 里。这个 harness 叫 Raven,渡鸦的意思,名称取自北欧神话里象征memory和mind的两只raven,大概三天左右超过一千星了,目前我们全都是先做开源,再做商业化支持。Raven 已经能够做到代码级的重写,可以随着使用优化调用路径,包括 skill 可以更新,甚至可以在部分代码上做重写和更新。

再后来还做了更加 to C 的应用。我们发现有些用户在 AI 领域还是新人,没那么强能力动手 coding,本地跑 agent 也有难度。我们围绕 Memory Hub 构建了to C 的应用叫 EverMe。后面很多能力也会整合上来。像刚才司总提到的长链 memory 管理,我们现在在做推理和 memory 的整合,面向长链。本身 memory 支持长链任务管理,包括多 agent 协作下 memory 的隔离和共享,我们都做了,但仍然不够。我们发现用户大多情况是边推理边更新 memory,所以把内部做的、之前行业称为"推理小钢炮"的deep research智能体整合进 Raven。后面大家用 Raven 时它是自带推理能力的,在推理能力基础上把 memory 跟它做协同。我们在推理这块做到了四百步推理的 memory 持续更新。这样的场景下,做信息密度比较高、持续时间比较长的任务时,可以持续不掉线,不会中间再从头“培训”。这是Raven随着用户迭代自我迭代的过程

再后面近期也会发布 memory 上更多的动作。当一个企业或重度知识工作者,不断把工作场景交付给 agent 时,他的知识需要在整个系统里沉淀,也会不断有更多产出可以被别人共享。他可以把整个 agent 能力共享给别人,我们要支撑这类用户去带领整个 agent 使用体验往前迭代。围绕这个目标做了整个端到端的自进化引擎,叫 context model。从 model 层到 agent 交互层到 to C 层面,实现了整体的数据飞轮。用户可以在整个系统生态内不仅围绕 memory 搭建 agent,还可以在使用过程中迭代 agent,还可以进一步把迭代好的 agent 分享给别人使用,成为可以商业化的 agent。

MemorFit 的独创性架构设计

赵亮:谢谢韩总。接下来跟司总聊一下,你们也很有开源精神,司总在开源社区有一个项目 Yak 也有一万多星了,做得非常好。你们也推出了 AI agent MemorFit。聊聊 MemorFit 做了哪些独创性的架构设计来解决特定问题,在 memory 这一层有没有做独特设计,区别于传统 RAG 架构?

司红星:网络安全行业还是有自己的特殊性,我们基本上都是离线部署的。对关键设备设施来说,所有数据都不允许出网。离线部署场景里没办法用到最强的模型,像 Claude、GPT-5.6、o1、o3 肯定没法用。包括国内的 DeepSeek V4 pro、Qwen 3.1/3.7 max,虽然开源,但离线部署一个团队去使用,要驱动这么大模型建一个数据中心,对安全团队不现实。所以总的来讲都是离线部署,结果造成大部分使用的模型都是 27B 的。没那么强,执行长链条任务时就会面临很多自旋,一直在调,一个工具一直调陷进去出不来。它也能调,但为了完成任务开始有幻觉,不停地做。这时就需要有反思和自旋检测的机制。检测到有这样行为时,要强制跳出来。跳出来第一步就是去检索记忆,看看历史上有没有遇到过相似问题,之前怎么解决的,再重新注入一次上下文,强制反思跳出来去做。这是一个很大的不同点。

第二个是过程中记忆的产生,一边工作一边产生,这没问题。涉及什么东西值得被记下来,而不是把整个任务全怼进去。我们做了一个外部的观察者模型,当陷入自旋或沉淀到一条经验时,提取出来一个 JSON 格式的记忆条。这一条做了一个打分机制,叫 callback 模型,从八个维度——关联度、时效性、情感编号偏好、用户偏好、实践性等七八个维度,让 AI 给它打分。有些记忆很久以前,时间过期了,召回时就往后排一排,也会有一个权重,召回时加权计算记忆怎么样。下一次执行时动态注入这个记忆来完成目标任务。这是 MemorFit 里跟传统 harness 不太一样的一个点。大家也可以去下载使用,里面都是网络安全的攻防工具,叫 MemorFit.ai。

教育场景里,哪些该记住、哪些该淡忘?

赵亮:谢谢司总。刚才司总提到 agent 里面涉及该记录什么、该淡忘什么。教育场景同样有这样的问题。请教张老师,教育场景里,我们担心学生和老师大量使用 AI 工具后,有没有可能起到反向作用,最后限制了学生发展。去年的教学方法今年可能就不适用了。在 memory 在教育场景里,哪些该记住、哪些该淡忘,边界由谁来定?面临这样一些具体问题,请张老师分享。

张民松:这个问题我换个维度回答。教育场景不单单从技术上去考虑,也要考虑教育的基本逻辑。教育是闭环的过程,学习也是闭环的过程,有输入就得有反馈。看校内产品,现在大部分学校都在提倡和落地精准教学的概念,本质上是以数据驱动的教学评一体化,通过追踪、记录、分析学生学习过程数据来为教学做决策,也是教学从“经验驱动”转向“数据驱动的改革。 

大部分校外学习型产品其实也遵循测学练评的学习闭环。这都涉及评价,学生评价是衡量教育质量的重要指标之一。有了评价就有了诊断,有了诊断就有了改进,那么这个闭环对学习型的教育智能体也适用,通过这个闭环,整个记忆的更新和解耦逻辑就会变得非常清晰,如果没有这个闭环数据的反馈,那都是预设。 这就是我认为教育场景下 Agent Memory 设计的核心准则。仅供参考。

来源:非凡产研 · 腾讯新闻。文章中的“非凡产研”是原始发布账号署名,不代表已核实个人执笔作者。引用访谈或圆桌观点时,应按正文标明具体发言人及当时身份;无法确认时不要推断。日期为原始发表日期,历史信息以发布时点为准。

阅读原始发布版本 ↗
← 返回研究文章库