为什么硅谷开始重新定义「AI 记忆」| S10E20What's Next|科技早知道

为什么硅谷开始重新定义「AI 记忆」| S10E20

57分钟 ·
播放数19292
·
评论数33

就在一个多月前,黄仁勋在 Computex 2026 上发布了英伟达 RTX Spark——第一个面向消费级 PC 的 AI 超算芯片,1 Petaflop 算力、128GB 统一内存,能在笔记本本地跑 120B 甚至 200B 参数的大模型。几乎同一时间,苹果 M5 系列也将端侧 AI 推到了前所未有的高度。硬件就位了,但一个老问题依然存在:如果 AI 助理不记得你是谁、不记得你三年前说过什么,再强的算力也只是个聪明的失忆者。

这期节目的嘉宾是 Clipto.AI 的创始人兼 CEO 康洪文(Henry Kang),他在做一款在端侧本地运行的多模态 AI 产品,能读懂你所有的音视频、图片和文档,并在此基础上构建个人记忆系统。我们一起聊了聊大模型做记忆(memory)的天花板在哪里,为什么端侧比云端更适合承载个人记忆;把云上成熟的 AI 架构搬到端侧,都会遇到什么挑战;以及当苹果、谷歌这样的 OS 巨头自己做记忆层(memory layer)时,一家创业公司凭什么不被碾压。

本期人物

康洪文 Henry, Clipto.AI 创始人兼 CEO

Yaxian,「科技早知道」主播

时间轴

02:12 英伟达 RTX Spark 的突破是什么?

  • 算力与内存双重突破,让本地跑百亿参数模型成为可能

  • OpenAI 就是大型机,端侧助理就像个人PC

04:58 大模型的万亿参数是公域知识的最大似然估计(MLE)

  • 大模型的生态位应是存储世界共识与通识

  • 用万亿参数去做个人知识是“杀鸡用牛刀”

  • 生态中缺一个专门记录和存储个人记忆的 player

09:35 Clipto 在做什么:端侧多模态记忆系统

  • 本地 100% 运行,10 个模型协同将裸数据结构化

  • 上层构建时空对齐的知识记忆系统,支持文本和语音查找

18:16 大模型做记忆的三条路径与共同天花板

  • Context Window、RAG、LoRA 微调都在尝试让模型记住用户

  • 共同问题:都没跳出大模型 MLE 框架,只能提供概率性记忆

  • 无法精确定位到“三年前某天下午和谁聊了什么”这种事实记忆

22:14 数据不等于记忆:坐在金矿上的穷人

  • 每个人都是 data rich 但 memory poor,数据没有被结构化就不叫记忆

  • 只有可查找、可复用、可执行的记忆才是真正的记忆

36:58 云上架构搬到端侧:垂直整合怎么做?

  • 带着云上思维框架看端侧“完全不 work”

  • 从芯片算子优化到算力调度到模型优化到 Agent 搭建,每一步都需要攻克

41:48 Memory layer 苹果和 Google 能做吗?创业公司的机会在哪里?

  • 苹果是硬件设备公司基因,更应搭建好 macOS 生态与第三方合作

  • 集齐“芯片+算力+模型+独立产品运营”,大公司极难发生

  • 谷歌、Meta 诞生第一天都是应用公司,终局是 memory layer 平台

52:06 两年前的预判:算力涨、模型小,两件事必然发生

  • 苹果 M1 已具备 AI 推理能力,摩尔定律指向算力指数级增长

  • 第一个模型最复杂,后续一定有办法优化——模型变小是必然

  • 以终局看可能只做了 1/10,但完整记忆系统已搭建起来

幕后制作

监制:Yaxian

后期:迪卡

运营:George

设计:饭团

商业合作

声动活泼商业化小队,点击链接直达声动商务会客厅,也可发送邮件至 business@shengfm.cn 联系我们。

加入声动活泼

声动活泼正在招聘全职商务运营经理、早咖啡内容实习生和社群实习生,如果你也对播客行业的内容制作感兴趣,欢迎[点击招聘入口](eg76rdcl6g.feishu.cn\)

关于声动活泼

「用声音碰撞世界」,声动活泼致力于为人们提供源源不断的思考养料。

我们还有这些播客:声动早咖啡声东击西吃喝玩乐了不起反潮流俱乐部泡腾 VC商业WHY酱跳进兔子洞不止金钱

欢迎在即刻、微博等社交媒体上与我们互动,搜索 声动活泼 即可找到我们。

期待你给我们写邮件,邮箱地址是:ting@sheng.fm

科技早知道

欢迎扫码添加声小音,在节目之外和我们保持联系。

Special Guest: 康洪文 Henry.

展开Show Notes
Sayhi_bzb
Sayhi_bzb
2026.7.10
嘉宾说的很多目标是行业的一个路径,也是非常困难没有技术共识的路径,说了这么多也都是 surface,理解这不是技术播客,但是听完下来没有什么亮点。更何况万亿模型没能解决的问题还选了端侧这个路径
康洪文henrykang:感谢认真听完整期节目。 我觉得这里有一个容易混淆的地方。今天大家都在谈 AI Memory,但其实讨论的是两类不同的问题。 大模型社区里的 Memory,更多是在解决 Agent 如何保持上下文连续性,让模型更好地推理和完成任务,本质上是 reasoning memory。 我们关注的是另一类问题:如何把一个人或一个团队多年积累的音视频、文档、会议等真实数字资产持续组织成长期可演化的记忆,本质上更接近 persistent memory infrastructure。 所以我们并不是想用端侧模型去替代万亿模型,而是在构建一个长期记忆层。大模型负责理解和推理,Memory Layer 负责组织和管理长期记忆。一个是在给模型增加记忆能力,一个是在构建记忆基础设施。两者是互补关系,而不是同一条技术路线上的竞争。 未来真正的 AI 系统既需要越来越强的模型,也需要越来越完善的长期记忆基础设施。
Sayhi_bzb:我能理解团队是想将用户积累下来的资产转变为更 ai native 的数据结构,如果是这个技术路线的话确实能将模型能力解耦出去只专注系统架构,但这也是最难的地方 比如模型在哪个环节参与,能不能编辑原数字资产,如何避免模型在分类资产时的风格差异...社区里面很多的方案(比如 llmwiki) 看下来也都只是玩具,相信最终能形成共识,但还有很多的工作要补齐
5条回复
别处理
别处理
2026.7.09
我的理解是记忆是激活的数据,可能人脑也有类似的机制,存储着大量数据,大部分都不会被激活,可能在某些特殊情况的刺激下会激活某些记忆
康洪文henrykang:这个理解和我们的判断很接近。 我们也认为,记忆不是简单的数据存储,而是能够在合适场景下被重新激活的知识。绝大多数信息平时都处于”静默”状态,只有当新的问题、任务或线索出现时,相关记忆才会被唤起。 所以 Memory Layer 的价值不只是把内容保存下来,而是持续理解内容、建立关联、判断重要性,并在用户搜索、提问或 Agent 执行任务时,把最相关的记忆主动激活出来。 从这个角度看,Memory 本身不是存储系统,而是”存储 + 组织 + 激活”的完整过程。 我们认为,真正的 AI Memory 也应该具备这样的能力。
阿大萨姆
阿大萨姆
2026.7.10
mem0有个问题就是什么都往记忆塞,什么需要写入,什么需要总结,如何总结,如何建索引,都很靠大模型能力的判断。本地模型是否具备这个能力。而且因为是向量库,比较不好audit,记忆也需要淘汰机制的,低召回的,或者被用户否定的就应该去掉了。不知道嘉宾的项目是如何处理这些的,嘉宾好像一直没提如何写入记忆的部分。
康洪文henrykang:这是一个非常好的问题,也是我们认为 AI Memory 最难、但目前讨论相对较少的部分。 我们一直认为,Memory 最难的不是 Retrieval,而是 Write。 如果什么都写、什么都存,最终得到的不是 Memory,而是越来越大的噪声。 所以我们不认为”把内容都塞进向量库”就是记忆。向量库只是检索的一种实现方式,而不是 Memory 本身。 真正困难的是写入阶段:哪些内容值得保留,哪些应该总结,哪些应该建立实体和事件关系,哪些只是一次性的上下文;以及如何做到可追溯、可审计、可修正,而不是一个不可解释的 embedding。 我们目前更倾向于把记忆组织成具有时间、人物、主题、事件、来源文件和具体 timestamp 等结构化信息,而不是只有向量表示。后续再结合用户反馈、召回情况、时间衰减等信号,持续调整、降权甚至淘汰记忆。 至于本地模型是否有能力完成这些,我们的看法是,不需要让一个模型独立完成所有判断,而是把写入拆成多个不同的任务,由不同模型和规则协同完成。这也是我们一直强调,Memory Layer 更像一个系统工程,而不是一个单一模型。
好重的生意,不好做
哈哈一笑哈哈哈哈:43:43 这个问题回答的好差, 听起来这个生意是等国内厂商收购掉吗?
妙miao猫
妙miao猫
2026.7.10
嘉宾可以说的再深入一点,我觉得没有很完整的解释清楚为什么一定是端侧。
康洪文henrykang:这是个很好的问题,也感谢给我们这个机会进一步阐述和澄清。 我们其实并不认为 AI 一定只能跑在端侧,我们强调的是 Memory 更适合 local-first,而不是 model-first。 原因并不是端侧模型更强,而是 Memory 的位置应该由数据决定,而不是由模型决定。 对个人来说,最重要、最大量、最高频、最隐私的数据,本来就存在设备上,比如视频、录音、会议、相册、文件以及屏幕内容。如果每次都先把这些数据上传到云端,再去构建记忆,不仅会带来隐私、带宽、延迟、存储和 Token 成本的问题,更重要的是,用户的长期记忆变成了云端的一份副本,而不是用户自己持续积累和掌控的资产。 还有一个经常被忽略的原因,是用户的使用门槛和决策成本。 用户本地的数据天然就在这里,不需要做任何选择;但云端不是。用户首先要决定上传哪些数据、同步哪些目录、是否愿意托管自己的长期数据。每增加一步决策,都会增加使用门槛,也会影响最终采用率。 Local-first 的优势,不只是隐私,更是顺应用户天然的数据形态。 用户的数据默认就在本地,Memory 可以直接围绕这些数据持续构建,而不是先要求用户完成一次大规模的数据迁移。 所以我们更倾向于一种架构:Memory 尽量靠近数据,Intelligence 可以根据任务在端侧和云端之间灵活分布。 换句话说,我们并不是主张”端云二选一”,而是希望把数据、记忆和智能解耦。数据和长期记忆尽量留在用户可控制的地方,而推理和智能能力则可以根据不同任务,灵活选择端侧或云端模型。我们认为,这会是更符合长期演进方向的 AI 架构。 最后补充一点,local-first 并不意味着 local-only。 Clipto 本身就是多端协同的,我们同时支持桌面端、Web 和移动端。在用户授权的前提下,不同设备上的 Memory 可以安全地同步和协同工作,为用户提供一致的记忆体验。 所以我们强调的不是”所有能力都必须在一台设备上完成”,而是Memory 应该首先属于用户,而不是首先属于云。 在这个基础上,再通过端云协同,把不同设备连接成一个统一的 Personal Memory,让用户在任何设备上都能访问和延续同一份长期记忆。
阿莱士
阿莱士
2026.7.09
这种比喻mainframe的方式还真的很随意🥲
HD880222x
HD880222x
2026.7.10
26:07 刚开始用 Evernote 的时候,唯一感到惊喜的也只是它是一个云端的存储笔记的地方。之后很多年也都没有什么太大的创新。
Yaxian
:
是,那会儿有个端云同步的功能就觉得好厉害
uaMiXYang
uaMiXYang
2026.7.21
击中痛点 如果能无痛把电脑里散落的非结构化数据结构化已经是解决大事情!!
重八-
重八-
2026.7.18
主持人语速为什么这么快?
谨慎不看好,大模型的商业模式都还没有探索成功。现在谈[memory layer]还是太早。
康洪文henrykang:我理解这种谨慎判断,也同意 AI 行业还有很多商业模式没有完全跑通。 但我们对 Memory Layer 的判断恰恰相反。我们认为,它不是建立在大模型成功之后才需要的能力,而是 Agent 真正进入生产力场景必须补上的一层基础设施。 今天很多 Agent 的瓶颈并不是不会推理,而是不够了解用户。不知道用户有哪些文件、过去讨论过什么、素材在哪里、哪些信息重要,因此很难真正进入长期工作流。 Memory Layer 解决的,就是让 AI 和 Agent 能够持续理解和利用用户长期积累的知识,而不是每次都从零开始。 更重要的是,我们并不是先提出一个基础设施概念,再去寻找应用场景。Clipto 是先从真实产品出发,解决创作者和团队找不到信息、无法复用知识的问题,再逐渐抽象出 Memory Layer 这套能力。我们的判断来自产品实践,而不是概念推演。 所以在我们看来,Memory Layer 不是一个等待未来验证的故事,而是已经在具体场景中开始产生价值,并且随着 Agent 的发展会越来越重要。
内存多少钱啊
Dicaprixin
Dicaprixin
2026.7.08
最近用了clipto的YouTube视频抓取神器,很好用
Yaxian
:
解决了素材搜集的老大难问题
autumnwind
autumnwind
2026.7.10
官网30+种语言 没有简体中文可还行🤔🤔
不会有纯端侧的记忆,毕竟人都有很多个端,需要端+云,背后的本质类似网盘+时序+检索
12:25 电脑讲究吗 苹果 Pc哪个比较好呢
Yaxian
:
目前是只有mac,应该马上有windows了
52:57 别的不说,信心非常足!
花不二物
花不二物
2026.7.08
先沙后学
桐棯
桐棯
2026.7.08
沙发🛋
LLLlll666
LLLlll666
2026.7.08
已学习
先沙发再听