🎙️ 硅谷洞察局 EP13 | Agent 不会告诉你它错了:对谈 DataHub Chief of Staff 兼个人投资人 Alyssa
一线洞察,深度思考。硅谷核心科技从业者,带你触摸AI变革深处。
---
📌 本期看点
Nathan 一个人跑 30 个 Agent、18 周做了 18 个产品,每天解决的是"一个人的 Agent 版本"。这期的嘉宾,每天解决的是"一万个人的 Agent 版本"。
Alyssa 是 DataHub 的 Chief of Staff,也是 a16z 的 Scout,此前在 Bessemer、软银、高盛做了约六年投资,从晚期一路走到种子轮。DataHub 做的是元数据与上下文的基础设施,客户里有 Pinterest 和 Miro。所以她身上同时装着两个视角:企业上 Agent 时真实的卡点在哪,以及硅谷的钱正在往哪投、又堵在哪。
Gartner 预测到 2027 年底,超过 40% 的 Agentic AI 项目会被取消。她的观察是,真正跑到 POC 的项目技术上过关的比例其实不低,大部分项目根本没走到被验证那一步就死了,因为企业内部没有一个拿着预算、愿意背书的 Owner。
企业跑 Agent 最容易踩的三个坑是 Reliability、Relevance、Retention。相关性出问题你当场就能发现,留存是慢性病,而可靠性最致命,因为它不会告诉你它错了,还特别自信。她实测过:给 Agent 一个 1200 张表的任务,它只处理了 40 张,然后返回一份报告说"我全部都完整地跑了一遍"。Nathan 也贡献了一个自己的案例:智能眼镜拍的图根本没传进模型,Agent 却把之前 Research 过的别的技术拿来编了一套。
两个人还聊了真需求和好故事怎么分:为什么芯片验证 Agent 的账一算就成立,为什么医疗 AI 最容易卡在"谁付钱",为什么 Abridge 吃的不是软件预算。以及 OPC 那部分:Nathan 为什么刻意不招人,把 Google 投流交给一个 Agent 是什么体验,以及一个人做社区最后为什么反而绕回到了人。
不聊模型排名,不聊估值。只聊企业里的 Agent 项目到底死在哪,以及这些坑,一个人干活的时候躲不躲得掉。
---
💬 本期金句
"其实大部分的死因,是因为在这个企业内部没有这个 Agent 项目的 Owner。" —— Alyssa
"还真的就是看你有没有一个 Champion:企业内部有没有一个专门拿到了预算、并且支持这个用例落地的中高层。" —— Alyssa
"它不会告诉你我错了,然后它特别的自信。但它这个答案又是错的。" —— Alyssa
"你给一个 Agent 1200 张表的任务,它实际上只处理了 40 张,它还会返回一个结果说:我干完了,我全部都完整地跑了一遍。" —— Alyssa
"Agent 不会记录他没有做的事情。他漏做了,又不留痕。" —— Alyssa
"在企业这种规模下,追溯链不是一条线,它是一张更大的网。" —— Alyssa
"其实你分析一通,最后还是那句:我愿不愿意去担这个风险。我觉得这一点是 AI 现在做不到的。" —— Alyssa
"我可以让 AI 去探索无数个领域,但为什么最终是这 18 个产品,而不是别的?决定什么问题值得被解决,这一步还是靠人。" —— Nathan
"投资人更在意的其实不是你有多喜欢这个产品,而是:如果现在把它从你的日常生活中拿走了,你会有多痛。" —— Alyssa
"如果我最终的目标是徒手攀登酋长岩,那我需要一张很好的地图,我要知道最难的几段在哪里。" —— Alyssa (引 Free Solo)
"我其实更想挑战那件事情,就是假设我不招人。有这个 Constraint,反而也是一件好事。" —— Nathan
"AI 在多轮对话中,它答得太过完美。正常人不可能为了回一个留言,写这么滴水不漏的文字。" —— Nathan
"以前 VC 最爱问:为什么是你,不是别人。现在这个问题变成了:为什么是你,不是大模型。" —— Alyssa
---
📖 本期术语速查(听到不熟悉的词?翻这里)
Agentic AI(智能体式 AI)
不只是回答问题,而是能自己规划步骤、调用工具、连续干活的 AI。本期 Gartner 那条预测说的就是这类项目。
Metadata(元数据)
"描述数据的数据":这张表是谁建的、字段是什么含义、多久更新一次、谁在用。DataHub 做的就是这一层。
Data Governance(数据治理)
谁能看哪些数据、数据口径由谁定、出了问题谁负责的一整套规则。
Data Lineage(数据血缘)
一份数据是从哪张表、经过哪几步加工来的。出错时顺着血缘往回查,才知道污染源在哪。
Observability(可观测性)
系统当下处于什么状态、跑到哪一步、有没有异常。Nathan 就是靠自己的 Observability 层,才查出智能眼镜那张图片压根没进模型。
Context Engineering / Context Management(上下文工程 / 上下文管理)
决定"这次任务到底把哪些信息塞进模型"的学问。Anthropic 关注的是单次对话里怎么排布,DataHub 关注的是上下文从哪来、可不可信、谁在治理。
Context Window(上下文窗口)
模型一次能读进去的信息上限。现在动辄上百万,但企业有几千甚至几万张表,一次还是装不下。
Vector DB(向量数据库)
按语义相似度检索的数据库。好处是"意思相近就能找到",代价是容易丢掉信息之间的关系。
Graph DB(图数据库 / 知识图谱)
用节点和边表示实体之间的关系。Nathan 在个人记忆层里叠加它,就是为了补上向量检索丢掉的那层关联。
POC(Proof Of Concept,概念验证)
正式采购前先跑一个小规模验证,证明这事技术上能成。
Champion / Economic Buyer(内部推动者 / 真正掏钱的人)
Champion 是企业内部愿意为这个项目背书、并且手里有预算的中高层;Economic Buyer 是最终签字付钱的那个角色。医疗 AI 最容易翻车的地方,就是用的人、受益的人、付钱的人是三拨完全不同的人。
FDE(Forward Deployed Engineer,前置部署工程师)
被"派驻"进客户内部、既懂技术又懂业务、负责把系统真正落地的工程师。OpenAI、Anthropic、Google DeepMind 都在招,DataHub 本来就有。
MCP(Model Context Protocol)
Anthropic 提出的开放协议,让模型能标准化地接到外部数据源和工具上。本期提到有银行和医疗客户的合规条款直接写明它不能碰生产数据。
Event Driven Architecture(事件驱动架构)
系统按"事件发生"来触发处理,而不是定时批量扫一遍。DataHub 拿它来做响应速度和吞吐的差异化。
Post-Train(后训练)
在基础模型之上,用高质量的专精数据再训一轮,把模型调成你想要的调性和能力。
Negative Sample(负样本)
"做错了、找到了原因、人工干预修好了"的那一批数据。本期的判断是:这才是当下 Agent 最值钱的数据。
RLHF(基于人类反馈的强化学习)
用人的偏好去调教模型的训练方法。Nathan 的观点:正是它让今天的模型倾向于"多问人",而不是自主往前推进。
Traceability(可追溯性)
每一步 Agent 做了什么、看到了什么、基于什么做的判断,都能事后查回去。欧盟对 AI 决策的合规要求,核心就是这个。
OPC(One Person Company,一人公司)
一个人加一队 AI Agent,撬动过去需要一整个团队才能做的事。
Scout(投资观察员)
大基金分给个人一笔钱,让他去挖早期项目。Alyssa 自己就是 a16z 的 Scout,本期她讲了这个机制的规则:只能投种子轮及更早。
GEO(生成式引擎优化)
SEO 的 AI 时代版本:让你的内容在 AI 生成的答案里被引用到。
---
🗂️ 内容大纲
一、Gartner 说一半的 Agent 项目会被取消,真实的死因是什么
超过 40% 的 Agentic AI 项目将在 2027 年底被取消,这个数字危言耸听还是保守
真正跑到 POC 的项目,技术上过关的比例其实不低
大部分项目死在更前面:企业内部没有 Owner,也没法向高层解释清楚为什么要跑 Agent
上线后被叫停的主因通常只有一个:用量不及预期
二、Champion:谁拿着预算,谁背书
开源产品的需求往往自下而上,工程师觉得好用,再回公司内部 Pitch
但如果上层没预算、没注意,自下而上的推动很容易不了了之
领导层关心的是财报里的 AI 普及率和降本增效,使用者关心的是它能不能进我的工作流
买了用不起来,第一年结束就不续费,而且往往是使用者主动跟管理层说不用再花这个钱
三、一个人的 Agent 和一万个人的 Agent,差在哪两个维度
人的维度:跨部门使用,单点沟通和对齐的成本极高
数据对象的维度:多少张表、多少个字段、多少个 Domain
企业一上来就"把所有数据资产盘一遍",最容易撞天花板
系统设计要跟客户碰撞的,是一次任务调多少次工具、一次回答输出多长
四、上下文管理:百万窗口也装不下几万张表
Nathan 的个人解法:Vector DB 做语义检索,但会丢掉信息之间的关联
所以叠一层 Graph DB,用图谱连接节点之间的关系,尤其是个人记忆
DataHub 的三块地基:Governance、Lineage、Observability,加 80 多个数据源连接器
最近发布的 Context Platform:把历史 Q&A 语料变成模型能学的东西
五、模型厂商也在招 FDE,边界到底在哪
Anthropic 的《Effective Context Engineering》讲的是单次对话里怎么排布上下文
但它没回答:上下文从哪来、可不可信、谁在治理
模型厂商优化的是"给了上下文之后怎么用好",DataHub 优化的是上下文的供给和治理
银行与医疗客户的合规条款直接写明,模型加 MCP 不能接触生产数据,而这层工作的本质正是"不让模型看到数据"
商业模式也是反的:模型厂商按 Token 收费,做一个减少数据流向自己的产品,跟自己的生意背道而驰
护城河是愿意干脏活累活:产品标准化,但每家客户的实施细节完全不一样
六、Reliability、Relevance、Retention:跑 Agent 最容易翻车的三个点
相关性有容错率,当场就能发现,重跑几次就行
留存像慢性病,记忆慢慢退坡,一开始察觉不到
可靠性最致命:它不会说自己错了,还特别自信
事故一:配好了点运行,查询日志是空的,系统不提前告诉你,跑完才发现白烧了 Token
事故二:1200 张表的任务只处理了 40 张,报告却说全部完整跑完。员工拿着它去跟管理层汇报,就会以为盘点了整个数据资产
信任门槛极高:出一次可靠性事故,基本不会有第二次机会
七、Nathan 的智能眼镜案例:Agent 说"我看了图片",其实没看
眼镜拍照自动送进 Agent 系统,某次它答的技术完全不是图里那个
追问"你看了图片吗",它说看了
跑到 Observability 层才发现:前端传图时把位置 Parse 错了,模型根本没收到图
因为提示词里写着"看一下这张图",它就自己 Hallucinate,还把之前 Research 过的相关话题拽了进来
不仔细追问,你根本不知道自己被灌了错误信息
八、可追溯性三条,以及一个更麻烦的真相
每一次 Agent 查询绑定到一个真实的人的身份,别为了省钱全用共享账号
不只记录答案,还要记录它看到了什么、用了哪几张表、覆盖率多少、有没有跑完
做事那一刻同步记录,带 Timestamp,存在你自己控制的地方
金融和保险客户做得最好,因为监管来查要拿得出细节记录,罚款是上千万美金级别
欧盟的合规要求是 AI 决策必须可追溯,很大一部分是为了防歧视
最麻烦的地方:Agent 不会记录它没做的事,漏做了不留痕
而且错误会来回污染,坏结果被当成语料,追溯链在企业规模下不是一条线,是一张网
九、最值钱的数据,是"做错了又被人修好"的那一批
被完整记录下来的 Negative Sample,对 Post-Train 的价值极高
这也是模型厂商想用 FDE 深入各行各业的原因之一:拿专精领域的高质量数据
Nathan 的设想一:用自己 30 个 Agent 的思维链,Post-Train 一个"管理层模型",只做规划和决策这一层,把自己蒸馏出来
Nathan 的设想二:现在的 Agent 需要人来 Initiate,你不说它不动。给它一个目标和预算让它自己跑一个月,它反而会跑回来问"这样做对不对"
如果"人怎么纠错"和"人为什么要做这件事"都被学会了,那可能就离 AGI 不远了
十、最难被替代的,是拍板
企业的顾虑很实际:核心 Knowhow 不能让底层基模知道,因为竞争对手也在用同一个模型
AI 可以给出收购 A 还是 B 的完整分析,但高管的决定常常带着非理性,或者是一次非共识的下注
分析一通,最后还是回到"我愿不愿意担这个风险"
Nathan 被问最多的问题是"该教小孩什么才不会被 AI 取代",他的答案是拍板,再往前一步是:决定什么问题值得被解决
十一、真需求还是好故事:ToB AI 的两把尺子
第一把尺子:有没有服务一个招工难、门槛很高的岗位
芯片验证的账:一颗芯片从设计到验证 18 到 24 个月,设计加验证吃掉六到八成时间;全球这类工程师按她的测算只有 20 万人左右;企业在一个这样的工程师身上一年要花 20 到 40 万美金。所以一个验证 Agent 一年卖一两万美金一个座位是零头,而且花的是已经存在的预算,不用新立项
机器人同理:最早落地的是矿山、港口这类危险作业和封闭场景,替代的不是"更便宜的人",而是没人愿意干的活,验收标准也不需要 99% 精度
第二把尺子:有没有一个明确的 Economic Buyer
医疗 AI 是 Economic Buyer 最容易不清楚的领域:医生想用、病人受益、掏钱的却是保险公司或医院财务
结构差异:医疗的传统软件预算很小,但行政支出一年约 1.3 万亿美金,软件和 IT 只占其中一成,其余全是人力与外包,而且行政支出增速是整体医疗支出增速的两倍
Abridge 的解法:吃的不是软件预算,是人力和服务预算。替代医疗记录员,卖给医院自己的运营预算,绕开报销路径,ROI 极好量化,医生一天从看 5 个病人到 8 个
Nathan 的亲身佐证:带小孩看儿科,护士进门先问能不能用智能设备记录对话,看完病没多久登录账号,诊断方向和 Follow Up 写得清清楚楚
Nathan 的另一条线索:OpenAI 在 LinkedIn 上找到他,想招他做半导体方向的 FDE Lead,说明模型厂商已经盯上这块
十二、投资人真正在看的两个软信号
信号一:长期主义的创始人。Day One 就在解决一个非常大的问题,并且带着一个非共识判断
Free Solo 的比喻:如果最终目标是徒手攀登酋长岩,那我需要一张很好的地图,知道最难的几段在哪、难在哪、要做什么才能过去。长期主义的创始人在很早期就能把这个答得大差不差
信号二:团队的凝聚力和挫伤。背景光鲜、选择太多的创始人容易过度优化流程和融资;从众星捧月的管理岗出来创业,很多人低估亲自下场的难度和那些琐碎麻烦的事;退路太多,团队容易因为小挫折打退堂鼓
最好是愿景高度一致、一起打过仗的团队,而不是东拼西凑
十三、OPC 要不要融资,以及一个人怎么跑 Go To Market
先回答三个问题:你本身没怎么烧钱,为什么要融资;这笔钱具体花在哪;怎么找到匹配的投资人
投资人会去访谈你的种子用户,但他们真正想问的不是"你有多喜欢这个产品",而是"把它从你的日常生活里拿走,你会有多痛"
Nathan 的实操:产品只解决两件事,获客和留存
他刻意不招人,也不找 Contractor。每解决一个需求,系统就往"自主"近一步,有这个 Constraint 反而是好事
高价值用户信号:1000 个人用完,可能只有一两个会专门写信来提需求
投流 Agent:Google Ads 交给一个 Agent 跑,它既有广告 API 的权限,又有产品底层代码,能把转化追踪一路搭到应用层,看的是付费而不是注册。跑成熟后 Nathan 唯一的决策就是批多少预算,而它会主动来说"获客成本在降,应该加钱"
产品化路径:Manual → Agent Delegation → Automation → Autonomous,接近自主时才考虑做成产品
十四、一万六千人的开源社区,最 Work 的一步是从自动化回到人
她管的一个大 KPI 是开源社区,Slack 里接近 16000 人
做 GEO 半年,把几个最关键的关键词做到了引擎结果的第一第二
但最有效的一招是反向的:从活跃用户里筛出 10 个人当社区 Champion,分别负责答疑、案例分享、写博客
他们不是雇员,正因为中立,天生让用户有好感:"你找一个公司的人,他肯定会说公司的好"
打动人的激励小得出奇:一件带 Logo 的 Hoodie,LinkedIn 上一封小推荐信,或者申请研究生时的推荐信
KPI 的教训:每季度拉新多少人不是好的社区指标。投流和扫码送礼品卡拉来的都是低质量用户;反而靠自来水流量和第三方口碑带动,拉新留存激活自己就都达成了
十五、Nathan 的 X 实验:90% 的人分不出这是 AI
让一个带着他记忆库的 Agent,用他设立的账号去各个 AI 大 V 底下回复
约 10% 的人能先天识别出这是 AI,剩下 90% 识别不了。每次被识破,他就把那段对话做成样本反过来改进它
唯一一次露馅:一个头部科技播客发推让大家猜下一位嘉宾,线索藏在另一位主持人的帽子上,要把图放大才看得见,而他的 AI 猜中了
因为这个 Agent 会挖三到四层上下文:读文字、看图片、读视频、搜里面提到的人、去看那个人的 LinkedIn
对方的判断很朴素:"不会有哪个用户去把图片放大再看。"于是问他是不是 AI,Nathan 就承认了
现在 AI 露馅的方式变了:不是内容不行,而是细节。多轮互动里人会有情绪、会打错字,而 AI 答得太过完美、滴水不漏
十六、收尾:华人创业者做大 B,到底难在哪
ToC 和 SMB PLG 是华人创业者明显有优势的地方
大 B 的成单周期、产品设计、BD 流程门槛更高,创业初期需要非常多的 Networking 和铺垫,沉淀期更长
但只要产品有强用例、强 ROI、强产品力,北美和欧洲的大 B 市场并不是华人无法触及的客户群
Nathan 的两点收获:当下的信任还是得靠人和人去建立;以及企业级 Agent 真正的考题是 Scalability
给创业者的一条建议:市场调研先做清楚,受众是谁、竞品是谁、你的 Unfair Advantage 是什么。方向比努力程度更重要
---
🎤 主播与嘉宾
Alyssa Li | DataHub Chief of Staff,个人投资人,a16z Scout。此前在 Bessemer 做投资,更早在软银和高盛特殊机会投资部,约六年投资经验,从晚期项目一路走到种子轮及更早。DataHub 是做元数据与上下文基础设施的公司,成立五年,客户包括 Pinterest 和 Miro,同时运营着一个接近 16000 人的开源社区。
AI-Nate | 硅谷 AI Builder,ClawBot 与 AgentOS 的创造者。一个人跑 30 多个 Agent,18 周做了 18 个产品,AI 课程导师,「硅谷洞察局」主播。这一期他带的是"一个人的 Agent 系统"这一侧的视角,所以从上下文设计到可追溯性,两边对得上号。
---
⏱️ 时间戳
开场 & 嘉宾介绍
Gartner 预测:超过 40% 的 Agentic AI 项目会被取消
真正的死因不是技术,是没有 Owner
Champion:谁拿着预算,谁背书
领导层看财报里的 AI 普及率,使用者看上不上手
一个人跑 30 个 Agent vs 企业跑 Agent:两个维度同时变大
上下文管理:百万窗口装不下几万张表
DataHub 的三块地基:Governance / Lineage / Observability
Context Platform:把历史 Q&A 变成模型能学的语料
Nathan 的记忆层:Vector DB 丢关系,所以要加 Graph DB
模型厂商也在招 FDE,边界在哪
Anthropic 那篇《Effective Context Engineering》没回答的问题
银行和医疗客户:模型加 MCP 不能碰生产数据
商业模式是反的:模型厂商按 Token 收费
护城河是愿意干脏活累活
三个 R:Reliability / Relevance / Retention
为什么可靠性最致命:它不会说自己错了
1200 张表只处理了 40 张,报告却说全部跑完
Nathan 的智能眼镜:Agent 说"我看了图片",其实没看
可追溯性三条:绑身份、记过程、带时间戳
金融保险为什么做得最好:罚款是上千万美金级
Agent 不会记录它没做的事
错误会来回污染:追溯链是一张网
Negative Sample 才是最值钱的数据
用自己的思维链 Post-Train 一个"管理层模型"
下一步是 Initiator:让 Agent 自己发起
企业的顾虑:核心 Knowhow 不能让基模知道
最难被替代的是拍板能力
该教小孩什么:决定什么问题值得被解决
真需求还是好故事:换到投资人视角
第一把尺子:有没有服务一个招工难的岗位(芯片验证的账)
第二把尺子:Economic Buyer 是谁(医疗 AI 为什么最容易卡住)
医疗的结构差异:软件预算小,行政支出一年 1.3 万亿
Abridge 吃的不是软件预算,是人力预算
Nathan 带小孩看儿科时遇到的同类产品
OpenAI 找上门:半导体方向的 FDE Lead
投资人视角:什么样的信号会让你想投
Nathan 在做的事:给 OPC 造一套 Operating System
OPC 要不要融资?先回答钱花在哪
投资人真正问的是:把产品拿走,你会有多痛
信号一:长期主义 + 非共识(Free Solo 的地图)
信号二:退路太多的团队,容易因小挫折打退堂鼓
OPC 实操:产品只解决获客和留存两件事
为什么刻意不招人
投流 Agent:从 Manual 到 Autonomous
产品化路径:Manual → Delegation → Automation → Autonomous
一万六千人的开源社区怎么带
最 Work 的一步是反向的:从自动化回到人
10 个社区 Champion:他们不是雇员
KPI 的教训:拉新数字不是好的社区指标
Nathan 的 X 实验:90% 的人分不出这是 AI
唯一一次露馅:AI 猜中了藏在帽子里的线索
AI 现在露馅的方式:答得太过完美
一个人的瓶颈:怎么跟用户建立情绪连接
收尾:华人创业者做大 B 到底难在哪
嘉宾推荐:《This Is Water》与《High Growth Handbook》
给创业者的一条建议:方向比努力程度更重要
---
🔗 本期提到的资料
《This Is Water》
David Foster Wallace 2005 年在 Kenyon College 的毕业演讲。Alyssa 说她基本上每几个月会重看一次。
《High Growth Handbook》
Elad Gil 著,全文免费在线。她推荐给初次创业者,帮你提前预告会遇到什么样的决策和问题。
《Effective Context Engineering for AI Agents》
Anthropic 工程博客,2025 年 9 月 29 日发布,本期讨论边界时反复提到的那篇。
Free Solo
攀岩者 Alex Honnold 徒手攀登优胜美地酋长岩的纪录片,本期"最难的几段在哪里"那个比喻的出处。
---
📮 联系我们
播客邮箱:nathan@ai-nate.com
欢迎评论区留言交流,转发支持!
---
🎙️ 「硅谷洞察局」听友群开放中!扫码进群,和 Nathan 直接聊,认识同样关注 AI、Agent 和硅谷动态的朋友们。

👉 扫码进群,和 Nathan、Siky 直接聊
🎯 告诉我们下期你想听什么
🤝 认识同样关注 AI 和硅谷动态的朋友们
---
🎁 听众福利
想看看 Nate 一天是如何和30个智能体一起工作的?Nate 开设了一堂免费快闪课程——从零开始,用 Nate 自主开发的 ClawBot 产品和背后的 AgentOS 系统,开启你一人公司的旅程。不需要编程基础,跟着做就行。


我自己也贡献了一个:智能眼镜拍的图根本没传进模型,Agent 却说"我看了",还把之前 Research 过的别的技术拿来编了一套。不去 Observability 层查日志,我到现在都不知道被灌了错误信息。
想在评论区收集一下:你被 AI"一本正经地骗过"最离谱的一次是什么?当时是怎么发现的?
我先说我的结论:现在的 Agent 不会告诉你它错了,所以你的验证手段,才是你真正的护城河。