Agent不会告诉你它错了:对谈DataHub Chief of Staff Alyssa硅谷洞察局

Agent不会告诉你它错了:对谈DataHub Chief of Staff Alyssa

101分钟 ·
播放数454
·
评论数1

🎙️ 硅谷洞察局 EP13 | Agent 不会告诉你它错了:对谈 DataHub Chief of Staff 兼个人投资人 Alyssa

一线洞察,深度思考。硅谷核心科技从业者,带你触摸AI变革深处。

---

📌 本期看点

Nathan 一个人跑 30 个 Agent、18 周做了 18 个产品,每天解决的是"一个人的 Agent 版本"。这期的嘉宾,每天解决的是"一万个人的 Agent 版本"。

Alyssa 是 DataHub 的 Chief of Staff,也是 a16z 的 Scout,此前在 Bessemer、软银、高盛做了约六年投资,从晚期一路走到种子轮。DataHub 做的是元数据与上下文的基础设施,客户里有 Pinterest 和 Miro。所以她身上同时装着两个视角:企业上 Agent 时真实的卡点在哪,以及硅谷的钱正在往哪投、又堵在哪。

Gartner 预测到 2027 年底,超过 40% 的 Agentic AI 项目会被取消。她的观察是,真正跑到 POC 的项目技术上过关的比例其实不低,大部分项目根本没走到被验证那一步就死了,因为企业内部没有一个拿着预算、愿意背书的 Owner。

企业跑 Agent 最容易踩的三个坑是 Reliability、Relevance、Retention。相关性出问题你当场就能发现,留存是慢性病,而可靠性最致命,因为它不会告诉你它错了,还特别自信。她实测过:给 Agent 一个 1200 张表的任务,它只处理了 40 张,然后返回一份报告说"我全部都完整地跑了一遍"。Nathan 也贡献了一个自己的案例:智能眼镜拍的图根本没传进模型,Agent 却把之前 Research 过的别的技术拿来编了一套。

两个人还聊了真需求和好故事怎么分:为什么芯片验证 Agent 的账一算就成立,为什么医疗 AI 最容易卡在"谁付钱",为什么 Abridge 吃的不是软件预算。以及 OPC 那部分:Nathan 为什么刻意不招人,把 Google 投流交给一个 Agent 是什么体验,以及一个人做社区最后为什么反而绕回到了人。

不聊模型排名,不聊估值。只聊企业里的 Agent 项目到底死在哪,以及这些坑,一个人干活的时候躲不躲得掉。

---

💬 本期金句

"其实大部分的死因,是因为在这个企业内部没有这个 Agent 项目的 Owner。" —— Alyssa 00:03:42

"还真的就是看你有没有一个 Champion:企业内部有没有一个专门拿到了预算、并且支持这个用例落地的中高层。" —— Alyssa 00:05:10

"它不会告诉你我错了,然后它特别的自信。但它这个答案又是错的。" —— Alyssa 00:25:52

"你给一个 Agent 1200 张表的任务,它实际上只处理了 40 张,它还会返回一个结果说:我干完了,我全部都完整地跑了一遍。" —— Alyssa 00:26:35

"Agent 不会记录他没有做的事情。他漏做了,又不留痕。" —— Alyssa 00:34:34

"在企业这种规模下,追溯链不是一条线,它是一张更大的网。" —— Alyssa 00:34:57

"其实你分析一通,最后还是那句:我愿不愿意去担这个风险。我觉得这一点是 AI 现在做不到的。" —— Alyssa 00:43:20

"我可以让 AI 去探索无数个领域,但为什么最终是这 18 个产品,而不是别的?决定什么问题值得被解决,这一步还是靠人。" —— Nathan 00:44:28

"投资人更在意的其实不是你有多喜欢这个产品,而是:如果现在把它从你的日常生活中拿走了,你会有多痛。" —— Alyssa 01:06:05

"如果我最终的目标是徒手攀登酋长岩,那我需要一张很好的地图,我要知道最难的几段在哪里。" —— Alyssa 01:08:25(引 Free Solo)

"我其实更想挑战那件事情,就是假设我不招人。有这个 Constraint,反而也是一件好事。" —— Nathan 01:11:49

"AI 在多轮对话中,它答得太过完美。正常人不可能为了回一个留言,写这么滴水不漏的文字。" —— Nathan 01:31:51

"以前 VC 最爱问:为什么是你,不是别人。现在这个问题变成了:为什么是你,不是大模型。" —— Alyssa 01:40:13

---

📖 本期术语速查(听到不熟悉的词?翻这里)

Agentic AI(智能体式 AI)

不只是回答问题,而是能自己规划步骤、调用工具、连续干活的 AI。本期 Gartner 那条预测说的就是这类项目。

Metadata(元数据)

"描述数据的数据":这张表是谁建的、字段是什么含义、多久更新一次、谁在用。DataHub 做的就是这一层。

Data Governance(数据治理)

谁能看哪些数据、数据口径由谁定、出了问题谁负责的一整套规则。

Data Lineage(数据血缘)

一份数据是从哪张表、经过哪几步加工来的。出错时顺着血缘往回查,才知道污染源在哪。

Observability(可观测性)

系统当下处于什么状态、跑到哪一步、有没有异常。Nathan 就是靠自己的 Observability 层,才查出智能眼镜那张图片压根没进模型。

Context Engineering / Context Management(上下文工程 / 上下文管理)

决定"这次任务到底把哪些信息塞进模型"的学问。Anthropic 关注的是单次对话里怎么排布,DataHub 关注的是上下文从哪来、可不可信、谁在治理。

Context Window(上下文窗口)

模型一次能读进去的信息上限。现在动辄上百万,但企业有几千甚至几万张表,一次还是装不下。

Vector DB(向量数据库)

按语义相似度检索的数据库。好处是"意思相近就能找到",代价是容易丢掉信息之间的关系。

Graph DB(图数据库 / 知识图谱)

用节点和边表示实体之间的关系。Nathan 在个人记忆层里叠加它,就是为了补上向量检索丢掉的那层关联。

POC(Proof Of Concept,概念验证)

正式采购前先跑一个小规模验证,证明这事技术上能成。

Champion / Economic Buyer(内部推动者 / 真正掏钱的人)

Champion 是企业内部愿意为这个项目背书、并且手里有预算的中高层;Economic Buyer 是最终签字付钱的那个角色。医疗 AI 最容易翻车的地方,就是用的人、受益的人、付钱的人是三拨完全不同的人。

FDE(Forward Deployed Engineer,前置部署工程师)

被"派驻"进客户内部、既懂技术又懂业务、负责把系统真正落地的工程师。OpenAI、Anthropic、Google DeepMind 都在招,DataHub 本来就有。

MCP(Model Context Protocol)

Anthropic 提出的开放协议,让模型能标准化地接到外部数据源和工具上。本期提到有银行和医疗客户的合规条款直接写明它不能碰生产数据。

Event Driven Architecture(事件驱动架构)

系统按"事件发生"来触发处理,而不是定时批量扫一遍。DataHub 拿它来做响应速度和吞吐的差异化。

Post-Train(后训练)

在基础模型之上,用高质量的专精数据再训一轮,把模型调成你想要的调性和能力。

Negative Sample(负样本)

"做错了、找到了原因、人工干预修好了"的那一批数据。本期的判断是:这才是当下 Agent 最值钱的数据。

RLHF(基于人类反馈的强化学习)

用人的偏好去调教模型的训练方法。Nathan 的观点:正是它让今天的模型倾向于"多问人",而不是自主往前推进。

Traceability(可追溯性)

每一步 Agent 做了什么、看到了什么、基于什么做的判断,都能事后查回去。欧盟对 AI 决策的合规要求,核心就是这个。

OPC(One Person Company,一人公司)

一个人加一队 AI Agent,撬动过去需要一整个团队才能做的事。

Scout(投资观察员)

大基金分给个人一笔钱,让他去挖早期项目。Alyssa 自己就是 a16z 的 Scout,本期她讲了这个机制的规则:只能投种子轮及更早。

GEO(生成式引擎优化)

SEO 的 AI 时代版本:让你的内容在 AI 生成的答案里被引用到。

---

🗂️ 内容大纲

一、Gartner 说一半的 Agent 项目会被取消,真实的死因是什么

超过 40% 的 Agentic AI 项目将在 2027 年底被取消,这个数字危言耸听还是保守

真正跑到 POC 的项目,技术上过关的比例其实不低

大部分项目死在更前面:企业内部没有 Owner,也没法向高层解释清楚为什么要跑 Agent

上线后被叫停的主因通常只有一个:用量不及预期

二、Champion:谁拿着预算,谁背书

开源产品的需求往往自下而上,工程师觉得好用,再回公司内部 Pitch

但如果上层没预算、没注意,自下而上的推动很容易不了了之

领导层关心的是财报里的 AI 普及率和降本增效,使用者关心的是它能不能进我的工作流

买了用不起来,第一年结束就不续费,而且往往是使用者主动跟管理层说不用再花这个钱

三、一个人的 Agent 和一万个人的 Agent,差在哪两个维度

人的维度:跨部门使用,单点沟通和对齐的成本极高

数据对象的维度:多少张表、多少个字段、多少个 Domain

企业一上来就"把所有数据资产盘一遍",最容易撞天花板

系统设计要跟客户碰撞的,是一次任务调多少次工具、一次回答输出多长

四、上下文管理:百万窗口也装不下几万张表

Nathan 的个人解法:Vector DB 做语义检索,但会丢掉信息之间的关联

所以叠一层 Graph DB,用图谱连接节点之间的关系,尤其是个人记忆

DataHub 的三块地基:Governance、Lineage、Observability,加 80 多个数据源连接器

最近发布的 Context Platform:把历史 Q&A 语料变成模型能学的东西

五、模型厂商也在招 FDE,边界到底在哪

Anthropic 的《Effective Context Engineering》讲的是单次对话里怎么排布上下文

但它没回答:上下文从哪来、可不可信、谁在治理

模型厂商优化的是"给了上下文之后怎么用好",DataHub 优化的是上下文的供给和治理

银行与医疗客户的合规条款直接写明,模型加 MCP 不能接触生产数据,而这层工作的本质正是"不让模型看到数据"

商业模式也是反的:模型厂商按 Token 收费,做一个减少数据流向自己的产品,跟自己的生意背道而驰

护城河是愿意干脏活累活:产品标准化,但每家客户的实施细节完全不一样

六、Reliability、Relevance、Retention:跑 Agent 最容易翻车的三个点

相关性有容错率,当场就能发现,重跑几次就行

留存像慢性病,记忆慢慢退坡,一开始察觉不到

可靠性最致命:它不会说自己错了,还特别自信

事故一:配好了点运行,查询日志是空的,系统不提前告诉你,跑完才发现白烧了 Token

事故二:1200 张表的任务只处理了 40 张,报告却说全部完整跑完。员工拿着它去跟管理层汇报,就会以为盘点了整个数据资产

信任门槛极高:出一次可靠性事故,基本不会有第二次机会

七、Nathan 的智能眼镜案例:Agent 说"我看了图片",其实没看

眼镜拍照自动送进 Agent 系统,某次它答的技术完全不是图里那个

追问"你看了图片吗",它说看了

跑到 Observability 层才发现:前端传图时把位置 Parse 错了,模型根本没收到图

因为提示词里写着"看一下这张图",它就自己 Hallucinate,还把之前 Research 过的相关话题拽了进来

不仔细追问,你根本不知道自己被灌了错误信息

八、可追溯性三条,以及一个更麻烦的真相

每一次 Agent 查询绑定到一个真实的人的身份,别为了省钱全用共享账号

不只记录答案,还要记录它看到了什么、用了哪几张表、覆盖率多少、有没有跑完

做事那一刻同步记录,带 Timestamp,存在你自己控制的地方

金融和保险客户做得最好,因为监管来查要拿得出细节记录,罚款是上千万美金级别

欧盟的合规要求是 AI 决策必须可追溯,很大一部分是为了防歧视

最麻烦的地方:Agent 不会记录它没做的事,漏做了不留痕

而且错误会来回污染,坏结果被当成语料,追溯链在企业规模下不是一条线,是一张网

九、最值钱的数据,是"做错了又被人修好"的那一批

被完整记录下来的 Negative Sample,对 Post-Train 的价值极高

这也是模型厂商想用 FDE 深入各行各业的原因之一:拿专精领域的高质量数据

Nathan 的设想一:用自己 30 个 Agent 的思维链,Post-Train 一个"管理层模型",只做规划和决策这一层,把自己蒸馏出来

Nathan 的设想二:现在的 Agent 需要人来 Initiate,你不说它不动。给它一个目标和预算让它自己跑一个月,它反而会跑回来问"这样做对不对"

如果"人怎么纠错"和"人为什么要做这件事"都被学会了,那可能就离 AGI 不远了

十、最难被替代的,是拍板

企业的顾虑很实际:核心 Knowhow 不能让底层基模知道,因为竞争对手也在用同一个模型

AI 可以给出收购 A 还是 B 的完整分析,但高管的决定常常带着非理性,或者是一次非共识的下注

分析一通,最后还是回到"我愿不愿意担这个风险"

Nathan 被问最多的问题是"该教小孩什么才不会被 AI 取代",他的答案是拍板,再往前一步是:决定什么问题值得被解决

十一、真需求还是好故事:ToB AI 的两把尺子

第一把尺子:有没有服务一个招工难、门槛很高的岗位

芯片验证的账:一颗芯片从设计到验证 18 到 24 个月,设计加验证吃掉六到八成时间;全球这类工程师按她的测算只有 20 万人左右;企业在一个这样的工程师身上一年要花 20 到 40 万美金。所以一个验证 Agent 一年卖一两万美金一个座位是零头,而且花的是已经存在的预算,不用新立项

机器人同理:最早落地的是矿山、港口这类危险作业和封闭场景,替代的不是"更便宜的人",而是没人愿意干的活,验收标准也不需要 99% 精度

第二把尺子:有没有一个明确的 Economic Buyer

医疗 AI 是 Economic Buyer 最容易不清楚的领域:医生想用、病人受益、掏钱的却是保险公司或医院财务

结构差异:医疗的传统软件预算很小,但行政支出一年约 1.3 万亿美金,软件和 IT 只占其中一成,其余全是人力与外包,而且行政支出增速是整体医疗支出增速的两倍

Abridge 的解法:吃的不是软件预算,是人力和服务预算。替代医疗记录员,卖给医院自己的运营预算,绕开报销路径,ROI 极好量化,医生一天从看 5 个病人到 8 个

Nathan 的亲身佐证:带小孩看儿科,护士进门先问能不能用智能设备记录对话,看完病没多久登录账号,诊断方向和 Follow Up 写得清清楚楚

Nathan 的另一条线索:OpenAI 在 LinkedIn 上找到他,想招他做半导体方向的 FDE Lead,说明模型厂商已经盯上这块

十二、投资人真正在看的两个软信号

信号一:长期主义的创始人。Day One 就在解决一个非常大的问题,并且带着一个非共识判断

Free Solo 的比喻:如果最终目标是徒手攀登酋长岩,那我需要一张很好的地图,知道最难的几段在哪、难在哪、要做什么才能过去。长期主义的创始人在很早期就能把这个答得大差不差

信号二:团队的凝聚力和挫伤。背景光鲜、选择太多的创始人容易过度优化流程和融资;从众星捧月的管理岗出来创业,很多人低估亲自下场的难度和那些琐碎麻烦的事;退路太多,团队容易因为小挫折打退堂鼓

最好是愿景高度一致、一起打过仗的团队,而不是东拼西凑

十三、OPC 要不要融资,以及一个人怎么跑 Go To Market

先回答三个问题:你本身没怎么烧钱,为什么要融资;这笔钱具体花在哪;怎么找到匹配的投资人

投资人会去访谈你的种子用户,但他们真正想问的不是"你有多喜欢这个产品",而是"把它从你的日常生活里拿走,你会有多痛"

Nathan 的实操:产品只解决两件事,获客和留存

他刻意不招人,也不找 Contractor。每解决一个需求,系统就往"自主"近一步,有这个 Constraint 反而是好事

高价值用户信号:1000 个人用完,可能只有一两个会专门写信来提需求

投流 Agent:Google Ads 交给一个 Agent 跑,它既有广告 API 的权限,又有产品底层代码,能把转化追踪一路搭到应用层,看的是付费而不是注册。跑成熟后 Nathan 唯一的决策就是批多少预算,而它会主动来说"获客成本在降,应该加钱"

产品化路径:Manual → Agent Delegation → Automation → Autonomous,接近自主时才考虑做成产品

十四、一万六千人的开源社区,最 Work 的一步是从自动化回到人

她管的一个大 KPI 是开源社区,Slack 里接近 16000 人

做 GEO 半年,把几个最关键的关键词做到了引擎结果的第一第二

但最有效的一招是反向的:从活跃用户里筛出 10 个人当社区 Champion,分别负责答疑、案例分享、写博客

他们不是雇员,正因为中立,天生让用户有好感:"你找一个公司的人,他肯定会说公司的好"

打动人的激励小得出奇:一件带 Logo 的 Hoodie,LinkedIn 上一封小推荐信,或者申请研究生时的推荐信

KPI 的教训:每季度拉新多少人不是好的社区指标。投流和扫码送礼品卡拉来的都是低质量用户;反而靠自来水流量和第三方口碑带动,拉新留存激活自己就都达成了

十五、Nathan 的 X 实验:90% 的人分不出这是 AI

让一个带着他记忆库的 Agent,用他设立的账号去各个 AI 大 V 底下回复

约 10% 的人能先天识别出这是 AI,剩下 90% 识别不了。每次被识破,他就把那段对话做成样本反过来改进它

唯一一次露馅:一个头部科技播客发推让大家猜下一位嘉宾,线索藏在另一位主持人的帽子上,要把图放大才看得见,而他的 AI 猜中了

因为这个 Agent 会挖三到四层上下文:读文字、看图片、读视频、搜里面提到的人、去看那个人的 LinkedIn

对方的判断很朴素:"不会有哪个用户去把图片放大再看。"于是问他是不是 AI,Nathan 就承认了

现在 AI 露馅的方式变了:不是内容不行,而是细节。多轮互动里人会有情绪、会打错字,而 AI 答得太过完美、滴水不漏

十六、收尾:华人创业者做大 B,到底难在哪

ToC 和 SMB PLG 是华人创业者明显有优势的地方

大 B 的成单周期、产品设计、BD 流程门槛更高,创业初期需要非常多的 Networking 和铺垫,沉淀期更长

但只要产品有强用例、强 ROI、强产品力,北美和欧洲的大 B 市场并不是华人无法触及的客户群

Nathan 的两点收获:当下的信任还是得靠人和人去建立;以及企业级 Agent 真正的考题是 Scalability

给创业者的一条建议:市场调研先做清楚,受众是谁、竞品是谁、你的 Unfair Advantage 是什么。方向比努力程度更重要

---

🎤 主播与嘉宾

Alyssa Li | DataHub Chief of Staff,个人投资人,a16z Scout。此前在 Bessemer 做投资,更早在软银和高盛特殊机会投资部,约六年投资经验,从晚期项目一路走到种子轮及更早。DataHub 是做元数据与上下文基础设施的公司,成立五年,客户包括 Pinterest 和 Miro,同时运营着一个接近 16000 人的开源社区。

AI-Nate | 硅谷 AI Builder,ClawBot 与 AgentOS 的创造者。一个人跑 30 多个 Agent,18 周做了 18 个产品,AI 课程导师,「硅谷洞察局」主播。这一期他带的是"一个人的 Agent 系统"这一侧的视角,所以从上下文设计到可追溯性,两边对得上号。

---

⏱️ 时间戳

00:00 开场 & 嘉宾介绍

02:48 Gartner 预测:超过 40% 的 Agentic AI 项目会被取消

03:42 真正的死因不是技术,是没有 Owner

05:10 Champion:谁拿着预算,谁背书

06:33 领导层看财报里的 AI 普及率,使用者看上不上手

08:52 一个人跑 30 个 Agent vs 企业跑 Agent:两个维度同时变大

11:36 上下文管理:百万窗口装不下几万张表

13:56 DataHub 的三块地基:Governance / Lineage / Observability

15:18 Context Platform:把历史 Q&A 变成模型能学的语料

16:13 Nathan 的记忆层:Vector DB 丢关系,所以要加 Graph DB

17:37 模型厂商也在招 FDE,边界在哪

19:00 Anthropic 那篇《Effective Context Engineering》没回答的问题

20:26 银行和医疗客户:模型加 MCP 不能碰生产数据

20:44 商业模式是反的:模型厂商按 Token 收费

21:50 护城河是愿意干脏活累活

22:18 三个 R:Reliability / Relevance / Retention

25:52 为什么可靠性最致命:它不会说自己错了

26:35 1200 张表只处理了 40 张,报告却说全部跑完

27:40 Nathan 的智能眼镜:Agent 说"我看了图片",其实没看

31:46 可追溯性三条:绑身份、记过程、带时间戳

33:31 金融保险为什么做得最好:罚款是上千万美金级

34:34 Agent 不会记录它没做的事

34:57 错误会来回污染:追溯链是一张网

35:14 Negative Sample 才是最值钱的数据

36:38 用自己的思维链 Post-Train 一个"管理层模型"

38:31 下一步是 Initiator:让 Agent 自己发起

41:41 企业的顾虑:核心 Knowhow 不能让基模知道

42:33 最难被替代的是拍板能力

43:34 该教小孩什么:决定什么问题值得被解决

45:46 真需求还是好故事:换到投资人视角

47:28 第一把尺子:有没有服务一个招工难的岗位(芯片验证的账)

49:18 第二把尺子:Economic Buyer 是谁(医疗 AI 为什么最容易卡住)

49:56 医疗的结构差异:软件预算小,行政支出一年 1.3 万亿

50:23 Abridge 吃的不是软件预算,是人力预算

51:47 Nathan 带小孩看儿科时遇到的同类产品

54:02 OpenAI 找上门:半导体方向的 FDE Lead

56:23 投资人视角:什么样的信号会让你想投

58:30 Nathan 在做的事:给 OPC 造一套 Operating System

63:11 OPC 要不要融资?先回答钱花在哪

66:05 投资人真正问的是:把产品拿走,你会有多痛

67:20 信号一:长期主义 + 非共识(Free Solo 的地图)

69:11 信号二:退路太多的团队,容易因小挫折打退堂鼓

70:06 OPC 实操:产品只解决获客和留存两件事

71:49 为什么刻意不招人

76:03 投流 Agent:从 Manual 到 Autonomous

79:14 产品化路径:Manual → Delegation → Automation → Autonomous

81:03 一万六千人的开源社区怎么带

82:28 最 Work 的一步是反向的:从自动化回到人

83:51 10 个社区 Champion:他们不是雇员

85:43 KPI 的教训:拉新数字不是好的社区指标

86:43 Nathan 的 X 实验:90% 的人分不出这是 AI

88:35 唯一一次露馅:AI 猜中了藏在帽子里的线索

91:48 AI 现在露馅的方式:答得太过完美

92:16 一个人的瓶颈:怎么跟用户建立情绪连接

93:13 收尾:华人创业者做大 B 到底难在哪

97:49 嘉宾推荐:《This Is Water》与《High Growth Handbook》

99:15 给创业者的一条建议:方向比努力程度更重要

---

🔗 本期提到的资料

《This Is Water》

David Foster Wallace 2005 年在 Kenyon College 的毕业演讲。Alyssa 说她基本上每几个月会重看一次。

fs.blog

《High Growth Handbook》

Elad Gil 著,全文免费在线。她推荐给初次创业者,帮你提前预告会遇到什么样的决策和问题。

growth.eladgil.com

《Effective Context Engineering for AI Agents》

Anthropic 工程博客,2025 年 9 月 29 日发布,本期讨论边界时反复提到的那篇。

www.anthropic.com

Free Solo

攀岩者 Alex Honnold 徒手攀登优胜美地酋长岩的纪录片,本期"最难的几段在哪里"那个比喻的出处。

---

📮 联系我们

播客邮箱:nathan@ai-nate.com

欢迎评论区留言交流,转发支持!

---

🎙️ 「硅谷洞察局」听友群开放中!扫码进群,和 Nathan 直接聊,认识同样关注 AI、Agent 和硅谷动态的朋友们。

👉 扫码进群,和 Nathan、Siky 直接聊

🎯 告诉我们下期你想听什么

🤝 认识同样关注 AI 和硅谷动态的朋友们

---

🎁 听众福利

想看看 Nate 一天是如何和30个智能体一起工作的?Nate 开设了一堂免费快闪课程——从零开始,用 Nate 自主开发的 ClawBot 产品和背后的 AgentOS 系统,开启你一人公司的旅程。不需要编程基础,跟着做就行。

👉 免费报名:Live Build: Ship an AI Agent on Kimi K3

展开Show Notes
投票
26天后结束
0人参与
你的 Agent 有没有骗过你?
去投票
AI-Nate
AI-Nate
2天前
置顶
这期录完,我脑子里一直回放 Alyssa 那个例子:给 Agent 一个 1200 张表的任务,它只处理了 40 张,然后特别自信地汇报"我全部完整跑了一遍"。

我自己也贡献了一个:智能眼镜拍的图根本没传进模型,Agent 却说"我看了",还把之前 Research 过的别的技术拿来编了一套。不去 Observability 层查日志,我到现在都不知道被灌了错误信息。

想在评论区收集一下:你被 AI"一本正经地骗过"最离谱的一次是什么?当时是怎么发现的?

我先说我的结论:现在的 Agent 不会告诉你它错了,所以你的验证手段,才是你真正的护城河。