

强推AI的企业为什么反而遭遇离职潮?团队用AI,领导者到底要改变什么?AI 省下了成本,为什么还要补充人工? 这未必意味着 AI 失败,却提醒我们:一个步骤变快了,客户的问题和后面接手的工作,不一定就变好了。 如果你已经把 AI 用进工作,却发现生成快了、交付没跟上,这期就从会议记录、客户跟进和创作中的变化聊起:核对和改错需要多少时间,为什么不想用 AI 未必是不会用,以及省下来的时间怎样才能带来实际改善。 我们也会讨论,什么时候可以扩大使用,什么时候该缩小范围或换条路。听完,可以回看手上的用法,找出下一步真正需要调整的地方。 时间轴 00:03 省了成本又补人工,AI 用得好不好该看什么 00:52 从会议记录到客户跟进,AI 应该帮到哪一步 02:50 几件工作都想用 AI,先改善哪一件 04:18 AI 写得快,核对的人有没有时间 05:38 不想用 AI,可能是工作负担和判断空间变了 09:14 客服继续用 AI,也可以给客户增加人工选择 10:31 回答更快、每天省一小时,实际改善了什么 12:50 一项工作做顺了,扩大使用还要检查什么 14:31 业务规则变了,谁发现错答、谁接着处理 16:04 试验可以结束,原来的工作怎么接回来 17:14 回看手上的 AI 用法,下一步该改哪里
【深度复盘】Jev 是如何在24小时打造出全球性AI营销事件9 月 15 日,一个只有 1,500 粉丝的账号发了条帖子。48 小时后,浏览量 3,700 万。 这个号不是公司官方账号,是旧金山一家叫 TypeSafe AI 的实验室的创始人本人。发帖之前没有任何异常,发帖之后,数字开始往一个明显不正常的方向走。 这期我们复盘的不是模型本身,是这条发布路径。从发布前两周到发布后 72 小时,几乎每一步都能对上一个具体动作:什么时候出关、什么时候公布融资、主帖发在哪一格、80 到 100 个账号是怎么在第一个小时内压进转发节奏的、第一句话为什么给的是一份三秒能核实的资历而不是公司名。 节目里有一段争论:这种量级的曝光,真的是靠排期排出来的吗,会不会就是东西太硬、技术圈自发传开的?我们把这个疑问摆在台面上,然后一步步对着时间线找动作、找数字,看这个解释站不站得住。 最后想请你做一件事:不管你手上是在做产品发布、公司内部项目推广,还是自己账号的一次内容规划——先想清楚,真到发布那天,你脑子里那份"会替你转发"的名单,第一个名字是谁。评论区告诉我你列到了第几个。
一线产品经理经验分享:B端产品中用AI的四步法与边界京东零售的一位 B 端产品经理,今年四月接手一批收银系统需求,覆盖开发票、部分退款、手动折扣、菜品数据本地化和排序优化五个分支。按老办法估下来要 34 人日,最后 15 人日交付,评审一次过,效率提升 56%。但这省下来的时间,不是 AI 替他做判断省的——一次都没有。AI 干的是结构化的活,判断和复核全在人手里。反例先摆出来:手上存两百多条 Prompt,模板齐全,结果让 AI 写需求文档读着顺,交给开发逻辑坑一堆,三天补坑没人记账。病根在于上来就让 AI 直接生成,它手上没有历史规则、没有踩过的坑,只能编,编出来的东西还特别顺。 他把方法压成一句话:人是决策者,AI 是劳动者。AI 管六件事——整理材料、生成初稿、提疑点、补结构、查遗漏、顺语言;人管另外六件——定目标、划边界、拍异常、评影响、担结论、负责到底。这就像装修请了个手艺再好的师傅,他不知道你妈住主卧腿脚不便、阳台墙不能砸,图纸一丢就能砸出漂亮但没法住的活。AI 缺的不是能力,是你脑子里那部分。落地成四步:Skill,把这类活的结构固定成可复用指令;Prompt,把料给够,连自己还没想清楚的地方也如实说;Context,先别急着生成,让 AI 反问,把没对齐的意图一条条补齐;Harness,回头调用 Skill 出初稿,边界和异常人来补。判据很糙但好用:一件事做过两次以上,才值得沉淀成 Skill,别指望一次写全,先跑一次真实需求再攒。 支付设置页改版是个具体案例。常规做法是截图丢给 AI,说照苹果风格重做,他没这么干。而是先让 AI 模拟登录、拿到身份凭证,跑一遍真实流程,才发现要改的内容藏在一个嵌套输入框里,截图根本发现不了。真结构找到后才轮到设计:调用绑定苹果 HIG(Human Interface Guidelines)规范的固定指令,在真实结构上出第一版原型,再围着弹窗、搜索、批量设置磨细节。五分支需求那次更典型:他没让 AI 直接生成文档,而是把原始需求原样喂进去,让 AI 一点一点反问,逼出跨分支交叉点——比如混合支付订单能不能开票——这些恰恰是过去只有评审现场才会被当场揪出来的坑。B 端产品后台核心从来不是好看,是层级得清楚、规则得说明白。AI 不返工的前提,是你先让它读懂真实结构,而不是甩一张截图讲几句虚的要求。
生活和工作中:如何调整确信感,逼出“尽力的上限”?一:不知道天花板时,可以带来更大的爆发力 * 1939年伯克利研究生Dantzig迟到,误把黑板上两道未解统计难题当作业,六周后解出,导师Neyman周日早上冲到他家门口直接投稿——唯一变量:他不知道那是"不可能" * 1964年五角大楼Nth Country项目:两个无涉密权限的博士后靠公开文献造出当量等同广岛的核弹设计,只靠一句"能做成"撑了两年半,全程不知道自己在靠近答案还是越跑越偏 * 1974年密码学家Diffie认定公钥密码学无解,同事一句"Merkle在做了",他回去重新想,不久后就发表了奠基论文——同一个大脑同一套知识,开关是"有人在干" * 吃豆人玩家误信"Junior boards上有人做了分组",五天不眠不休找到隐藏安全点,后来才知道那句话根本传错了——错误信息也能改写行为,大脑只需要"解法存在"这个信号 二:从"试试看"到"找出那个解法"的切换 * AI电商生图团队三周交不出透明香水瓶场景图,翻译工具把"半透明磨砂感"翻成全透明,七步链路重跑一次就是一笔钱,团队心里那句"可能真的做不到"越试越强 * 第四周第一天,竞品产品页上刷到同类型香水瓶图——玻璃折射、液体通透感、大理石侧光全部到位,团队什么工具都没变,状态却从"试试看"切换成"找出解法" * Wiener的说法很精确:科学家一旦知道问题有答案,整个态度就变了——OpenAI做出ChatGPT后全球实验室迅速跟发LLM,靠的不是新技术,是路线被证明可行 * 同样的时间和资源,"确信有解"和"不确信"这两种搜索行为,产出根本不在一个量级 三:大脑在真正极限前早早踩了刹车 * 1999年开普敦大学实验:运动员骑到力竭,肌电图测出活跃肌肉纤维只剩三成——传统理论说该动员更多肌肉补偿,实际是大脑主动降速,生理极限远没到 * 耐力车手Robič横跨美国三千英里,每天骑三百五十英里、睡九十分钟,出现幻觉还想对着邮筒挥拳——体能师Miran替他做所有决策、瞒住剩余里程,因为他自己的大脑在骗他停下 * Robič的动力不是热爱,是被父亲偏爱弟弟、二十八岁还在洗碗的那口气——他说"我一生都在被推开,我的力量就是从它们来的",还曾因为跟一座山较劲两个月爬了三十八次 * 体能师就是那个"第二脑":把主观的"我不行了"信息挡在外面,大脑调控器才不会提前锁死搜索空间——你永远不知道自己真正的边界在哪,因为"到极限了"这个信号,本身就隔着一整条河
如何孵化内部AI 项目:Anthropic 的经验分享1️⃣:一支只有二十人的小队,凭什么定生死 * Anthropic 内部的 Labs 团队,规模不到二十人,孵化出了 Claude Code、MCP(Model Context Protocol)、Claude Design 这些你正在用的东西 * 但这支精英小队自己的内部项目成功率只有 20%到 30%,也就是说七成项目从立项那天起就注定被砍 * 反直觉的地方在于:这不是烧得起钱的奢侈,是刻意设计的纪律,跟团队大小、预算多少没关系 2️⃣:三条停损规则,买的是失败的自由 * 规则一:每两周一次复盘,只回答一个问题——继续还是转向,没有中间状态 * 规则二:一个项目只要团队超过 4 个人,就必须从 Labs 毕业,逼着项目要么证明自己能独立活下去,要么结束 * 规则三:20%到 30%的成功率是提前定好的规则,不是做完之后回头算的账——你事先就知道大概率会失败,所以失败不丢人 3️⃣:规则管结束,不管定目标 * 这套机制的边界很清楚:三条规则全是关于什么时候停,没有一条教你怎么定目标 * 类比一下:这是一套很锋利的剪刀,但剪什么、从哪下手,得靠人先想清楚 * 今天就能做的事:给团队里一直没成的某个 AI 试验,写一句两周后的成功判定条件——写不出这句话,通常就说明它已经该停了
经验分享:阿里团队从1个人开始做AI 项目,到100人协同的坑和解决方案一:一个人干活,加人反而变慢 * 商品短视频从分镜到成片,一人跑通时一天能过四五轮;加三个同事后,同一批商品两版分镜口径对不上——一个按曝光算成本,一个按成片时长算成本 * 效率没有乘以四,团队负责人的下午变成挨个盘问"这版到底怎么出来的",个人产出反而下滑 * 天猫技术团队复盘一个新品项目从一两人扩到整组的过程,印证同一规律:人一多,框架、协作、整合每个环节都会露出新坑 二:四关不是 AI 不够聪明,是协作没设计好 * 第一关,单人阶段:解法是一份入口地图,加一套自动沉淀机制,做过的事系统自己往下记,不靠人脑记忆 * 第二关,多人加入:先划地——每人明确自己的地界,划完再在系统之间对接一套标准,避免口径各说各话 * 第三关,系统跑快了:单独设一台机器专管提交合并,逐个排查、验证合并口子,把速度和质量分开处理 * 第四关,非技术人员进场:把系统锁死,他们只负责提需求、看结果、反馈结果,不碰系统本身 三:四个解法长得不一样,修的是同一件事 * 四关全部指向架构设计和人机协作方式,没有一关的答案是"等 AI 变聪明" * 从一人到多人再到跨角色协作,每一次规模扩大,暴露的都是提前该想清楚的分工和接口问题,而不是模型能力问题 * 留一个开放问题给听众:你们业务里的多人 AI 协作,撞上过这四关之外的坑吗
Anthropic预测:AI 导致部分知识工作者失业,经济总量增加一:把工作拆成任务,才能看清 AI 在做什么 * 每份工作都是任务的集合——护士的一天里,查房、抽血、记录生命体征、订物资,每一项都可以单独判断 AI 能不能接手 * AI 对任务的影响分四种:辅助做得更好更快、直接自动化、完全不影响、催生全新任务(比如护士要新增"审核 AI 分诊结果"这项工作) * 任务清单本来就在变——手写病历卡三十年前是标配现在基本消失,远程病人监测三十年前不存在现在是常规,工作内容从来不是固定的 * 把全美所有人、机器、软件完成的任务加总,就是过去一年超过 30 万亿美元的美国经济,AI 会怎么改写这张任务清单,决定了经济走向 二:三种情景,冲击程度天差地别 * 保守情景:AI 冲击约等于当年的互联网,宏观数据里几乎看不出痕迹,增长真实但不特殊,慢慢显现 * 可观情景:到 2030 年 AI 能胜任一半知识型工作且大部分自主完成,但现实中大多数任务依然是人在做;GDP 增速翻倍,但知识工作者工资不涨,受益的反而是其他行业劳动者 * 极端情景:AI 在绝大多数知识型工作上超过人类且几乎全自主,需要 AI 具备递归自我改进能力;GDP 年增速达 15%,经济体量每 4.5 年翻倍,但知识型工作岗位大减,失业率超出常规衰退水平 * 一万多名美国人的调查显示,多数人预期接近"可观情景"(2030 年 GDP 因 AI 多出 10%,失业率约 5%),约一成人的判断已经逼近"极端情景" 三:增长会发生,但分配是真正的问题 * 不管哪种情景,AI 都会让美国 GDP 扩大——来源是 AI 辅助、AI 自动化、AI 催生的新任务、整体生产率提升四部分叠加 * 但新增财富里流向资本的比例可能大于流向工人的比例,社会整体更富裕,工人占比却可能缩水 * 大多数情景下失业率仍落在历史正常区间,唯独极端情景(递归自我改进+极快普及)例外,失业率可能飙到历史罕见高位 * 真正的挑战从来不是"AI 会不会创造财富",而是这些财富能不能被广泛分享——增长的蛋糕会做大,切法却还没定
20-30岁的人如何面对AI时代一:最稳的那条路,回报正在崩塌 * 纽约联储今年二月的数据:计算机专业毕业生失业率 6.1%,艺术史 3.0%。被劝退了十年的专业,失业率是热门专业的一半 * 国内的对应版本叫「上岸」——进大厂、考公考编。同一套逻辑:用四年确定的投入,换一张越来越薄的入场券 * 学校在两头拧着来:毕业论文要过 AIGC 检测,AI 率超线打回重写;走出校门第一场面试,问的是你平时用哪个模型、怎么用 * YC 那场面向学生的活动上问了两次:你们学校允许用 cursor 吗——举手的不多;有多少课明确禁止 cursor、禁止 vibe coding——手一下子全举起来了 二:文凭不值钱之后,稀缺的是另一半 * YC 反复观察到的现象:technical expertise 这一侧,二十岁的大学生已经走在最前面。你缺的不是技术,是技术之外那一半 * 那一半叫 domain expertise——某个具体行业里,只有待过的人才知道的活儿是怎么干的。FDE(forward deployed engineer)之所以吃香,是因为它逼你去人家现场,把 AI 落进他们真实的流程 * 今年 YC 投的项目里,有三家在给牙医做 AI agent。三个创始人跟牙科的交集都不是听来的,是真在里面待过,才做得出管用的东西 * 越冷门、越说出去有点丢人的方向,护城河越深——因为大公司看不上,也注意不到 三:不要用应试心态去面对AI 时代 * 最大的风险不是选错行业,是心智惯性:从小被训练成听话和应试,于是把新工作、把手上这套 AI 流程也当成下一张卷子,坐着等人来发 * 真实的东西只有一样:真的营收,真的客户。刷出来的 GMV、包装的用户数、跑通告、上榜单,都是幻象 * 该攒的是两样:核心判断力和落地能力。攒法只有一个——保持耐心,扎进一个陌生行业待上几年 * 该学什么专业、进哪个行业,跨境、机器人还是养老,没有标准答案。那东西只有你自己知道
FDE 不一定是个好工作,弄不好就成了外包劳工一:FDE 真正的门槛不是技术 * FDE(Forward Deployed Engineer)最值钱的能力不是写代码、不是懂模型,是有资格对客户说"不" * OpenAI 招 FDE 要求至少五年工程或交付经验,Anthropic 要求至少四年,门槛卡在经验而不是技术栈 * 说不的前提是摸清自家产品边界——连边界都不知道在哪,就没资格替公司拒绝客户的需求 * 做不到这一条,干的其实是外包开发的活,只是换了个更时髦的名字 二:国内的挂名和实际招聘不符 * boss直聘、猎聘上挂着 FDE 名头的岗位,很多直接招应届生甚至实习生 * 一个入职三个月的新人,没有跟客户博弈的资本,也没时间摸透产品边界,根本谈不上"说不" * 岗位名称照搬过来了,门槛却在本土化过程中被悄悄拿掉,剩下的只是"现场"两个字 * 招聘逻辑还是外包老一套——按人头、按项目量级配人,跟"资深"完全不挂钩 三:三条标准,看清手里的机会 * 判断中国 FDE 岗位值不值得干,不看薪资,看三件事:合同量级、经验会不会沉淀回产品、有没有一条能写下来的说不边界 * 三条都在,是个能长本事的位置;一条都不在,名字再新也是换皮外包工位 * 这套判断只在你还有得选的时候管用,要是没得选,就先杀进去,进去后拿这三条盯它半年 * 只要 AI 能力边界和真实业务需求之间还有那道沟,就得有人来回跑着弥合它——名字可能会变,但这个角色短期内不会消失
做软件的 OPC 注定失败一:成本坍缩不等于生意成立 * AI 把软件开发的边际成本压到几乎为零,人人都能写出能跑的代码,但"能做出来"和"能卖出去、能持续赚钱"从来不是同一件事,做产品的门槛和做生意的门槛不能划等号 * 晚点最近一篇报道印证了这个判断:一批靠 AI 独立做出来的小工具类应用短暂冲上榜单,热度过后留存和付费曲线很快掉头,开发成本降了,获客成本却纹丝不动 * 类比:印刷术让写书变便宜了,但畅销书依然是少数——瓶颈从来不在"能不能写出来",而在分发、信任和持续维护这些印刷术管不到的地方 二:OPC 为什么更不成立 * OPC(One Person Company)把"一个人做软件"当成低成本创业的终极形态,但用户不会因为你只有一个人,就降低对产品稳定、安全、有人兜底的要求 * 反例:一个人做的工具一旦出 bug 或漏洞,没有团队分摊响应速度,用户流失比大公司产品快得多——单点故障不只发生在代码层,也发生在人力层 * 特定窗口期里确实有人赚到第一波钱,比如蹭一个热点做个小工具收几周的钱,但这类窗口本身就是被同样便宜的 AI 迅速填平的——别人复制你的速度,和你做出来的速度一样快 三:窗口红利终将被抹平 * AI 拉平的是开发门槛,不是分发门槛、信任门槛、维护门槛——恰恰是这几道门槛,需要团队、时间和资本才能堆出来 * 趋势外推:越来越多人涌入同一片"低成本开发"的红海,单点优势的半衰期会持续缩短,从月级别压缩到周级别 * 金句:成本降到人人都能做,恰恰说明这门生意的护城河已经不在"做"这件事上了——谁还只靠"能做"赚钱,谁就是在窗口关闭前抢跑
AI 绝无可能,回答你一模一样的答案回车之后,你到底在等什么 * 每次提问,系统不是"接着聊",而是把整个历史重新拼成一份文档,从头喂给模型再读一遍 * 这两秒被切成几块:拼文档、过安全分类器、排队等资源、最后花最多时间的是重新读一遍越滚越长的历史 * 你回头改一个字,模型不会"修正记忆",而是把改过的版本当成从一开始就是这样发生的,整段重读 长对话为什么越聊越贵越笨 * 你自己打的字始终就那一百来个token,真正往上涨的是前面不断累积的历史,这才是变贵的根源 * 一个调用了三次网页搜索才答完的问题,其实是完整跑了三趟整套流程,每趟都要重新拼一次历史 * 二十步的任务,每一步都要重新塞进去一段两千token的指令块,二十步下来光指令块就四万token,还没算真正干活那部分 * 缓存决定了同一句话要重复烧几次钱,这也是为什么有的回答明显更快 同一句话问一千次,为什么能跑出八十种答案 * 就算关掉随机性,你的请求也要跟陌生人的请求凑在一起批处理,每次凑够的人数不同,数值计算就会出现细微差别 * AI 一直在跟一堆陌生人共用同一块算力,答案的波动不是模型"心情不好",是排队方式变了 * 你能做的就两件事:提示词把固定内容往前放、变化内容往后放,吃上缓存;对话滚过二十轮,别死磕,做摘要或干脆重开一个 * 你不是在跟模型聊天,是在跟一份被重新拼装出来的文档打交道
一次读懂持久化 AI 同事一:从聊天工具到持久化同事 * AI 产品大致走过三段:聊天是问一句答一句,代理是把整包任务递出去,持久化 AI 同事则持续在场、定期同步、自己推进工作 * 持久化的价值不只在“能产出”,而在于它能在你离开之后继续工作,过一段时间回来还能接上进度 * “90% 成功率”听起来像指标,真正交付时却可能没有计算口径、样本范围和失败记录,数字越漂亮,验收盲区越值得警惕 * 最麻烦的不是 AI 有没有交结果,而是结果回来以后,人凭什么确认它做对了 二:把交付变成可验收的工作 * 分工的第一道门槛不是任务难度,而是结果能不能被独立核对:能复查的活适合整包交给 AI,不能复查的活不能只收最终答案 * 验不了的任务,要让 AI 同时交回输入、引用和走过的过程;这些不是附加文档,而是判断结果可信度的证据链 * “让代理做事”和“持续托管工作”差别在责任闭环:前者验收一个任务,后者还要检查它连续推进期间有没有悄悄偏航 * 可以把工作清单按“能验”和“得留判断”分开:前者让 AI 执行,后者让 AI 提供材料,人和 AI 一起完成判断 三:人的位置留在判断现场 * AI 越持久,越容易把过程藏在后台;未来真正稀缺的能力,不是让它多做一步,而是知道哪一步必须留下可追溯证据 * 手艺被抽象掉以后,人的位置不会自动消失,但会从亲自完成每个动作,转向定义验收标准、识别反例、承担最终判断 * 这条分界线不在难不难,而在验不验得了:能独立核对的结果,交出去;必须由人形成、也由人承担的判断,留在现场 * 持久化 AI 同事真正改变的,不是“谁来干活”,而是“谁还能对结果说得清楚”
如何借助 AI 做市场调研:从经典商业案例中得到启示一:把调研外包给 AI,交回来的为什么全是废话 * 问卷丢进去,AI 总结出的用户需求永远是「更便宜、更好用」;销量报表丢进去,回来的是行业里人人都知道的趋势;让它盯社交情绪,抓回来的是算法推给所有人的那几个热词。数据不缺,提示词攒了一大堆,读完自己都嫌是废话。 * 麦当劳早年拉奶昔销量,用的是最标准那套:做调研、调口味、调甜度、加巧克力碎,迭代了好几版。动作全对,销量纹丝不动——问题不在执行,在一开始问的那个问题。 * AI 擅长把答案做便宜,而调研里真正贵的东西,从来不是答案。三个动作分它:反问常识、盯住异常、人到现场。每个动作里,人跟机器各拿一半,拿错了就白干。 二:三条线,逼出 AI 到底能接哪一半 * 反问常识:哪一条行业共识值得怀疑,这一步只能人来指——AI 没有立场,不知道你行业里那条「手机必须有键盘」长什么样。指完之后,那种不知疲倦、一句接一句的追问,交给 AI,它比任何人都能扛。 * 盯住异常:扫报表、把不符合预期的行列出来,AI 又快又便宜,这是它最硬的强项。但哪一行值得追、这一行背后站着谁,得人来判——异常清单是原料,不是结论。 * 人到现场:这一半 AI 连接口都没有。买家真正在用的场景、和详情页写的用途对不对得上,只有自己下单用一遍、找那批反复回购的老买家聊几句才知道。 三:从异常清单到主推位,一个选品岗的完整闭环 * 那位做电商选品的朋友,先给 AI 换了任务:把「跟着热销榜走」这条共识反问了一遍。AI 交回一张异常清单,他从里头圈出一款早就停投的旧款——复购不对劲。 * 然后他自己下单、从头用了一遍,又去找那一小批老买家。结果是:这些人买回去干的事,跟详情页上写的用途根本对不上,是一个他从没预想过的使用场景。他照着买家真正在用的场景重做链接,把这款旧品排进了下个月主推。 * 报表还是那张报表,AI 还是那个 AI,变的只是分工。AI 把答案做便宜了,贵的只剩问题、异常和现场。 * 留一个问题带走:你那个行业里,「手机必须有键盘」是哪一条。想到了先别自己下结论,丢给 AI,只给它一条规矩——只准反问,不准总结。真的是这样吗。
一次性理解 AI Skill 如何持续维护 (阿里内部经验)一:Skill 不是写得越全越准,是这一步用不用得上 * Skill 分三层加载:第一层只有名字和一句描述,AI 靠这一句决定要不要翻开;第二层是正文,官方建议 500 行以内,超了就拆;第三层的附件和脚本,执行到那一步才读。你那几十条指令串不起来,缺的就是开头那句"客户发来投诉截图时用我,纯询价别用我"——官方明确要求这句写得有侵略性,把触发和不触发都列清楚。 * 团队最初把上百条埋点解读规则全塞进 SKILL.md,结果它执行一次最简单的日志搜索也要全量加载,token 开销大还容易走神,偶尔自作主张跑去做深度分析,人得反复打断把它拉回来。撤掉当前这一步用不上的段落,只留判断依据和输出要求,同一个模型立刻就老实了。于是立了条判据:每加一句都问"删掉这句会不会导致它出错",不会,就不该加。 * 逻辑互斥的分支要拆开:那份手册曾把各功能描述交织在一起,低端模型上经常顾此失彼。改成一段约 60 行的全局约束 + 4 条规则约 20 行的决策树,下面挂三条互不相干的路径,各带各的输出规则。老客户续约、新线索、投诉——先判断,再只取那一份,三条路互相看不见。 * 套路越死的活儿越该写死:已有成熟解析规则的部分固化成脚本,比让模型现场处理最多快 7 倍、格式 100% 统一。而脚本已经生成好的标准报告,模型拿到还会手痒加标题、改措辞、截断表格,甚至补一句不存在的结论——日志分析里几乎任何"总结"都是信息损失,只能用极强语气写禁止清单:不许总结改写、不许重排、不许添话,一字不改直接输出。 二:它做错的时候,你该丢的不是结论,是现场 * 脚本遇到字段缺失、编码异常、JSON 层级变化报错不断,只把那一行 ErrorMessage 丢过去,改了几轮问题还在——它根本不知道这报错从哪段逻辑冒出来、当时手上是什么数据。改成打包三样:源码给业务逻辑、堆栈给报错关键点、触发异常的那份具体输入给复现现场。凑齐了它自己就进"改一版、用同一份输入回放、再改"的循环。 * 生成和维护这份手册直接上最强的模型。一开始为省 token 用中端模型,最复杂那条搜索路径的循环逻辑被写得支离破碎,改三四轮还不对,总消耗远超一次性用强模型。正确顺序是:把最佳实践、真实案例、现有手册连报错一起喂给最强模型解决问题,再让它复盘自己怎么解的、把手册写出来,最后才验一遍便宜模型跑不跑得动——日常每天几百次调用,那时候才轮到算单价。 * 让它看全和让它专注是冲突的。团队把远程代码也纳进同一个工作区,本意是给足上下文,结果只想改本地搜索策略时,之前读过的埋点规则白白填满窗口分走注意力,它还会"好心"顺手优化,改动纠缠在一起。做法是按任务动态切换范围,且每轮只改一个维度——只调话术,或只调筛选标准——改完验证通过立刻存一版,diff 越小,AI 审查越能明确告诉你这次是不是漏了信息。 * 天天在变的东西别抄死在流程正文里。选品的价格带和淘汰标准、报价的折扣区间、投标的资质清单,单独存成一个文件,流程里只写"先去读那份标准,按它执行"。规则变了只改那一个文件,流程一个字不动,你和同事手里的版本也不会对不上。 三:能被改到第五十版还站得住,才算工具 * 验证不看跑不跑得通,看撞不撞得住。开发时拿普通商品调试,默认五分钟窗口干干净净;真投产撞上 iPhone 17 这种热门商品,一分钟上千条访问记录,返回爆炸数据量当场卡死。测你那个知识库,别用自己想出来的问题——去翻聊天记录,专挑客户真发过来的那种:一句话塞三个条件的、错别字连篇的、还带张截图的。 * 撞出来的坑要评估过才写回手册,不然刚删瘦的文件一个月又膨胀回去——判据还是那句:删掉这句它会不会出错。缺关键前提就先问清再动手,把多个疑点合并成一轮提问、每个配好选项和默认值,能从截图推断的(比如 24 小时制的"20:11")绝不多此一问;执行完扫一遍结果,命中区域限售这类信号就在末尾追一句提示,几十条记录的长报告一律转成文件给链接,对话里只留最要紧的那 3 条。 * 跨了一次调用它就不记得上一次做过什么:用户先发截图分析,再追问"刚才那张截图为什么无法加购",另一端完全不记得自己分析过什么,只能重发一遍。他们的解法是全程复用同一个会话编号,手册里多了十行左右,体验提升非常明显。你这边对应的做法是——聊到后面它开始忘前面拍板的结论,别硬聊也别复述,让它把已定结论、已排除方向、未决问题压成几百字的交接说明存出去,新开会话贴回去接着干。 * 五十多个 Skill,最能打的那份积了五十多次提交,第一版到第五十版最大的差别不是写得更全,是删掉的更多,行数是往下走的。业界讲"怎么写好"的多,讲"怎么迭代"的少——不能持续迭代的 Skill,说到底只是个一次性 demo。写这份手册真正不可替代的位置也不在措辞:是知道该把哪份材料、在哪一刻、递多少过去。它走神不是变笨了,是你喂的东西太多。
腾讯团队分享:Agent 的能力上限,卡在团队知识上一:不是知识不够多,是知识的形状不对 * 文档写全写细写多,对 AI 反而是负担:大段自然语言里"适用哪种情况、不适用哪种情况"的边界是糊的,检索翻出十篇九篇不相干,给得越多错得越离谱 * 直觉解法是做两套——长文给人看、卡片给 AI 看,这是个坑:两套等于两份维护成本,时间一长必烂一套,而烂掉的通常是给机器看的那套 * 卡住 AI 的从来不是读不读得完,是找不着、喂不进;两千字它毫不费力,两千篇它挑不出该看的那两三篇 * 同一个坑一拨人反复踩,因为那点经验只留在当初经手那个人的脑子里 二:靠人写一定失败,99.7% 的知识由流程自动沉淀 * 腾讯安全中心跑出来的数字:99.7% 的知识由流程自动沉淀,一千条里人手动写的不到三条,剩下 997 条是活干过去了知识自己留下来的 * "靠人写一定失败"不是说人懒,是机制上就不成立——这个判断一旦立住,后面所有设计都是被它逼出来的 * 自动沉淀最大的副作用是产得太快:方案改了三版前两版是废的,项目做一半砍了过程判断全是错的,这些进池子后 AI 会一本正经拿废方案教育你,所以必须有一道审核闸 * 几个月实际代谢数据:已归档 101 条、准备清理 11 条、过期该处理的处理完九成,且基本没人盯着——后台只留待审核、快到期、待完善三栏,人只在真要判断的地方花时间 * 有进有出这四个字,是知识库和垃圾场的分界线 三:注入即记账,密度比体量重要 * 主动注入(平台把知识塞给 AI,而不是等 AI 自己去翻)真正值钱的不是省心,是顺手解决了老大难——注入即记账,谁用了、用了几次系统自动记,知识库第一次有了消费数据 * 反直觉的巧劲叫"敢于不沉淀":很多事做完真没什么值得留下的,系统判断后直接跳过;大多数团队生怕漏了什么,结果越堆越厚,有用的那部分越来越稀 * 四种常见死法都眼熟:拿指标逼贡献(被逼着写的质量低、后面更没人维护)、只进不出无限膨胀、骨干一离职门道全带走、写了一堆没人认可动力消退 * 月增量五月 86 条、六月 716 条,还在爬坡,不是一次性运动 * 该问的问题变了:不是"我们知识库全不全",而是那些只留在某个人脑子里的东西,有没有变成 AI 找得着、拿来就能用、过期会自动下架的团队资产 * 模型每半年换一代,那部分谁都追得上;追不上的是别人已经转了两年的飞轮。动手别贪全,挑一个具体场景切进去,能转起来比转得快重要