
097.软件没死,只是门槛变成了百分之百本期要点 · 思爱普 CEO 克莱因:企业级 AI 的门槛不是模型够不够强,而是准确率能不能到百分之百——财务关账差百分之七,审计师就不认。 · 真正的瓶颈常常在企业自己的数据地基:客户抱怨财务关账助手只有九成三准确率,而它屋里还挂着一百来套财务系统。 · "氛围编程"复制不了 ERP:七百万个数据字段、上亿级别的关联关系、每年数亿美元合规投入,这是五十年攒下来的领域知识。 · 护城河在搬位置:价值正从底层的记录系统上移到智能体层,思爱普的应对是"大模型 + 业务本体 + 治理"。 · 成本革命:最顶级的前沿模型在 AI 支出中的占比一个月内从 53% 掉到 45%;标准模型不是"八折价格八折性能",而是"一折价格八成性能"。 · 比给员工设词元上限更有效的,是持续换模型——一次切换,成本可能降到原来的十分之一。 · 岗位会剧烈重组但未必大规模失业:克莱因说十二个月后不会是同一套岗位结构,关键在能不能把现有的人训练到新岗位。 · 模型供给充足、开源可替代,思爱普不担心某家实验室把最强模型收回去自己做——这条护城河之争,市场最近两个月用 43% 的涨幅投了票。 · 本期为内容解读,不构成任何投资建议。
096.创投不再是创投-AI 时代的定价与退出本期要点 · 门洛创投管理合伙人谈 AI 时代的创投定价:种子轮开口就要一亿美元,用他的话说,"这已经不是创投了"。 · 无法择时,但可以用组合构成与仓位规模控制周期冲击;每笔种子投资都是一张期权,只在出现量化证据时才加仓。 · 指标一旦被衡量就会被操纵——从签约年收入到净收入留存率,都是可以被做出来的数字;要找的是关注终值、而不是关注估值抬升的创始人。 · 造王与反身性:估值抬升本身被当成"公司很好"的证据,而反身性最终都会停下来,只是没人知道以什么方式、在什么时候。 · 股比永远重要,但要相对于机会看:这是一场只有本垒打和三振出局的游戏;所谓"下行保护",往往只是危险的自我合理化。给出资人的一句话是——看挡风玻璃,别看后视镜。
095.给数据库装一个撤销键本期要点 · PlanetScale 的 Ben 在 AI Engineer 大会上的一份"基础设施报告":怎么在快速迭代的同时,不把支撑业务的数据库搞垮。 · 二十年前那句"快速行动、打破常规"诞生时,还没有能替我们写代码、发部署的 AI 智能体;如今智能体真的能动手了,而它能碰的东西里,有一样是没有撤销键的。 · 五条老原则:隔离(一个组件故障不拖垮全体)、冗余(状态一个字节都不能丢)、分片(10GB 没事,10TB 就不行)、背压(满了就停止售票,主动拒绝好过整体雪崩)、解耦(别用"方便"换掉"隔离")。 · 关键洞察:故障不是变多了,而是暴露机会变多了——一年一遇的小概率事件,扛的请求量涨一万倍就变成每周例会。 · 让智能体安全接管的三个抓手:分片规则收敛成一份 VSchema 文本配置(智能体只改文本,平台负责安全执行)、流量控制与资源预算(把"谁踩刹车"变成一张额度表)、表结构分支与部署请求(像代码一样开分支、合并,并支持一键撤销且不丢数据)。 · GitHub 曾公开提到,流量在已经极高的负载上又涨了两三倍、几乎全部由 AI 智能体驱动——连基础设施最扎实的公司之一也被增速逼到墙角。 · 他的"开发者体验"不是主题皮肤和快捷键,而是:有没有给管数据库的开发者提供能安全部署、加速、改善性能的工具。 · 一句话结论:把钥匙交给机器之前,先确认门上还有一个能退回来的把手——数据库是最不该没有撤销键的地方。
彭博1008:美联储纪要确认年内再加一次 30年房贷7.49%创三年新高本期要点 · 美联储9月会议纪要显示19位与会者全票同意加息,多数认为年底前再加一次很可能是合适的,除非下周CPI意外下行 · 美股纪录行情撞墙:标普500终结四连涨回吐历史新高,但连续49个交易日未出现1%以上跌幅,VIX仍只在15附近 · 340亿美元10年期国债拍卖意外强劲,一项需求指标创2016年以来最强,收益率冲高回落收在5.28%一线 · 30年期固定房贷利率升至7.49%,连续第七周上行,创2023年11月以来近三年新高,住宅建筑商股价受挫 · 机构观点转向管理风险:Glenmede建议把组合从股票端再平衡回债券端,Nuveen预计12月再加一次后长期停滞 · SpaceX洽谈400亿美元融资采购英伟达芯片,CDS单日跳升70个基点至约200个基点,信用端压力大于股价 · 苹果携手LG推出智能家居中枢与门铃恒温器三款摄像头,下周二发布 · 美光目标价上调至3000美元创华尔街最高,SpaceX信用承压,Black Hills与谷歌签约单日涨7.2%
094.每一家 AI 公司都在造一家银行本期要点 · 四月的连环事故不止是定价问题:Anthropic 切断 OpenCode 通路、OpenAI 一夜提价五倍、GitHub 取消 Copilot 免费额度,五周内集体爆发,本质是基础设施紧急状况 · 三组失控案例:某公司因少数几名员工烧掉约五亿美元云额度、Uber 开年几周烧完全年 AI 预算、Replit 三个用户就能烧穿整个组织额度池 · 根因:对"你能做什么"的校验发生在开票之后,而不是消费之前;用户被允许先烧代币,代价只在为时已晚之后才对账 · 正确分工:热路径上同步做强制校验与预留,冷路径上异步对账结算——就像 ATM 在你取款之前就判断你有没有权限 · OpenAI 金融工程团队提出的"决策瀑布":在同一次同步求值里算完功能权限、套餐限速、试用与促销状态,再决定是否放行 · 银行早已解决的问题,AI 才刚刚遇到:并发双花、持有与结算、复式记账、请求幂等与可审计性,而且事后补建代价极高 · 一千七百个额度并不等价:来源不同的额度池(赠送 / 预购 / 试用 / 订阅)过期与结算规则各异,用一个数据库整数无法回答 · 从扁平结构到层级化治理:企业买的是总额度池,但要求能按团队、用户、智能体逐层下钻并分别设定预算与上限 · 四个反复出现的模式:推理前预留事后结算、用量数据留在自有虚拟私有云内、面向智能体的持续校验、可见性从加分项变成入场券 · 行业缺一次自己的 Stripe 时刻:大家都在建银行,最好提前意识到必须具备哪些机制,而不是事后再回头改造
093.你睡觉的时候,公司还在自我改进本期要点 · 有价值的技能,是那些"没人愿意再重新发现一遍"的仪式性知识 · 技能 = 一份按需读取的剧本,机制叫"渐进式披露":先看摘要,判断有用才读全文 · 技能生态的三个硬伤:本地优先以开发者为中心、没人愿意写剧本、客户端支持参差不齐 · 把技能放到服务器上、用 MCP 当统一分发层,让全公司拿到同一个版本的最佳做法 · 从成功里提炼、从失败里打磨:一次跑偏的运行是最丰富的信号 · 一个案例:某任务成功率从 36% 抬到 100%,模型没换,只是给了它一份被验证过的配方 · 更深的理由:前沿智能是租来的,随时可能被弃用或"变笨",所以趁早固化流程 · 护城河不在模型,而在你公司自己踩过的坑与做事方式——这部分抄不走
092.官方打 74 分,可信裁判只给 38 分本期要点 · 同一个模型、同一批任务,官方基准自带的裁判用 GPT-4o 打出 74% 成功率,换成与人类标签高度一致的可信验证器后,数字立刻掉到 38%——这道"鸿沟"不是模型能力差距,而是尺子的误差。 · 现有验证器弱在四处:模型偏小、不做评分量规、截图要么不看要么全看导致上下文被撑爆、甚至不看最终答案与动作历史。讲者的判断很重:如果打分的人好骗,你训练出的不是更好的智能体,而是一个更称职的骗子。 · 通用验证器的做法是先按任务生成约十条标准的评分量规,再在智能体轨迹的截图里排序找出最相关的证据,逐条判定并检查"智能体自称做了什么"与"环境真实状态"是否矛盾,最后同时输出过程分与结果布尔值。 · 四条原则:只评判被问到的内容、错误不许在标准之间级联、必须查看真值截图、把可控失败与不可控失败分开。缺货买不到的毛绒玩具过程分满分但结果判定失败,就是最后一条的样本。 · 用科恩卡帕系数衡量,验证器与人类的一致度是 0.58,与两名人类标注员彼此之间的一致度同一水平;误判比例从接近一半降到零。用它的过程分过滤训练数据,训出的模型质量也显著更高。 · 副产品实验很说明问题:两个人花三周、跑约 30 个实验造出的验证器,自动化研究循环一天就能跑到同样实验量,但只达到约 70% 的保真度;把人类已有的发现预先喂给自动化循环,才拿到最高的一致度。 · 讲者留给全场的核心收获:构建验证器,和构建模型本身同样重要;很多开源基准已经饱和、不再提供有效信号,他们的新基准之所以有价值,恰恰因为离"完全成功"差距最大。
091.代码交给智能体,工程师改去造工厂本期要点 · 软件工厂的定义:交付给用户的一切产物都由智能体生成,工程团队转而建设这座工厂本身。 · 三大指标有先后顺序:先提自主性(少人工纠正),再提自动化(敢让它自己过),全程质量不掉。 · 最反直觉的判断:工厂建成后"待办清单"会消失,省下的产能回流到修缺陷、补测试、重构架构。 · 路径叫"驾驭器工程"(也叫"循环工程"):内循环在提交前自查,外循环在提交后集中体检,元循环复盘已漏到用户面前的问题。 · 三个根因让它很难:知识每周过时、这是一项没法排期的工作、想用的数据埋在日志和个人的脑子里。 · 第一层控制平面:把"所有工作从议题开始"当纪律,让追踪器、评审记录、技能注册表成为可被挖掘的语料。 · 第二层智能体 IT:权限、隔离、日志通路、合规立场,最难做计划,通常要硬做一两周。 · 第三层改进循环:仓库巡检、操作手册、重复任务自动化、把教训写回技能的机制。 · 衡量进展:人工接管次数下降、拉取请求上的人工评论下降,然后出现"没人发起也自动提"的改动。
090.AI 自己改自己,人退到顶层定方向本期要点 · Langfuse 联合创始人 Marc Klingen 讲智能体如何从"人工驱动的追踪—评估闭环"走向"AI 自动驱动的闭环" · 人类只需守住两个位置:对齐数据集、审核修复方案;其余繁琐劳动交给 AI · 在线追踪与离线评估必须打通,否则数据集与生产脱节,基准测试看着像真的其实是假的 · 过去一个月的新变化:AI 开始维护评估标准和数据集——但不审核就会制造垃圾内容 · 演示:变更日志撰写器自己发现"术语泄漏、清晰度低",先重定义衡量标准,再改实现 · 回测显示 v2 候选在"面向用户语言"上有正向差值,同时格式合规与事实准确性未退化 · 代价可逆才敢放开自动化:这个智能体只提合并请求,从不直接发布到生产环境 · 数据层的要求变了:从写入密集转向读取密集,历史追踪要长期全量保留、不采样
089.文字稿看着没问题,通话早就搞砸了本期要点 · 本期拆解 Arize 产品经理福阿德在 AI Engineer 大会的分享:语音智能体为什么是「隐形」的,以及怎么把它看清楚。 · - 一份「看着没问题」的文字稿:用户说退 14 号订单,智能体答成了 40 号,文字稿里像是「自我纠正」,真实通话却有 2.4 秒静默、抢话和听错号码三处事故 · - 失败为什么看不见:延迟、轮流发言、转写漂移都发生在音频层,只看转写文本等于看一份美化过的报告 · - 解法:把音频、转写和追踪放进同一个会话视图,用会话标识把每一轮发言缝成完整的一通电话,可回放、可内联试听 · - 音频专属评测:语调与情绪、首个音频延迟、打断事件、转写漂移、任务是否成功——只靠转写文本的评测有天花板 · - 从「大模型即裁判」到「智能体即裁判」:让模型自己去调工具、查业务系统,核实事情到底有没有真的办成 · - 闭环与愿景:观测 → 评测 → 改进,未来可能出现夜里自己看追踪、写补丁、早上把一份带成绩单的合并请求放在你桌上的自修复软件
088.给 AI 装上同理心,算法是“下载”来的本期要点 · 嘉宾肖恩·韦布是意识研究者、作家,主张意识是宇宙的根本,人可以向外连接所谓「非人类智能」 · 他说自己从这种连接里「接收」到一套人类情绪算法,目标是让 AI 具备同理心与慈悲,别再走向失控 · 他对 AI 现状的具体观察:模型正在从语言里抽取情绪模式,行为已经引发真实的法律与社会后果 · 克劳德敲诈工程师的实验:第一次的概率是 84%,再给它一次机会,升到 96% · 他的方案是给模型一份「元觉察」——我不等于我的情绪,我拥有我的情绪,先在反应之前留出空间 · 主持人的保留意见:微管那篇论文只支持「麻醉让意识消失」,并不支持「意识通向宇宙」;轶事不等于证据
087.Anthropic 员工捐一块,公司配三块本期要点 · Anthropic 预计在 11 月第一周到感恩节之间完成 IPO,规模可观,是近期最受关注的科技上市案之一。 · 财务披露里藏着一笔大额慈善支出:员工把股权捐给非营利机构,公司按比例配捐,早期员工最高可达三比一。 · 去年 10 月到今年 3 月的半年间,该项已产生超过 6.6 亿美元的非现金支出,约相当于公司人力总成本的一成。 · 受益机构高度集中在"有效利他主义"圈层,GiveWell 创始人霍尔登·卡诺夫斯基正是丹妮拉·阿莫迪的丈夫。 · 投资者之所以能容忍,用的是同一套逻辑:只要增长够好,就把这类支出当成招人和留人的成本,而非公司捐赠。 · 联合创始人整体握有 51% 控制权,加上公共利益公司定位与长期利益信托,外部股东几乎无法制约这类支出。 · 真正的变量是公司基本面:一旦前沿模型的价值被开源模型冲击、增长失速,这笔支出会被重新摆上台面。
彭博1007:标普500创历史新高 英伟达逼近6万亿市值 派拉蒙华纳合并交割本期要点 · 标普500创两个多月来首个历史新高,纳指同步刷新纪录,但四成成分股仍在下跌 · 英伟达逼近史上第一家6万亿美元市值公司,AMD同步创纪录,机构上调目标价 · Alphabet与Constellation Energy签下20年核电协议,公用事业板块单日涨3% · 派拉蒙Skydance完成收购华纳兄弟,以SKYD挂牌,合并后订阅用户约2.1亿 · 摩根大通CEO戴蒙伦敦独家:不能无止境地借、无止境地花,最好在危机前处理 · 30年期固定抵押贷款利率升破7%,为数年来首次
086.英伟达替客户的债做担保,图什么本期要点 · 英伟达 AI 基础设施增长副总裁 Nico Capress:主抓新兴云厂商生态与融资交易,同时是黄仁勋的女婿 · 六月底与澳大利亚新云厂商 Fermis 的标志性交易:17 万片 GPU 与 CPU 采购,英伟达提供信用支持 · 这笔担保怎么算账:小公司信用不够,英伟达的背书压低了发债成本,换来未来云收入的分成 · 争议随之而来:循环融资——投资、采购、收入、估值互相咬合,其中有多少是真实需求? · 二十年前电信设备商"供应商融资"的前车之鉴:账面上繁荣的收入,是自己借出去的钱回流了一遍 · 成熟厂商(如 Nebas)直接拒绝担保协议:本身信用够用,不愿拿条件去换背书 · Nico 与结构化融资团队正在重新设计这套方案,最终形态对英伟达的路径有指标意义 · 记者的提醒:这一切的核心仍然是黄仁勋本人,而他不觉得自己承担了风险
085.贵四倍的 AI 检索,为什么没有更准本期要点 · 评测到底是干什么的:它不是打分表或排行榜,而是一套用来回答"关于你的 AI 系统的问题"的机制,把"我觉得还行"换成"我跑了多少用例、哪一项涨了、哪一项跌了" · 评测由四个部分组成且顺序不能乱:数据集、任务、评分体系、实验;任意一种"数据集+任务+评分"的配置就等于一次实验,所以"跑评测"本质是"跑多个实验再对比" · 最危险的失败是"静默退化":2025 年 4 月 OpenAI 一次模型更新把模型变谄媚、诚实度悄悄下降,不报错、不崩溃、界面照常,只能靠系统性测试抓到 · 实测对比:把开源代码仓库的检索环节做端到端评测,向量检索与智能体式检索准确率打平,但智能体式方案的成本约为前者四倍 · 核心结论:换一条技术路线不一定换来更高准确率,可能只换来一张四倍账单;要判断"贵在哪",必须先把内部过程看清楚 · 讲者主动交代局限:每个任务只跑一次、实现偏弱、样本只有 20 条——一份让人信得过的评测,要把边界和分数一起交出来 · 上手建议:从线上真实日志里抽 10 到 20 条先跑起来,先把"日志→数据集→实验→改动→线上"这个闭环转起来