

EP156:Claude effort档位配置最佳实践指南本简报对 Claude Code 中新增的 Effort(思考投入度) 机制进行了深度分析与总结。Effort 是用于控制模型在任务上消耗计算资源(Compute)与时间近似值的机制。研究与基准测试表明,提升 Effort 能显著增强模型的自主决策能力、边角情况(Edge Cases)测试以及自主验证能力,从而有效提高复杂任务的成功率;而低至中等 Effort 则能够提供快速反馈,非常适合人机协同(In-the-loop)的迭代开发。 针对不同类型的任务(从日常软件工程到高难度的安全、硬件及科学计算任务),合理调整 Effort 层级(Low、Medium、High、Max/XHigh)能够在开发效率与输出质量之间取得最佳平衡。 一、 Effort 的概念与核心原理 1. 什么是 Effort? * 计算资源与时间的近似度量:Effort 给模型提供了一个大致的参考,指示其在特定任务上应当消耗多少计算量(Compute)。这与人工对任务难度的建模方式类似(例如:要求在 12 小时内完成与 1 小时内完成,工作的深入程度与迭代方式会有显著差异)。 * 自主性与验证力度的体现:高 Effort 不仅意味着消耗更多 Token,更代表 Claude 会采取更多独立的行动来进行自主判断、自我审查与验证。 * Prompt Cache 兼容性:在 Claude Code 中调整 Effort 水平不会破坏 Prompt Cache(提示词缓存),保证了高效的交互性能。 2. Effort 曲线与能力表现 在 Fable 5.1 与 Opus 5.5 模型中,Effort 曲线表现出显著的效果:随着 Effort 级别的提升,基准测试得分(如 Terminal Bench 3.0)与消耗的 Token 量同步增长。 * 提升显著的领域:在需要大量验证和边角情况测试的领域(如硬件设计、代码审查、性能优化和安全审计),高 Effort 带来的改善最为明显。 * 局限性:增加 Effort 能够大幅减少因**遗漏边角情况(Missing Edgecases)而导致的失败,但无法修复模型初始解题方向错误(Wrong Approach)**的问题。 二、 不同 Effort 层级在开发任务中的实践表现 通过在 Opus 5.5 上对不同复杂度的任务进行对比测试,Effort 展现出以下具体影响: 1. 规格不明确的构建任务(Underspecified build task) * 示例:要求 Claude“构建一个个人健身与运动追踪应用”。 * 低 Effort:生成一个仅包含基本日志和简单图表的基础应用,适合作为快速迭代的初始框架。 * 高/最大 Effort:生成功能更复杂、细节更丰富的应用;在最大 Effort 下,甚至会自主添加热度图(Heat chart)。 2. 规格较轻度的设计任务(Lightly specified design task) * 示例:重新设计 Claude Code 中的 /config 菜单。 * 低 Effort(耗时约 1 分钟):快速输出一个交互式草图,直观表达核心概念(如子菜单和搜索功能),但视觉上不太像 Claude Code。 * 最大 Effort(耗时约 28 分钟):输出高度精致、极具 Claude Code 原生风格的高保真原型,并附带针对不同交互流程的完整演练说明。 3. 规格高度明确的构建任务(Highly specified build task) * 示例:先对需求进行深度访谈并生成详细规格书(Spec),再交由模型执行。 * 表现:在给定详尽 Spec 的情况下,不同 Effort 层级生成的代码结构和设计非常相似。但在最大 Effort 下,Claude 会花费额外时间对部分细节进行精简和优化。 三、 复杂任务与基准测试(Terminal Bench 3.0)深度分析 Terminal Bench 3.0 是一个社区驱动的基准测试,涵盖安全、硬件、机器学习、科学、软件、运维和媒体等高难度领域。在该测试集上的对比进一步揭示了高 Effort 的核心价值。 1. 高难度任务类型示例 * 硬件 (retro-console-soc):用 Verilog 编写一个适配小型 FPGA 的 8 位游戏主机,并运行测试 ROM。 * 科学 (takens-embedding-lean):在 Lean 4 中形式化证明 Takens 嵌入定理。 * 机器学习 (mp-checkpoint-consolidation):将专家混合(MoE)检查点的 16 个分片合并为一个能够复现参考 logits 的文件。 * 运维 (intrastat-meldung):端到端运行一家公司月末的欧盟贸易统计申报。 * 媒体 (layout-config-recreation):将海报图像重建为可编辑的布局文件。 2. 高 Effort 应对复杂边角情况的具体案例 任务名称与领域 模型与 Effort 级别变更 低 Effort 表现 高 / 超高 Effort 表现 html-js-filter<br>(安全:HTML 清洁器) Fable 5.1<br>1/5 (Low) $\rightarrow$ 5/5 (XHigh) 耗时约 2 分钟。单次生成过滤代码,仅针对单个手写页面进行简单测试。 耗时约 33 分钟。对初稿进行对抗性审查,阅读已安装解析器的源码以排查 Bug,运行标准 XSS 测试集,并编写随机文档模糊测试器(Fuzzer)。 mvcc-lsm-compaction<br>(存储引擎 Bug 修复) Opus 5.5<br>0/5 (Low) $\rightarrow$ 4/5 (XHigh) 耗时约 1 分钟。在构建或运行复现脚本前就直接修改代码,未验证新测试是否能捕捉原始 Bug。 耗时约 11 分钟。先复现崩溃问题,编写针对不合并参考系统的随机测试,并确认其测试能准确捕获未完成修复的代码缺陷。 cli-2ph-simple<br>(线性规划求解器) Opus 5.5<br>0/5 (Low) $\rightarrow$ 5/5 (High) 单次编写求解器,仅用少量简单问题测试,Token 消耗约 10k 即停止,未对大规模问题进行性能验证。 将求解器与独立的暴力求解器进行随机问题对比测试,对大规模问题计时,遇到超时或崩溃时主动重构搜索算法。 gsea-proteomics<br>(蛋白质组学数据分析) Opus 5.5<br>0/5 (Low) $\rightarrow$ 4/5 (High) 选择一种看似合理的方法预处理数据,运行一次分析即报告结果。 尝试了两种数据预处理方法,注意到显著治疗列表发生变化后深度排查原因,最终选择正确的方法。 四、 Effort 层级的选择策略与最佳实践流程 1. Effort 层级使用法则(Rule of Thumb) * Low(低):用于需要快速响应且保持人机协同的场景,如脑暴(Brainstorming)、概念草图绘制(Sketching)、简单变更。 * Medium(中):适用于大部分日常软件工程任务,如新功能实现(New feature implementation)。 * High(高):用于验证至关重要或存在大量潜在边角情况的场景,如在遗留/老旧代码库(Brownfield codebase)中修复 Bug。 * Max / XHigh(最大/超高):用于需要 Claude 全自主运行以解决极高难度问题的场景,如端到端的应用构建与验证、关键软件的安全性漏洞挖掘。 2. 软件功能开发的最佳循环流程(Recommended Iterative Loop) 为了兼顾开发效率与代码质量,建议采用以下四步开发循环: [1. 需求访谈] ──> 给定初始 Spec,让 Claude 采访自己以补全遗漏细节 │ ▼ [2. 低度构建] ──> 使用 Low / Medium Effort 进行初步代码实现 │ ▼ [3. 人工审查] ──> 检查核心逻辑是否正确,必要时在 Low Effort 下继续迭代 │ ▼ [4. 高度验证] ──> 切换至 High / Max Effort 进行全面的测试与深度验证 3. 操作方式 在使用 Claude Code 时,用户可以通过输入命令 /effort 在会话过程中或针对特定任务随时调整 Effort 层级。 thumb_up报告内容不错 thumb_down报告内容不好
EP155:智谱CEO唐杰-AI下一站,递归自我改进(RSI)智谱CEO唐杰指出,人工智能的演进已进入新阶段:递归自我改进(Recursive Self-Improvement, RSI),即AI开始具备自我进化及创造继任者的能力。在GLM-5.3的研发过程中,这一能力已得到实质性验证。通过由GLM-5.3驱动的底层设施代理(Infra Agent),智谱在两周内实现了GLM-5.3-Flash在国产芯片上的全流程部署优化,端到端吞吐量提升至3.2倍。这一过程的核心在于将人类工程师的隐性经验显性化为“稠密反馈”系统,通过资源置换和自动化迭代,使Agent完成的每一项任务都成为下一代模型的训练信号。 递归自我改进(RSI):AI 的下一站 AI 发展的核心趋势正从单纯的人类驱动转向递归自我改进(RSI)。其定义与表现如下: * 核心定义: AI 自我进化、自己创造自己的继任者。 * 早期迹象: 在 GLM 系列模型的研发中,高级别模型(如 GLM-5.3)已开始辅助优化轻量化模型(如 GLM-5.3-Flash)的底层部署与性能表现。 实战案例分析:GLM-5.3 驱动的 Infra Agent 智谱利用 GLM-5.3 驱动的 Infra Agent 针对国产加速卡进行了深度优化,取得了显著的效能提升。 1. 任务成果 * 研发周期: 仅用两周时间,完成从第一次跑通到承载全线流量的过程。 * 性能提升: 端到端吞吐量提升至原来的 3.2 倍。 2. 克服的底层挑战 国产芯片环境存在多重限制,Infra Agent 必须在以下困难条件下工作: * 硬件约束: 显存受限、互联带宽受限。 * 需求复杂: 需同时支持 1M 超长上下文和多模态请求。 * 生态缺失: 生态不成熟,算子不完备,且相关技术文档极其匮乏。 3. 三大关键技术突破 优化哲学与方法论 1. 资源置换原则 每一项性能优化在本质上都是对底层资源的重新分配与置换: * 以算换存: 通过增加计算量来减少显存占用。 * 以通信换显存: 利用数据传输缓解存储压力。 * 以精度换容量: 在可接受范围内调整精度以提升存储效率。 * 以分离换调度自由: 通过架构解耦获取更高的调度灵活性。 2. 隐性经验显性化:稠密反馈系统 为了让 Agent 替代资深工程师,需要将工程师头脑中的“隐性经验”(如观察时间线、跑微基准、分层对比输出等)转化为 Agent 可调用的显性工具,构建稠密反馈机制。 反馈系统的三大支柱: * 正确性反馈: 验证计算结果是否准确。 * 系统行为反馈: 分析时间消耗的分布情况。 * 性能反馈: 对比不同方案在特定条件下的优劣。 反馈标准: 所有的反馈必须具备局部化、廉价化、可客观验证的特点。 结论与未来展望 递归自我改进(RSI)的核心逻辑在于建立一个高效的反馈闭环。一旦“反馈-验证”系统建立,真实的部署和优化任务就会源源不断地产生高质量的训练信号。 这种模式意味着:Agent 每一个成功完成的任务,都不再仅仅是一次工具性的输出,而是为其继任者(下一代模型)提供的实战训练场。 这种自我强化的循环将极大地加速大模型的进化速度与落地效率。
EP154:什么是FDE?Anthropic大牛一次讲明白将最宝贵的工程师派往客户一线,这听起来像是一场豪赌,但Palantir却凭借这一“反常识”的FDE(前置部署工程师)模式,创造了远超行业巨头400万美元的惊人客单价。本期节目,我们邀请到前Palantir及Rippling创始FDE、现Anthropic技术专家Kevin Bai,为你深度拆解这一被誉为“企业服务核武器”的增长飞轮,揭示其从0到1的构建心法。 Palantir曾面临一个棘手难题:如何将一个极其复杂的技术平台卖给那些对数据如何组织毫不在意的财富500强客户?他们给出的答案是:不卖软件,卖“最终结果”。Kevin分享道,FDE模式的核心是将初创公司验证产品市场契合度(PMF)的“设计伙伴”模式规模化,派遣工程师深入客户业务,直接为其构建解决方案。这种将产品与服务深度绑定的打法,不仅解决了客户的学习成本问题,更创造了高达400万美元的平均合同价值(ACV),是第二名ServiceNow的三倍多,证明了其在企业服务市场的巨大威力。 您将了解到: * 将工程师派往一线,Palantir如何凭借这一“反常识”的FDE模式,创造出远超行业巨头的400万美元平均合同价值? * 将初创公司的“设计伙伴”模式规模化,应用到服务世界500强企业,这背后隐藏着怎样的核心逻辑与关键陷阱? * 在AI让软件定制无处不在的今天,为什么说几乎所有公司都将面临“客户不知道产品能做什么”的困境,而FDE或许是唯一的解药? 💡时点内容 | Key Topics * [01:48] 销售最终结果:Kevin Bai回顾了Palantir的商业模式,指出单纯销售技术平台效率低下,因为客户需要投入巨大成本学习。他强调,Palantir的成功在于将产品与服务结合,通过派遣工程师为客户构建解决方案,从而交付一个客户真正关心的“最终的结果”。 * [05:04] FDE模式的适用场景:Kevin Bai分析了FDE模式的适用场景,指出它并非万能。他强调,只有当公司需要“把一个技术性极强的产品,卖给一个非技术的买家”时,FDE模式才成为必要选择,这正是Palantir面对财富500强非技术客户时的核心打法。 * [05:31] 规模化的设计伙伴关系:Kevin Bai揭示了FDE模式的本质,将其比作初创公司寻找产品市场契合点(PMF)的“设计伙伴关系”。他认为,Palantir的核心论断在于挑战传统观念,并提出“谁说设计伙伴关系只能存在于公司的初创阶段?为什么不能把它规模化呢?” * [08:33] 平台构建的重要性:Kevin Bai强调了平台在FDE模式中的核心作用,指出如果FDE团队为每个客户从零开始写代码,那本质上就是一个“软件外包公司”。他认为,FDE成功的关键在于工程师们是在一个拥有共享基础模块的平台上进行构建,从而避免重复造轮子和高昂的维护成本。 * [11:27] 实施FDE的两大拷问:Kevin Bai为考虑引入FDE模式的公司提供了两个核心自检问题。他建议,公司必须首先判断是否“需要”而非“想要”该模式,即是否存在向非技术买家销售复杂产品的场景。其次,他强调了拥有一个可供构建的平台是避免陷入维护困境的必要条件。 * [11:55] AI时代的FDE新常态:Kevin Bai预测了AI对软件商业模式的深远影响,认为AI让软件定制变得极其容易。他指出,这导致几乎所有平台都变得可定制,从而使更多公司面临Palantir曾遇到的困境,即“你们的客户根本就不知道你们的产品究竟是做什么的”,这使得FDE模式变得更加普遍。 * [14:52] 理想FDE的画像:Kevin Bai在分享的最后,描绘了理想FDE(前置部署工程师)的画像。他总结道,FDE本质上是“一名面向客户的软件工程师”,这个角色需要具备双重能力:既要有过硬的技术实力,能胜任软件工程师的本职工作,又要具备出色的沟通和客户服务能力,值得被信赖并直接面对客户。 📺相关链接与资源 [视频来源]《Forward Deployed Engineering 101 — Kevin Bai, Anthropic, ex Palantir & Rippling Founding FDE》
EP153:SpaceXAI 工程师分享AI智能体工程从“微管理”到“自动驾驶”如何从一个不信任AI智能体的资深工程师,转变为让AI一夜之间为你自动合并20个代码拉取请求(PR)的管理者?这并非科幻,而是智能体驱动开发的真实前沿。本期节目,我们邀请到了xAI工程师Lauren Tan,她将彻底颠覆你对AI协作的认知,分享她如何通过建立一套严格的“护栏”系统,攀登信任曲线,并实现了个人生产力的指数级爆发。 Lauren Tan的经历是每一位与AI协作的工程师的缩影。最初,她也深陷于对AI智能体“幻觉”和不可靠输出的不信任之中,感觉自己像在微观管理一个不靠谱的下属,效率低下。然而,在短短五个月内,她通过构建强大的“验证能力”和“功能地图”,成功攀登了“信任曲线”,从月产几十个PR跃升至上千个。如今,她的AI智能体已经可以自主合并代码,甚至在她醒来前就完成了20个PR的部署。这个惊人的转变不仅带来了个人生产力的飞跃,更预示着软件开发范式的根本性变革。 您将了解到: * 如何从不信任AI智能体,到让它一夜之间自动合并20个PR? * 为什么“永远不要重写代码”的工程铁律,在AI时代可能需要被重新审视? * 如何通过设置“硬性约束”和“功能地图”,让AI智能体只能写出高质量、可信赖的代码? 💡时点内容 | Key Topics * [01:40] AI协作的信任鸿沟:Lauren Tan分享了她在与AI智能体协作初期的挣扎,指出工程师因AI的“幻觉”和不可靠性而难以信任它们。她将这种不信任比作微观管理一个工程团队,并认为“当你对你的智能体没有太多信任时,你就真的无法发挥出它们的最大潜力。” * [04:35] 攀登信任曲线:Lauren Tan透露她通过五个月的努力攀登了“信任曲线”,实现了AI智能体自动合并PR的里程碑,并展示了其个人生产力的指数级增长。她强调,与AI协作最重要的技能是验证能力,因为这至少能“让它们写出……正确的代码。” * [10:25] 验证能力与功能地图:Lauren Tan详细阐述了“验证能力”的重要性,即赋予AI智能体实际运行和测试代码的能力。她分享了为解决AI智能体不理解应用结构的问题而创建的“功能地图”,并指出这个地图能“教会 agent 如何找到你应用里的所有功能”,从而极大地提升了AI处理模糊用户反馈的效率。 * [19:10] 智能体的单元测试:Lauren Tan介绍了她维护和迭代AI技能的方法,即使用“评估”(evals)体系。她将evals比作“为智能体准备的单元测试”,并详细描述了通过主协调智能体和子智能体进行自动化测试的流程,甚至可以采用“爬山式”的优化方法,让评估流程持续循环直到所有指标达标。 * [30:51] AI时代的重构哲学:Lauren Tan提出了一个反传统观点,认为在AI时代重写代码是必要的,尤其对于新项目。她分享了通过提交超过600个PR来重构Grokbot的经历,并强调建立一个带有多重“护栏”的严格架构至关重要,因为这能确保“最短路径就是最佳路径”,从而引导AI智能体写出高质量代码。 * [39:55] 硬性约束与架构护栏:Lauren Tan详细介绍了她为Grokbot构建的CI系统中的“硬性约束”,例如完全禁用ReactuseEffect和代码注释。她认为,应将所有依赖人工审查的规则视为反模式,并反思“我怎么才能把它变成一个硬性规则?怎么把它变成一个lint规则?” * [55:12] 赋能整个组织:Lauren Tan指出,一个经过精心设计的、带有严格约束的架构,其价值远超个人效率提升。她分享了Grokbot如何赋能产品经理和设计师直接提交高质量代码的案例,并认为这证明了“正是所有这些非常严格的约束,才让那些不是工程专家的人,也能够做出高水平的贡献。” 📺相关链接与资源 [视频来源]《'SpaceXAI engineer, Lauren Tan 'GrokBot is the most powerful agentic tool we have ever》 本播客采用虚拟主持人进行播客翻译的音频制作,因此有可能会有一些地方听起来怪怪的。如想了解更多信息,请关注微信公众号"AI西经东译"获取AI最新资讯。如有后续想要听的其他外文播客,也欢迎联系微信:mayday2303。
EP152:Agent Lightning-开启“带装具”的智能体强化学习新范式本文档《Agent Lightning v1.0: Towards Harnessed Agentic RL》概述了 Agent Lightning v1.0,这是一个旨在解决“受控代理强化学习”(Harnessed Agentic RL, HARL)挑战的轻量级框架。与传统代理强化学习(RL)不同,HARL 范式中,代理的部署环境(即“Harness”,负责管理工具、上下文和控制流)直接参与模型的训练,从而缩小了训练与实际使用之间的差距。 核心发现与成就: * 范式转移: 确定了 HARL 与传统 RL 的根本区别——在 HARL 中,支架(Harness)拥有环境交互循环,而训练引擎仅观察到一系列 LLM 请求-响应对。 * 技术挑战: 系统性地阐述了重新分词(Retokenization)、样本合并、优势计算、损失归一化以及后端调度等关键挑战。 * 框架优势: Agent Lightning v1.0 仅用约 3,500 行代码实现,支持任意代理支架,并引入了“同址异步 RL”(Collocated Async RL)以提高 GPU 利用率。 * 显著性能提升: 在编码代理任务中,仅使用 6,000 个训练样本,便将 Qwen3.5-9B 在 SWE-bench Verified 上的表现从 41.8% 提升至 56.4%,实现了 14.6% 的绝对增长。 1. 核心概念:受控代理强化学习 (Harnessed Agentic RL) 现代 AI 代理并非作为独立的 LLM 运行,而是在管理工具、执行环境和控制流的“代理支架”(Agent Harness)内运行。 1.1 传统代理 RL vs. 受控代理 RL 特性 传统代理 RL 受控代理 RL (HARL) 交互所有权 训练引擎拥有环境交互循环 代理支架(Harness)拥有该循环 状态观察 策略模型直接与环境交互,观察连续令牌历史 策略模型仅观察由支架构建的独立请求提示词 潜在状态 主要是环境状态 包含支架状态 + 环境状态 数据表现形式 单一线性令牌轨迹 一系列请求-响应对 $(p_1, a_1), (p_2, a_2), \dots$ 1.2 支架的核心作用 支架决定了代理如何观察环境、跨长周期执行行动以及从错误中恢复。常见的支架包括用于编码的 mini-SWE-agent、OpenHands,以及通用支架 OpenClaw 和 Hermes。 2. 受控代理 RL 面临的主要挑战 研究识别出四个影响算法正确性和训练稳定性的关键挑战: 2.1 重新分词与样本合并 (Retokenization & Sample Merging) * 令牌前缀断裂: 即使文本内容相同,重新分词(Retokenization)后的令牌 ID 可能会发生变化。这通常由聊天模板的非组合性、解码-再分词漂移或推理时的输出转换(如 JSON 修复)引起。 * 后果: 导致连续调用无法安全合并,增加了计算冗余。 2.2 优势计算 (Advantage Calculation) * 动态样本数: 由于重新分词、子代理产生或上下文摘要,一个任务级的 Rollout 可能会产生多个训练样本。 * 统计偏差: 如果在样本层级计算优势,会给产生更多样本的 Rollout 分配更高的权重。研究认为 Rollout 层级的优势计算 是更原则性的选择。 2.3 损失归一化 (Loss Normalization) * 不稳定性: 如果按样本层级归一化损失,会导致训练不稳定。 * 推荐方案: 采用 Rollout 层级的令牌平均损失(Rollout-level token-mean loss),确保每个 Rollout 在梯度更新中具有相等的权重,不受其产生的样本数量影响。 2.4 训练后端调度 * 由于 Rollout 产生的样本数量和长度只有在执行后才能确定,后端必须在固定的 GPU 集群上动态平衡多变的工作负载,同时保持 Rollout 的统计完整性。 3. Agent Lightning v1.0 系统设计 Agent Lightning v1.0 采用解耦架构,通过以下三个主要组件协调训练与执行: 3.1 架构组件 * API 网关 (API Gateway): 充当事实来源,存储 Rollout 状态和事件。它作为 LLM 代理转发请求,并自动记录模型交互事件。 * Rollout 控制器 (Rollout Controller): 管理代理的执行。它支持 Kubernetes (K8s) 集群,将每个代理任务调度为标准的 K8s Job,避免了对昂贵的商业沙盒服务的依赖。 * 自定义训练器 (Customized Trainer): 基于 VERL 构建,负责注册 Rollout、检索轨迹并组装训练样本。 3.2 关键技术特性 * 同址异步 RL (Collocated Async RL): 允许 Rollout 和权重更新共享同一组 GPU 池。当收集到足够数据时切换到更新阶段,API 网关会暂停新请求。相比同步 RL,实现了约 2 倍的端到端加速。 * 网络鲁棒性: 设计了幂等的 API 端点,并能通过提示词去重来处理网络重试导致的重复 LLM 调用。 * 简单性原则: 整个框架代码量约为 3,500 行,易于扩展和研究。 4. 实验结果与验证 4.1 编码代理 (Coding Agent) 案例研究 这是本研究的重点,展示了在资源有限的情况下实现显著性能提升的路径。 * 数据处理: 使用 SWE-smith 数据集,通过过滤空说明、缺失分支和过大测试套件,最终筛选出约 6,000 个高质量训练样本。 * 奖励欺骗 (Reward Hacking) 防护: * 禁用 Git 命令并隐藏 .git 目录,防止模型查看提交历史。 * 实施 K8s 网络策略,屏蔽通用的外部网络访问。 * 训练表现: * SWE-bench Verified 提升: Qwen3.5-9B 从 41.8% 提升至 56.4%。 * 策略稳定性: 实验验证了 Rollout 层级的优势计算和损失归一化能提供最高且最稳定的验证集奖励。 4.2 其他代理类型 * 搜索代理 (Search Agent): 在 HotpotQA 等多跳问答任务上,验证集奖励从 25.1% 提升至 41.7%。 * 通用指令遵循代理: 在多样化的计算机沙盒任务中,验证集奖励从 51.9% 提升至 70.2%。 5. 结论 Agent Lightning v1.0 为受控代理强化学习提供了一个高效且透明的测试床。通过系统性地处理 HARL 特有的建模挑战(如 Rollout 层级的统计处理),该框架证明了即便使用中等规模的计算资源和开源模型,也能在复杂的软件工程任务中取得突破性进展。该项目已在 GitHub 开源,以促进该领域的可重现性研究。
EP151:AI软件工厂-软件开发的终极自动化Cole Medin并非空谈理论,他已经将这个想法付诸实践。受到Dan Shapiro“AI编码五个自主级别”理论的启发,他进行了一项大胆的实验,旨在达到最高级别的完全自主编程。最终,他成功地利用自己的“黑灯工厂”系统,从零开始构建了一个名为“dinna chat”的AI导师应用,整个过程没有编写甚至没有看过一行代码。这个成功的案例让他坚信,AI软件工厂已经准备好从原型设计走向更广泛的商业应用,他也因此决定将自己的YouTube频道全部精力投入到构建一个普惠大众的开源AI软件工厂中。 * AI软件工厂如何将一份高级规划文档,自动转化为可直接上线的代码? * AI编码的五个自主级别是什么?为什么嘉宾认为我们已经准备好迎接最高级别的全自动编程? * 完全不写一行代码,真的能开发出一个功能完整的应用程序吗?嘉宾分享了他惊人的实验成果。 * 为什么嘉宾决定豪赌一把,投入全部精力构建一个开源AI软件工厂?普通开发者如何参与其中? 💡时点内容 | Key Topics AI软件工厂的终极愿景:什么是AI软件工厂,或称“黑灯工厂”?嘉宾解释了AI编码的终极进化形态:一个能将高级规划文档直接转化为已部署生产代码的系统。他深入探讨了这一自动化流程如何处理任务拆分、代码生成、代码审查和合并,全程无需人工干预。这个曾经看似科幻的愿景,如今正成为企业可行的实用工具。 AI编码自主性的五个级别:借鉴Dan Shapiro著名的自动驾驶汽车类比,嘉宾详细解读了AI编码自主性的五个级别。他解释了我们如何从基础的AI辅助(第一级)发展到他目前主要教授的模式(第三级),即人类深度参与规划和验证。而终极目标第五级,就是“黑灯工厂”,AI将做出所有微观决策,人类只需提供高层指导。 真实世界的实验:零代码构建应用:AI工厂真的能构建出实际产品吗?嘉宾分享了他的亲身实验,他使用自己的“黑灯工厂”系统,从零开始完整地构建了一个名为“dinna chat”的应用程序。他强调了一个关键事实:在整个开发过程中,他没有编写甚至没有看过任何一行代码。这个案例成功证明了当前自主编码代理的强大能力。 下一个宏大项目:为所有人构建开源AI工厂:嘉宾宣布了他雄心勃勃的新项目:构建一个任何人都可以下载和使用的完全开源的AI软件工厂。他解释说,这是软件开发的未来,而挑战极限也能迫使他构建出更可靠的AI代理。他邀请所有开发者一同踏上这段旅程,共同引领这场技术变革。 📺相关链接与资源 [视频来源]《AI Software Factories Are the Next Big Thing (And I'm Building You One)》 本播客采用虚拟主持人进行播客翻译的音频制作,因此有可能会有一些地方听起来怪怪的。如想了解更多信息,请关注微信公众号"AI西经东译"获取AI最新资讯。如有后续想要听的其他外文播客,也欢迎联系微信:mayday2303。
EP150:深度采访OpenAI高管Tibo-揭秘颠覆行业的产品文化密码在ChatGPT改变世界的前一年,谷歌内部早已诞生了类似的产品,却因“过于紧张”而错失先机。本期节目,我们邀请到了曾亲历谷歌DeepMind和现任职于OpenAI的Tibo,他将揭示OpenAI颠覆行业的文化密码,并带我们预见下一代AI将如何彻底重塑我们的工作与生活。 从谷歌“无法发布产品”的组织困境,到OpenAI“极少有阻力”的赋能文化,Tibo分享了他眼中两家巨头的本质差异。他强调,OpenAI成功的关键在于愿意“自我颠覆”,即使这意味着调整核心业务也要抓住未来浪潮,甚至为此设置了一个真实的“重置按钮”,体现了对用户和创新的极致承诺。 您将了解到: * 谷歌当年为何“不敢”发布自己的ChatGPT?OpenAI的文化究竟有何不同,能让它颠覆整个行业? * 未来的AI助理将如何超越你的笔记本电脑,成为一个能理解你一切需求的“无缝协作伙伴”? * AI如何通过“递归式自我改进”实现成本骤降80%?这是否预示着超级智能的到来将比我们想象的更快? 💡时点内容 | Key Topics * [00:57] 谷歌的束缚与OpenAI的颠覆:Tibo回顾了他在谷歌DeepMind参与LaMDA Chat项目的经历,透露当时DeepMind的组织架构并非为发布产品而设计。他强调OpenAI的文化截然不同,是一种自下而上的赋能文化,鼓励快速迭代,并指出“在这里,研究和产品部门的协作超级紧密”。 * [03:36] 快速迭代与自我颠覆:Tibo分享了OpenAI赋能文化的具体元素,强调了坚定的信念、快速的用户反馈迭代以及“愿意自我颠覆”的重要性。他认为,即使这意味着从主营业务中重新分配资源,公司也必须能够判断投资新想法的正确时机,以抓住下一波浪潮。 * [06:15] 超越笔记本的AI伙伴:Tibo预测,下一代模型将远超笔记本电脑的处理能力,并指出未来的AI将演变为能深度理解用户目标与工作流的“完美的、无缝协作的伙伴”。他认为,人类的能力限制了笔记本电脑的设计,而AI没有同样的限制,可以并行处理海量任务。 * [14:13] 适应所有人的统一界面:Tibo解释了合并ChatGPT和Codex的战略意图,透露其目标是构建一个能适应所有人的完美界面。他认为,用户不应被“软件工程师”或“设计师”等标签限制,未来的产品将是同一个,但会根据每个用户的独特性进行调整,实现“技术来主动适应你”。 * [22:10] “重置按钮”的文化内涵:Tibo透露了“重置”功能的起源,指出这并非复杂的营销策略,而是源于对用户的真诚关怀。他分享道,当产品体验未达预期时,团队会主动补偿用户,现在甚至有了一个实体按钮,他可以“在任何我觉得合适的时机按下那个按钮”。 * [27:29] 递归式自我改进的应用:Tibo报告称,OpenAI正利用其最强大的模型来开发和优化支撑它们运行的基础设施,这是一种实际应用中的“递归式自我改进”。他强调,这不仅带来了巨大的成本和速度效率提升,也是团队能用极小规模完成复杂优化的关键。 * [35:56] 极速模式的未来普及:Tibo预测,当前“超快模式”所代表的速度,可能在一两年内成为常态。他认为,随着推理硬件和模型效率的持续创新,AI完成任务的速度会不断提升,并强调这与OpenAI提供广泛可及性和实用性的目标完全一致,技术总会“随着时间变得极其高效”。 📺相关链接与资源 [视频来源]《How to Understand the Next Wave of AI Before Everyone Else》 本播客采用虚拟主持人进行播客翻译的音频制作,因此有可能会有一些地方听起来怪怪的。如想了解更多信息,请关注微信公众号"AI西经东译"获取AI最新资讯。如有后续想要听的其他外文播客,也欢迎联系微信:mayday2303。
EP149:Anthropic内部AI Native经验公开-原生SDLC实施手册随着生成式AI(如Claude Code)将代码编写速度提升至前所未有的水平,传统的软件开发生命周期(SDLC)已成为生产力的瓶颈。Anthropic发布的《AI原生SDLC指南》指出,软件开发的约束点已从“构建阶段”转移到了其左右两端的“计划、评审、测试和部署”阶段。 AI原生SDLC的核心在于将传统的线性过程重塑为自动化循环,通过在每个阶段嵌入AI代理(Agents),实现从人类编写代码到人类“在关口进行审查”的转变。其关键目标是让流程速度匹配AI的产出速度,同时通过版本控制的Markdown文件(如 intent.md, plan.md, CLAUDE.md)确保治理的透明度与一致性。 核心挑战:代码不再是瓶颈 传统SDLC的设计初衷是为了在代码编写(曾经最昂贵、最耗时的阶段)过程中确保问责制和控制。然而,在AI时代: * 瓶颈移位:构建阶段缩短至数小时,而计划、评审和部署仍处于“人类速度”。 * 控制失效:当AI代理生成大量代码差异(diff)时,逐行人工审查变得难以为继。 * 治理成本上升:若决策仍需通过周会或委员会,治理成本将抵消AI带来的效率提升。 传统SDLC与AI原生SDLC的对比 阶段 传统 SDLC AI原生 SDLC (基于Claude) 计划 (Plan) 委员会收集需求,通过研讨会和手工记录。 Claude从源头综合痛点,生成机器可执行的 intent.md。 设计 (Design) 分析师编写规范,设计师解析规范。 需求与设计压缩在一次代理会话中,通过“技能”编码标准。 构建 (Build) 手写测试和代码,事后补齐文档。 AI生成测试与代码,知识维护在 CLAUDE.md 和“技能”中。 测试 (Test) 阶段边界处的QA关口。 持续评估(Evals)贯穿整个实施过程。 部署 (Deploy) 人工审查每一行,治理周期不一致。 代理层级审查,人工仅负责受监管和关键代码。 维护 (Maintain) 人工监控生产环境漏洞。 代理监控部署,自动诊断并将问题写回 intent.md 循环。 AI原生SDLC的六个关键阶段 1. 计划 (Plan):将想法转化为意图 AI原生流程始于 intent.md。当发起者(不一定是工程师)有想法时,直接与Claude进行头脑风暴,生成人类可读且机器可操作的 proto-spec。 * 核心产出:intent.md。包含问题、提议结果、受影响的用户/系统及约束条件。 * 优势:消除了传统流程中因层层移交导致的需求失真,将周期从数周缩短至数小时。 2. 设计 (Design):需求与设计的融合 在AI原生模式下,设计和需求规格说明在一个会话中完成。 * 技能驱动:组织可以将品牌指南、安全策略和UX标准编写为“技能(Skills)”。Claude在生成 spec.md 时会自动应用这些约束。 * 治理建议:所有被Claude标记的风险点需由人类政策所有者先行解决,然后再进入构建阶段。 3. 构建 (Build):计划先行与知识文件化 构建阶段不再直接跳入编码,而是采用“计划模式(Plan mode)”。 * 核心工具: * plan.md:在编码前,Claude会列出修改的文件、工作顺序和证明成功的测试,由工程师确认。 * CLAUDE.md:存放项目特定的上下文(如构建命令、架构规则、常见错误),类似于给AI代理的“新人指南”。 * 并行会话 (Parallel Sessions):一名工程师可同时驱动多个Claude Code实例(通过git worktrees),大幅提升吞吐量。 * 钩子 (Hooks):作为确定性的构建时护栏,拦截不安全的操作(如修改受保护的路径)。 4. 测试 (Test):AI自我反馈循环 AI必须具备验证自身工作的能力。 * 反馈循环:Claude在向人类报告完成前,需运行测试、构建并执行视觉检查(如截图对比)。 * 持续评估 (Continuous Evals):在CI中运行50个以上的真实任务样本,确保更换模型或更改提示词(Prompts)时,系统性能不会退化。 5. 部署 (Deploy):AI辅助审查与治理 部署阶段强调“职责分离”,编写代码的AI代理不能自行批准代码。 * PR评审循环:Claude会针对 REVIEW.md 中定义的 pass(如逻辑错误、安全漏洞、合规性)审查PR。 * 托管设置 (Managed Settings):对于受监管企业,平台团队可实施不可覆盖的设置(如禁止读取 .env 文件、禁用外部网络访问)。 6. 维护 (Maintain):闭环自动化 这是SDLC从线性转为循环的关键。 * 自动触发:生产环境的监控脚本(如CI失败率超标)自动调用Claude进行诊断。 * 修复流程:Claude诊断后生成新的 intent.md,重新进入计划阶段。 * Claude Security:定期运行全库扫描,识别 context-dependent 的漏洞,并在网页端生成建议补丁。 关键技术组件 * 技能 (Skills):组织机构化知识的载体,版本化控制并集中更新。 * 子代理 (Subagents):主会话中专注于特定任务(如简化代码、运行验证)的微型助手,拥有独立上下文。 * MCP (Model Context Protocol):用于将Claude连接到外部部署工具、数据库或监控系统。 * Claude Tag:使Claude能够加入Slack等协作工具,作为第一响应者处理事件。 总结与建议 转型为AI原生SDLC并非要消除人类参与,而是要将人类注意力转移到: 1. 定义意图(我想实现什么?)。 2. 设置护栏(有哪些不可逾越的规则?)。 3. 最终评审(AI产出是否符合初衷?风险是否可控?)。 这种模式不仅提升了开发速度,更通过贯穿始终的 Markdown 审计跟踪(Audit Trail),为大型企业提供了比传统手动流程更严密的治理能力。
EP148:无国界创始人-全球科技创始的新范式为什么下一代最伟大的创业者将是“无国界”的?他们不仅拥有改变本土市场的雄心,更具备在全球舞台上竞争的视野和韧性。在本期节目中,我们与嘉宾Elena Burger一同探讨这一新兴群体的崛起,揭示他们如何凭借独特的“局外人”优势,在技术浪潮中找到颠覆性机会,并最终成为定义未来的力量。 a16z的全球投资策略,始于一个偶然的WhatsApp群组。Elena Burger分享了团队最初如何从拉美市场发现巨大机遇,见证了Nubank等公司在“五家肥胖快乐的银行”主导的市场中开辟蓝海。她描绘了这批“无国界创始人”的独特画像:他们带着“证明自己”的动力,将在美国学到的先进模式与对本土市场的深刻理解相结合,从零开始搭建支付、KYC等全套基础设施。这种在资源匮乏环境中磨练出的“全栈”能力,以及在AI浪潮下主动拥抱硅谷的战略选择,正是他们构筑独特竞争壁垒的关键。 您将了解到: * 为什么说最顶尖的“无国界创始人”能将本土洞察与全球视野相结合,在看似饱和的市场中找到一片蓝海? * AI浪潮如何既“民主化”了技术,又将创新中心“集中化”到硅谷?国际创始人应如何利用这一矛盾,建立独特的竞争壁垒? * 什么是“AI奥运会”?科技公司如何能成为“国家选手”,并借助品牌优势获得政府支持和早期关键客户? 💡时点内容 | Key Topics * [01:28] 蓝海市场的巨大机遇:Angela Strange回顾了她对拉美市场的初步兴趣,分享了Nubank创始人的观点,并指出在这些新兴市场成为客户的第一选择,远胜于在美国成为第五选择。她认为,尽管面临基础设施搭建的挑战,但“摆在面前的,是无比广阔的蓝海市场”。 * [04:11] 无国界创始人的独特画像:Gabriel Vásquez描绘了早期拉美优秀创始人的共同特质,指出他们通常在本土长大,去美国学习或工作,最后选择回国创业。他认为,这种经历让他们既能“了解在美国被验证成功的商业模式,又对本土市场有非常深刻的理解”。 * [06:54] AI引发的创新二元性:嘉宾分析了AI带来的有趣分化,指出技术本身是“民主的”,为新兴市场打开了大门,但它同时也“把创新的中心,也就是发展最快的地方,高度集中到了湾区”。这改变了国际创始人与硅谷的连接方式,从希望投资人去当地,变为他们主动来到湾区。 * [09:50] 媲美校友圈的社群力量:Angela Strange将海外创始人社群比作顶尖大学的校友网络,并分享了她创办加拿大C100组织的经历。她强调,这些社群凝聚力极强,为创始人提供了回馈平台,帮助他们“找到一些初期的设计合作伙伴”和扩张所需的关键高管人才。 * [18:28] “AI奥运会”的国家品牌优势:Gabriel Vásquez将全球AI竞争比作“AI奥运会”,并以波兰公司ElevenLabs为例,说明成功的无国界公司如何成为国家骄傲。他指出,这种地位能带来政府投资与合作,从而在大型企业客户面前“获得巨大的先发优势和信誉背书”。 * [21:23] 加速增长的“优先链接”:嘉宾探讨了无国界创始人如何利用其独特背景加速“优先链接”效应,指出他们能接触到差异化的人才库,并能更快地拿下其他国家的大型企业作为标杆客户。这种优势可以“极大地加速你在美国的业务进展”,为增长飞轮提供更多筹码。 * [24:06] 寻找“本地领袖”:Gabriel Vásquez揭示了a16z开拓新市场的核心策略,即首先识别并赋能“本地领袖”(local luminaries)。他解释道,这些人是生态系统中最受尊敬的关键人物,通过帮助他们,投资机构能“完全融入了整个信息流”,从而接触到最优秀的人才。 * [38:34] 亲赴硅谷校准速度:嘉宾给国际创始人的核心建议是,一定要来硅谷待上一段时间,并推荐至少停留三到六个月以深度融入。他强调,这段经历最重要的价值在于帮助创始人“校准了对‘速度’的认知”,因为“硅谷至今仍然领先于其他所有生态系统的一点,就是这里人们的运作速度”。 📺相关链接与资源 [视频来源]《Why the Next Great Founders Will Be Borderless》 本播客采用虚拟主持人进行播客翻译的音频制作,因此有可能会有一些地方听起来怪怪的。如想了解更多信息,请关注微信公众号"AI西经东译"获取AI最新资讯。如有后续想要听的其他外文播客,也欢迎联系微信:mayday2303。
EP147:AI时代的人才进阶-Netflix为何押注「系统思维」的人当AI让产品经理能写代码,设计师能写文档,工程师能做产品时,我们迎来了“人人皆是创造者”的时代,也陷入了“我的工作还剩下什么”的职业迷思。本期节目,我们再次邀请到Netflix首席产品与技术官Elizabeth Stone,她将从Netflix独特的企业文化出发,深刻剖析为何在AI时代,“系统性思考者”远比精通单一领域的专才更加重要。 在这场激荡的对话中,Elizabeth Stone将当前AI引发的职能模糊期定义为新技术诞生前的“风暴期”。她坦言,尽管角色界限变得模糊,但顶尖的工程、数据科学与创意能力依然是稀缺资源。更重要的是,Netflix赖以成功的“卓越操作系统”——一种赋予员工高度自主权、鼓励冒险并坦然面对不适感的文化,正成为AI时代的人才孵化器。这种文化摒弃了传统大公司的繁琐流程,转而寻找那些能够跨越业务领域、抽象出核心构建模块的“系统性思考者”,因为他们才是推动组织在变革中高速进化、保持卓越的关键。 您将了解到: * AI让产品、设计、工程的界限日益模糊,你的角色价值还剩下什么? * 为什么Netflix认为,在AI时代,“系统性思考者”比精通单一领域的专才更重要? * Netflix如何将“卓越”打造为一套可复制的“操作系统”,并坦然面对其带来的不适感? 💡时点内容 | Key Topics * [01:35] 系统性思考者崛起:Elizabeth Stone透露,Netflix现在对一类人才的需求正不断增加,即系统性思考者。她指出,无论是构建通用基础设施还是设计系统,都需要人才能够审视全局,并从中抽象出“AI世界里所需要的基础构建模块”,从而在高速迭代中保证质量与效率。 * [02:04] 培养系统性思维:Elizabeth Stone分享了培养系统性思维的技巧:退后一步,审视对问题所处更大环境的预设。她建议,思考如何让工作帮助上级和同事,并将“选择对整个组织最有利的方案,而不仅仅是对你局部最有利的”这种心态,本身就定义为系统思维。 * [02:33] 卓越之路的不适感:Elizabeth Stone强调,实现“卓越操作系统”需要抵制大公司增加流程的常规做法,并坦然面对不适感。她分享了领导者需放手让团队承担风险,并指出最优秀的人才想要的是“‘无指责的复盘’,而不是一个充满各种清单、流程和关卡的地方”。 * [04:29] 职能模糊的“风暴期”:Elizabeth Stone指出,AI正让产品、设计和工程等职能界限变得模糊,并将当前阶段比作新技术来临前的“风暴期”。她认为,这并不意味着专业职能会过时,但强调团队需要适应新节奏,并建立护栏,反复强调“人类依然要为最终的结果负责”。 * [38:35] 卓越,如同一套操作系统:Elizabeth Stone将Netflix的文化比作“把卓越当作一个操作系统”。她指出,其核心是通过赋予员工高度的自主权和责任感来实现卓越,这包括高人才密度、下放决策权和承担风险。她认为,这种文化能“极大地激发员工的动力和责任感”。 * [1:03:41] 故事讲述的人性核心:Elizabeth Stone预测,在AI时代,人性将永远是故事的核心。她引用了一个说法:“当一个孩子出生时,他们首先需要食物、水和保护,然后他们会说,给我讲个故事吧。”她认为,技术可以放大故事的呈现方式,但无法取代故事与人类情感的连接。 📺相关链接与资源: [视频来源]《Why Netflix is betting on systems thinkers—not specialists—in the AI era》 本播客采用虚拟主持人进行播客翻译的音频制作,因此有可能会有一些地方听起来怪怪的。如想了解更多信息,请关注微信公众号"AI西经东译"获取AI最新资讯。如有后续想要听的其他外文播客,也欢迎联系微信:mayday2303。
EP146:聊聊DeepSeek Harness一切皆插件的智能Agent框架DeepSeek Harness (DSH) 开发者预览版(v0.1)已正式面向全球开发者开放,并以 MIT 协议开源。该项目旨在通过“一切皆插件”的设计理念,构建一个高度灵活、可组合的 Agent 基础设施。DeepSeek Harness 基于 Cordis 插件系统开发,允许开发者在无需修改源码的情况下,对模型、工具、技能、存储及 UI 等所有核心组件进行自由替换和扩展。目前,该版本提供四种运行模式以适应不同应用场景,并具备完善的会话追踪与日志回放能力,标志着开源 Agent 基础设施向高度模块化方向迈出的重要一步。 核心设计哲学:“一切皆插件” DeepSeek Harness 的技术核心在于其极度的模块化设计。这一设计确保了系统的灵活性与可扩展性,使其能够适应快速演进的 AI 技术环境。 * 基于 Cordis 的插件架构: DeepSeek Harness 构建于具有“时空可组合性”的 Cordis 元框架之上。 * 职责分离: Cordis 框架仅负责插件的生命周期管理(加载与卸载)及依赖关系处理。 * 组件化实现: Agent 的所有具体能力(包括模型、工具、会话管理、沙箱、调度等)均作为独立的 Cordis 插件存在。 * 开发者友好性: 开发者可以通过配置层自由组合插件,实现对任一能力的独立选择、替换或扩展,而无需改动 DeepSeek Harness 的核心源代码。 多样化的运行模式 为了覆盖从基准测试到自由创作的多种需求,DeepSeek Harness 预设了四种运行模式,每种模式配置了特定的插件集合: 模式名称 核心功能与应用场景 标准模式 提供完整的工具组合,适用于通用的 Agent 任务。 PTC 模式 即“程序化工具调用”(Programmatic Tool Calling),通过模型生成的代码片段来驱动多轮工具调用。 极简模式 仅保留单一的 shell 工具与文件编辑工具,专为最小环境下的模型基准测试设计。 创造模式 允许开发者检查当前运行时并在内存中试验插件,用于组合与创作全新的运行模式。 可观测性与溯源机制 DeepSeek Harness 强调运行过程的透明度,确保每一次模型决策和执行都有迹可循。 * 仅追加(Append-only)会话日志: 系统将模型接触到的所有信息写入持久化日志,确保数据的不可篡改性和完整性。 * 全方位追踪: 日志记录内容涵盖系统提示词、思维链(CoT)、工具调用及其结果、子 Agent 调度以及每一次上下文注入。 * 轨迹视图(Trajectory View): 开发者可以按来源查看信息流,并基于同一份事件流实现以下功能: * 恢复与回放: 重新审视或恢复特定的运行状态。 * 分叉(Forking): 从特定节点开启新的实验分支。 * 检索: 对过往会话进行高效的信息提取。 快速上手与生态愿景 DeepSeek Harness 目前处于 v0.1 的早期阶段,致力于通过开源合作探索智能上限。 安装与启动 * 快速体验: 支持通过 Node.js 工具链一键启动: npx @deepseek-ai/dsh web * 源码安装: 开发者可以通过 GitHub 仓库(deepseek-ai/deepseek-harness)获取完整源码进行深入开发。 未来展望 DeepSeek 团队强调,当前版本是构建开源、开放、可复用基础设施的起点。未来将通过快速迭代改进核心插件与基础接口,并号召全球开发者共建 DSH 插件生态,共同推动 Agent 能力的演进。
EP145:AI工具层出不穷,Alex大神分享最新工具使用面对日新月异的AI工具,你是否感到焦虑和不知所措?本期节目,我们邀请到知名AI专家Alex Finn,他将为你一劳永逸地解决这个难题,为你揭晓2026年8月最顶级的AI工具矩阵,让你彻底告别选择困难,精准掌握未来的生产力密码。 Alex Finn将分享他如何将AI深度融入日常工作流,从使用“地球上最聪明”的规划模型Fable 5 Medium解决ChatGPT无法处理的网络难题,到仅凭语音指令让AI智能体自动部署新模型到本地服务器,其实战经验颠覆了我们对AI工具的传统认知。他将用一个令人震惊的案例证明,为何你每天都在使用的ChatGPT桌面应用,其强大的电脑控制能力已悄然超越Hermes和OpenClaw,成为当下最强的AI智能体框架。 您将了解到: * 在2026年,当AI工具层出不穷时,究竟哪款模型才是规划、执行和设计的王者? * 当下的AI智能体大战中,为什么说一款你每天都在用的桌面应用,已经悄然超越了Hermes和OpenClaw? * 如何仅通过语音对话,就能在散步时完成过去需要坐在电脑前数小时才能完成的复杂工作? 💡时点内容 | Key Topics * [01:33] 最强规划模型:Fable 5:Alex Finn指出,Fable 5 Medium是当前地球上最聪明的规划模型,适用于任何计划、纲要或头脑风暴。他分享了用它解决ChatGPT 5.6无法处理的网络设置问题的经历,并强调Medium版本是“最佳平衡点”,因为它既能保证足够的使用量,又能得到可读性很强的内容,避免了高阶版本的过度思考和高昂成本。 * [02:11] 执行力之王:ChatGPT 5.6:Alex Finn宣布,专为日常工作和执行任务设计的最佳模型是ChatGPT 5.6 SoMedium。他透露自己所有执行层面的工作都由它驱动,并认为从代码编写角度看,它与Fable 5不相上下但性价比更高,强调“Hermes已经过时了,ChatGPT 5.6 SoMedium才是王道”。 * [02:50] AI交互的未来:语音模式:Alex Finn分享了他最喜爱的工具ChatGPT Voice,并坚信它“就是AI未来的交互界面”。他描述了自己每天花数小时戴着AirPod散步,通过语音对话完成大量工作的工作流,指出用户只需说出“启动一个新线程”,就能将任务委派给其他代理,实现颠覆性的多任务处理。 * [09:15] 最强AI代理框架:Alex Finn回答了关于最佳AI代理的疑问,并断言目前地球上最强的AI智能体框架是ChatGPT桌面应用。他回顾了让ChatGPT自动部署新模型的经历,强调其强大的电脑控制能力已超越Hermes和OpenClaw,并指出“其他智能体能做到的事情,ChatGPT没有做不到的”。 * [13:07] UI/UX设计的首选:Alex Finn指出,在构建UI、UX或任何图形相关任务时,他的首选是在Claude Code中使用Opus 5。尽管承认该模型存在说话方式奇怪等缺点,但他强调“每当我在做任何跟UI或者UX相关的工作时,Opus 5都是最强的”,尤其对于需要惊艳UI的商业级应用而言更是如此。 * [13:45] 本地模型的可靠选择:Alex Finn分享了他在本地模型上的首选是Qwen 3 627B,并将其比作一匹任劳任怨的“老黄牛”,因为它在速度和智能之间取得了完美平衡。他建议,如果用户拥有本地模型,最好设置一个Hermes智能体来运行它,并推荐使用LM Studio来方便地下载和加载模型。 * [16:58] 多人协作AI的未来:Alex Finn推荐了一款名为Buzz的必备工具,并将其描述为一个专为AI智能体协作而生的平台。他透露自己正通过Buzz将本地算力分享给社区成员,并预测“‘多人协作AI’这个概念,就是未来”,相信让多个人共享智能体和上下文共同构建项目将成为巨大趋势。 📺相关链接与资源 [视频来源]https://www.youtube.com/watch?v=u0_5qgc3k0Y
EP144:揭秘Claude Tag背后的产品哲学-是“主动型队友”而非工具。当一家顶尖AI公司的内部PR有65%都由AI开启时,这不仅是效率的提升,更是一场工作范式的革命。在本期节目中,我们邀请到Anthropic技术团队成员Lamis Mukta,她将为我们揭示这款名为Claude Tag的“主动型队友”如何将开发工作流从IDE彻底解放出来,并分享Anthropic产品哲学背后的深刻洞见——为模型未来的能力而设计。 Claude Tag 远不止是Slack中的一个简单@机器人,它是一个拥有持久记忆、能够跨频道理解上下文、并主动发起任务的智能协作者。Lamis Mukta分享了Anthropic内部令人惊叹的实践:Claude Tag能够自主捕捉用户反馈、创建工单,甚至启动沙箱环境编写代码,将整个开发流程无缝串联。它就像团队的“总指挥”,不仅自动化了繁琐的技术任务,更通过独特的“智能体身份”架构,将产品、销售等跨职能同事无缝整合进开发协作中,真正实现了端到端的智能体驱动工作(Agentic Work)。 您将了解到: * Anthropic内部65%的PR竟由AI开启,开发者真的要告别IDE,在Slack里完成所有工作了吗? * 为什么说为当下最强的AI模型设计产品是错误的?Anthropic的产品开发哲学揭示了什么未来趋势? * 如何让AI智能体像人一样“做梦”并实现自我进化?揭秘Anthropic用于优化智能体的持续学习黑科技。 💡时点内容 | Key Topics * [04:42] 主动型队友Claude Tag:Lamis Mukta将Claude Tag定义为一个“主动性很强的队友”,它在Slack中工作,拥有持久性和跨频道的记忆与上下文。她强调,与简单的@Claude机器人不同,Claude Tag能“自己去执行一项任务,而且是长时间地执行,直到任务完成后再回来通知你”,甚至能够主动发起对话,突破了单次会话的限制。 * [07:47] 端到端自动化工作流:Lamis Mukta描述了Claude Tag如何实现从捕捉用户反馈、创建工单到启动沙箱编写代码的完整工作流,将开发者从繁琐流程中解放出来。她将Claude Tag比作“总指挥”,指出它不仅能自动化技术任务,还能赋能“多人协作”,将产品、销售等跨职能同事无缝整合到开发流程中。 * [17:03] 智能体能力的指数级增长:Lamis Mukta探讨了AI智能体能力的指数级增长,并引用研究称“大概每四个月,智能体能够自主运行的时间就会翻一番”。她认为,这种能力的提升,加上模型在自我验证方面的进步,是开发者敢于在远离代码的协作环境(如Slack)中工作的信任基础。 * [29:24] Claude Code的诞生与启示:Lamis Mukta回顾了Claude Code源于一个内部业余项目,并分享了其成功的关键在于模型能力达到了某个临界点。她从中总结出一个重要的产品开发原则,即应该“为模型未来的形态去构建产品,而不是为它们今天的样子”,因为技术的发展速度远超预期。 * [35:35] 企业级AI的权限架构:Lamis Mukta透露,为了将Claude Tag扩展到企业级应用,团队设计了“智能体身份”这一核心架构。她解释说,团队版的智能体拥有“自己独立的权限和密钥”,代表整个团队而非个人进行操作,这使得审计和追溯变得更容易,是实现大规模安全协作的关键。 * [51:02] “做梦”:智能体的持续学习:Lamis Mukta介绍了Managed Agents产品中的“Dreaming”功能,将其描述为一种持续学习机制。她解释道,该功能会派一个审查智能体去分析另一个智能体的工作记录和记忆,“寻找其中任何不一致的地方”,从而提出优化建议,实现智能体性能的自动化迭代和提升。 📺相关链接与资源 [视频来源]《How Claude Tag Is Changing Agentic Work》 本播客采用虚拟主持人进行播客翻译的音频制作,因此有可能会有一些地方听起来怪怪的。如想了解更多信息,请关注微信公众号"AI西经东译"获取AI最新资讯。如有后续想要听的其他外文播客,也欢迎联系微信:mayday2303。
EP143:黄仁勋-构建NVIDIA的创始人思维与AI愿景英伟达,这家市值万亿的AI帝国,竟是从一个完全错误的技术设想起家?在本期节目中,创始人兼CEO黄仁勋将亲自揭示这段鲜为人知的创业史,分享他如何带领公司从濒临破产的边缘,凭借“直面现实”和“终身学习”的心态,一步步构建起今天的商业传奇。 很少有人知道,英伟达的起点是选择了一条完全错误的技术路线,濒临破产。面对危机,黄仁勋没有放弃,而是亲自跑到书店买回教科书,带领团队从零学起。更具戏剧性的是,他曾向客户世嘉坦诚项目失败,却大胆请求对方支付全款以挽救公司。正是这段“向客户要救命钱”的经历,让他深刻领悟到,一个伟大公司的核心并非技术,而是一个独特且坚信不疑的宏大构想,以及直面现实、不断学习的强大心态。 您将了解到: * 英伟达是如何从一个完全错误的技术设想起家,最终成长为万亿市值AI帝国的? * 当项目失败、公司濒临破产时,黄仁勋为何敢向客户承认失败并要求对方支付全款?这个大胆的请求如何奇迹般地拯救了英伟达? * 为什么黄仁勋坚信,AI非但不会摧毁就业,反而会通过自动化“任务”来创造更多更有价值的“工作”? 💡时点内容 | Key Topics * [04:04] 错误的起点:黄仁勋透露,英伟达创立之初所依赖的核心技术是完全错误的。他分享了公司濒临失败时,自己去买教科书从零开始学习3D图形技术的经历,并强调真正的教训是“只要你能够直面现实,只要你愿意去学习,技术本身是什么,其实并不重要。” * [06:58] 算法,而非芯片:黄仁勋指出,英伟达早期最精准的宏大构想并非制造芯片,而是通过加速计算来解决特定算法领域的问题。他认为,成就伟大公司的核心是“对世界有一个独特且坚信不疑的看法”,这甚至比技术和市场更重要,而英伟达坚信的正是加速计算的未来。 * [07:21] 濒临破产的转折:黄仁勋回顾了公司早期因技术路线错误而无法履行与世嘉合同的危机。他分享了自己如何坦诚地向客户承认失败,并请求对方支付合同款以挽救公司的经历,并认为对方的投资最终是“投的是人,而不是公司”,这笔钱让英伟达得以存活。 * [09:20] AI的顿悟时刻:黄仁勋分享了他对AlexNet出现的看法,指出真正的突破点是认识到其背后是一种全新的软件开发方式。他将深度学习比作“通用函数逼近器”,并解释了这一认知如何让英伟达在15年前就开始布局计算机视觉、机器人和自动驾驶等领域。 * [14:53] CEO的赛车手哲学:黄仁勋将CEO比作F1赛车手,强调创始人应根据自己的驾驭方式来打造和调整公司这辆“赛车”。他认为,不应拘泥于传统的管理方法,而应不断重塑业务流程和工作方式,让组织适应自己,从而为公司创造最大价值,实现“创始人模式”的长期成功。 * [24:59] AI创造就业:黄仁勋反驳了“AI摧毁就业”的论调,认为AI消除的是“任务”而非“工作”。他以软件工程师和放射科医生为例,指出生产力的提升会促进增长,从而创造更多就业机会,因为人类积压的雄心和抱负远超当前生产力所能满足的范畴。 * [27:22] 物理AI的黎明:黄仁勋预测,物理AI将成为继自动驾驶汽车之后,下一个千亿美金级别的业务。他透露,机器人领域的“ChatGPT时刻”其实几年前就已发生,并介绍了英伟达通过“从现实到模拟”再“从模拟到现实”的框架来训练机器人,加速其商业化进程。 * [37:12] 创业者的终极心态:黄仁勋分享了他认为企业家应有的核心心态。他鼓励创业者面对未知和挑战时,不要被困难吓倒,而是要抱持一种“能有多难呢?”的态度去开始,并坚信学习是“最强大的超能力”。他认为,坚韧不拔是最终成功的关键。 📺相关链接与资源 [视频来源]《Jensen Huang: The Mindset That Built NVIDIA》 本播客采用虚拟主持人进行播客翻译的音频制作,因此有可能会有一些地方听起来怪怪的。如想了解更多信息,请关注微信公众号"AI西经东译"获取AI最新资讯。如有后续想要听的其他外文播客,也欢迎联系微信:mayday2303。
EP142:揭秘Claude Code狂删80%系统提示词的真相,CC之父自爆经历一个AI智能体如何仅用11天重写十万行代码,完成工程师团队数年的工作量?本期节目,我们邀请到Claude Code的创造者Boris Cherny,他将分享一套颠覆传统软件工程的AI开发新范式,揭示顶尖用户如何通过“激进删减”和“自我验证”释放模型的真正潜力。 Boris Cherny分享了一个令人震惊的案例:一个Opus 5模型仅用11天,就将Bun项目的十万行Zig代码重写为Rust,这项任务过去需要顶尖团队耗时数年。这背后是他将大模型开发视作与“活的生物”打交道的独特哲学,他认为当前产品形态严重“束缚”了模型能力(即“产品悬置”),而Claude Code的诞生正是为了打破这种限制,去探索模型能力的真正边界。他提倡一种经验主义的科学方法:大胆尝试,观察结果,然后快速迭代。 您将了解到: * 为什么Claude Code的创造者每次发布新模型,都会删掉80%的系统提示? * 一个AI智能体如何仅用11天就重写了十万行代码,完成了工程师团队数年的工作量? * 顶尖AI用户究竟掌握了什么秘诀,能让一个任务持续运行数周并调度上千个智能体? 💡时点内容 | Key Topics * [00:03] Opus 5的全新境界:Boris Cherny透露了Opus 5模型的两项突破性能力:无需“脚手架”即可持续运行数周乃至数月,以及通过结合对齐模型和神经元层面的分类器,达到了前所未有的“提示词注入”攻击免疫。他指出,“我们现在已经完全无法复现提示注入攻击了。” * [03:04] 激进的提示词删减法:Boris Cherny分享了他们为适应新模型而采取的“消融实验”方法,即每次模型更新后都删除超过80%的系统提示,再逐行加回以评估效果。他建议开发者和用户也应勇敢按下删除键,因为“在没有这些提示的情况下,模型本身的表现反而会更智能一些。” * [06:05] 模型开发的新范式:Boris Cherny将为大模型开发比作与一个“活的生物”打交道,强调这与传统软件工程截然不同,后者注重宏大架构和预先设计。他认为,新范式更像是一个经验主义的科学探索过程,开发者必须“抱着非常科学的心态来对待它,就是你先尝试一些东西,观察结果,然后再基于结果去迭代。” * [12:06] 为Claude松绑:Boris Cherny介绍了“产品悬置”的概念,指出当前模型的能力远超现有产品所能激发的范围,而产品本身反而成了模型的“束缚”。他回顾了Claude Code的诞生正是为了打破这种限制,并认为“即使是今天的这些先进模型,仍然存在大量的‘产品潜力悬空’现象。” * [15:07] 重写十万行代码:Boris Cherny分享了一个惊人案例:Opus 5模型在11天内,仅凭一个提示词和动态工作流,就将Bun项目的十万行Zig代码重写为了Rust。他强调,这项过去需要顶尖团队耗时数年的工作,如今模型已能胜任,这证明了“你应该交给模型一些比你想象中它能做的、要稍微难一点的任务。” * [15:37] 编排数千智能体:Boris Cherny揭示了通过“动态工作流”和“例程”来扩展智能体能力的方法,可以调度成千上万个智能体协同完成复杂任务。他分享了利用这些工具实现代码库自我维护的实践,例如自动清理无用代码和统一抽象,并称之为“一种组织‘测试时计算’的全新方式”。 * [21:07] 自我验证的关键:Boris Cherny指出,顶尖用户的秘诀并非提示工程技巧,而是为模型设定一个高难度任务,并赋予其自我验证的能力。他以一个持续运行两周多的Swift应用重写任务为例,强调关键在于让模型能像人一样检查工作成果,并认为“这个‘验证’环节,可能就是大家最容易忽略,但又恰恰是最关键的一步。” 📺相关链接与资源 [视频来源]《Boris Cherny: Stop Hobbling Your AI》 本播客采用虚拟主持人进行播客翻译的音频制作,因此有可能会有一些地方听起来怪怪的。如想了解更多信息,请关注微信公众号"AI西经东译"获取AI最新资讯。如有后续想要听的其他外文播客,也欢迎联系微信:mayday2303。