

EP200 · AWS 谈智能体云、Shopify 模拟商家增长、Neo4j 将记忆化为技能章节时间戳 * 00:00 开场 * 00:43 精讲:AWS CEO Matt Garman 谈智能体云基础设施 * 03:29 精讲:Shopify CTO 谈商家数字孪生与 AI 能力上限 * 06:19 精讲:Neo4j Will Lyon 把智能体记忆转为可靠技能 * 08:49 重点 4–6:Decisions API、Reducto MCP、Agent Lightning * 11:00 重点 7–10:Spotify 广告、AI 数据、虚假门面、Agent Plan 导演 * 13:31 结语 ★ 精讲一 | AWS CEO Matt Garman 谈为 AI 智能体重建云基础设施 [视频] 00:43|来自 a16z|BestBlogs 评分 91 智能体会临时创建数据库,又需要任务级权限与快速启动的沙箱。AWS CEO Matt Garman 从这些变化谈云服务重构,并解释为何企业仍卡在自主执行、评测与数据隔离。对中文读者,这场访谈提供了从负载特征到基础设施选型的判断路径,也呈现云厂商如何在实验室与初创企业之间分配算力。 ★ 精讲二 | Shopify CTO Mikhail Parakhin 谈 AI 战略:提高能力上限与商家数字孪生 [视频] 03:29|来自 Claude|BestBlogs 评分 89 Shopify CTO Mikhail Parakhin 把商家活动建模为动作序列,在数字孪生中试验贷款、发货与广告策略,再为真实商家提供建议。他也谈项目复杂度如何帮助衡量工程效率,以及开发用强模型、生产优化成本的配置思路。读者可据此区分已有任务提效与新增能力,重新检查自己的 AI 投入指标。 ★ 精讲三 | 把智能体记忆蒸馏成真正可用的技能:从记忆图到可治理技能 — Will Lyon,Neo4j [视频] 06:19|来自 AI Engineer|BestBlogs 评分 88 Neo4j 的 Will Lyon 将实体、工具调用和决策痕迹连接成记忆图,再蒸馏为有类型、可追溯的技能。他解释实体消解、覆盖度检查和技能漂移治理,并展示病患接待流程如何对应真实操作。对构建智能体的读者,增量在于把历史经验变成可执行知识,而非仅把相似文本塞回上下文。 重点 4–10 08:49 继续阅读七篇重点内容 OpenAI 推出 Decisions API:用预设选项实现快速决策 [视频] 08:49|来自 OpenAI|BestBlogs 评分 90 OpenAI 推出基于 GPT-6 Luna 的 Decisions API,从预设答案中选择结果,为文本路由、视觉动作、富有表现力的语音交互和机器人追踪提供低延迟决策。 Reducto 为何删掉并重建 MCP 服务器:让智能体的错误变得可见 [视频] 08:49|来自 AI Engineer|BestBlogs 评分 88 Reducto 团队讲述为何删掉按端点逐一生成工具的 MCP 服务器,并用更少但携带工作结构、实时状态与错误反馈的工具重建,让智能体的操作可供用户校验。 Agent Lightning:轻量级强化学习智能体训练框架 08:49|来自 Microsoft Research Blog|BestBlogs 评分 88 微软亚洲研究院发布 Agent Lightning v1.0,这是一款轻量级的智能体强化学习框架,通过 LLM 代理直接训练现实世界的智能体执行环境,以极简代码实现显著的编码性能提升,并原生支持 Kubernetes。 Spotify AI 广告平台中的多智能体模式 08:49|来自 InfoQ|BestBlogs 评分 88 Spotify 工程师详述了其 Ads AI 平台从单体智能体向基于 Google ADK 的模块化多智能体架构演进的过程,强调了严格的归属权边界、用于数据落地的确定性工具以及闭环性能反馈。 谁在给大模型出题、卖题、判卷?聊聊 AI 数据行业的野蛮生长 08:49|来自 硅谷 101|BestBlogs 评分 88 本文通过硅谷 101 对 Scale AI 研究员何允中与伯克利博士后孙一铀的深度访谈,揭示了 AI 数据行业从传统标注向智能体环境(Agentic Data)转型的底层逻辑,剖析了 Benchmark 与数据售卖的利益冲突、垂直领域采购难题及激励机制设计等核心痛点。 OpenAI 报告:打击利用 AI 的「虚假门面」行动 08:49|来自 OpenAI News|BestBlogs 评分 90 OpenAI 挫败了来自俄罗斯和伊朗的高影响力「虚假门面」舆论操纵行动,这些行动利用 AI 扩大了传统虚假信息战术的规模,标志着该公司报告的首个第 5 级突破型行动。 用 Agent Plan 解锁 AI 导演体验:通过 CUA 搭 Blender 白模指导武侠视频生成 08:49|来自 字节跳动技术团队|BestBlogs 评分 87 文章演示了利用火山引擎 Agent Plan 中的 CUA(Computer Use Agent)自动操作 Blender 生成武侠视频白模预演,再结合 Seedance 模型生成最终成片的完整工作流。 相关链接 · 本期早报在线阅读:https://www.bestblogs.dev/explore/brief/2026-10-09 · AWS CEO Matt Garman 谈为 AI 智能体重建云基础设施 [视频]:https://www.bestblogs.dev/video/4d734a4ff · Shopify CTO Mikhail Parakhin 谈 AI 战略:提高能力上限与商家数字孪生 [视频]:https://www.bestblogs.dev/video/76f9e85af · 把智能体记忆蒸馏成真正可用的技能:从记忆图到可治理技能 — Will Lyon,Neo4j [视频]:https://www.bestblogs.dev/video/fe556d554 · OpenAI 推出 Decisions API:用预设选项实现快速决策 [视频]:https://www.bestblogs.dev/video/e564ac497 · Reducto 为何删掉并重建 MCP 服务器:让智能体的错误变得可见 [视频]:https://www.bestblogs.dev/video/ad768dcf3 · Agent Lightning:轻量级强化学习智能体训练框架:https://www.bestblogs.dev/article/26045a6ab6 · Spotify AI 广告平台中的多智能体模式:https://www.bestblogs.dev/article/3672e5454d · 谁在给大模型出题、卖题、判卷?聊聊 AI 数据行业的野蛮生长:https://www.bestblogs.dev/article/4d829ff9a7 · OpenAI 报告:打击利用 AI 的「虚假门面」行动:https://www.bestblogs.dev/article/953f5c6d49 · 用 Agent Plan 解锁 AI 导演体验:通过 CUA 搭 Blender 白模指导武侠视频生成:https://www.bestblogs.dev/article/07cd83a89c 关于 BestBlogs BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 [关注我们]
EP199 · GPT-6 生成界面、ASML CEO 谈工业 AI、LlamaIndex 拆解检索章节时间戳 * 00:00 开场 * 00:45 精讲:OpenAI 让 GPT-6 生成交互界面 * 03:53 精讲:ASML CEO 谈工业数据与量产 * 06:57 精讲:LlamaIndex 拆解企业文档检索 * 09:56 重点 4–6:OpenClaw 协作、成功任务成本、Kafka 管道 * 12:01 重点 7–10:GitHub 密钥、视觉验收、d1 决策、Runlayer Skill * 14:40 结语 ★ 精讲一 | GPT-6 与面向所有人的智能 UI 00:45|来自 OpenAI News|BestBlogs 评分 90 GPT-6 正把 ChatGPT 的回答变成按问题生成的交互界面:图表、表单和即时工具随内容流式出现。OpenAI 解释了原生组件库、界面编译器与训练方法,并允许模型边思考边回答。对产品团队而言,值得观察的是界面如何服务具体任务,而不只是让文字更漂亮。 ★ 精讲二 | 对话 ASML CEO Christophe Fouquet:EUV、供应链与工业 AI 的关键判断 [视频] 03:53|来自 TechTechPotato|BestBlogs 评分 90 ASML CEO Christophe Fouquet 把工业 AI 的价值落在企业独有数据、系统集成和稳定量产上。他从 EUV 的长期研发、供应商信任谈到与 Mistral 共建数据架构和定制模型。访谈给出的判断方法是:先找到真实问题与客户,再看技术、伙伴和运营如何共同支撑规模化。 ★ 精讲三 | Grep 还是向量检索?企业文档的智能体搜索实践|George He,LlamaIndex [视频] 06:57|来自 AI Engineer|BestBlogs 评分 91 企业文档检索该用 grep 还是向量索引?LlamaIndex 工程负责人 George He 从文件规模、格式和维护成本出发,将混合搜索、文件遍历、结构化解析与页面截图组合起来。财报演示展示了跨文档定位证据的过程,读者可据此判断自己的智能体在哪一层需要补工具和数据组织。 重点 4–10 09:56 继续阅读七篇重点内容 ClawLabs:共同建设开源项目 | DevDay 2026 [视频] 09:56|来自 OpenAI|BestBlogs 评分 92 ClawLabs 演示多人共享会话、持久智能体与持续维护工作流,并介绍 OpenClaw Enterprise 的开源控制平面和可执行部署边界,探索团队如何共同观察、审阅和推进智能体工作。 别再为智能多花钱:如何优化每项成功任务的 AI 成本 | DevDay 2026 [视频] 09:56|来自 OpenAI|BestBlogs 评分 91 OpenAI 部署工程师建议以每项成功任务的成本衡量 AI 应用:先用代表性评测选择模型和配置,再通过提示缓存、程序化工具调用、推理控制与延迟处理减少工作量,避免单看 token 价格。 用 Go 构建会话有序 Kafka 管道 09:56|来自 InfoQ|BestBlogs 评分 92 实时对话 AI 如何既按会话顺序完成 NLU、LLM 推理与交付,又并行处理不同会话?这篇 Go 与 Kafka 实践用两层 worker、原地重试和连续水印提交,解释消息排序、故障恢复与生产加固。 GitHub:密钥防护必须随 AI 编码规模同步扩展 09:56|来自 The GitHub Blog|BestBlogs 评分 86 GitHub 用九季度数据说明,代码推送增加会扩大密钥暴露总量,单次推送的泄露比例并未出现可检测的上升趋势;其与微软共建的 ModernBERT 分类器和自动吊销机制,让防护随 AI 编码规模扩展。 我所了解的机器视觉检测产品应用(9):验收的 99%,量产怎么就成了 95%? 09:56|来自 人人都是产品经理|BestBlogs 评分 91 机器视觉验收与量产表现为何不同?作者从漏检率的分母、误判良品的过杀成本、环境漂移和合同条款展开,用可复现测试与标准化验收表,把算法指标转成客户能签字的交付口径。 Liquid AI:面向边缘设备的多模态 d1 决策模型 09:56|来自 Hugging Face - Blog|BestBlogs 评分 86 Liquid AI 发布开放权重决策模型 d1-3B 与实验性 d1-omni-600M,用单次前向计算从预设选项中给出答案,并报告 d1-3B 在不同 Jetson 设备与输入条件下的延迟,探索端侧多模态决策。 从 36% 到 100%:Runlayer 如何让智能体编写并改进自己的 Skill [视频] 09:56|来自 AI Engineer|BestBlogs 评分 89 Runlayer 从智能体成功与失败的执行轨迹提炼共享 Skill,经提示注入、隐私与权限检查后通过 MCP 分发;讲者举出一项任务成功率从 36% 升至 100% 的案例,讨论组织经验如何持续积累。 相关链接 · 本期早报在线阅读:https://www.bestblogs.dev/explore/brief/2026-10-08 · GPT-6 与面向所有人的智能 UI:https://www.bestblogs.dev/article/9b5e17342a · 对话 ASML CEO Christophe Fouquet:EUV、供应链与工业 AI 的关键判断 [视频]:https://www.bestblogs.dev/video/dd43fe130 · Grep 还是向量检索?企业文档的智能体搜索实践|George He,LlamaIndex [视频]:https://www.bestblogs.dev/video/c5542a10c · ClawLabs:共同建设开源项目 | DevDay 2026 [视频]:https://www.bestblogs.dev/video/cecd3ac16 · 别再为智能多花钱:如何优化每项成功任务的 AI 成本 | DevDay 2026 [视频]:https://www.bestblogs.dev/video/05fd92832 · 用 Go 构建会话有序 Kafka 管道:https://www.bestblogs.dev/article/ae9ca694c9 · GitHub:密钥防护必须随 AI 编码规模同步扩展:https://www.bestblogs.dev/article/ad519879f1 · 我所了解的机器视觉检测产品应用(9):验收的 99%,量产怎么就成了 95%?:https://www.bestblogs.dev/article/ad5c023514 · Liquid AI:面向边缘设备的多模态 d1 决策模型:https://www.bestblogs.dev/article/d9963ee5a0 · 从 36% 到 100%:Runlayer 如何让智能体编写并改进自己的 Skill [视频]:https://www.bestblogs.dev/video/ec4f1c981 关于 BestBlogs BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 [关注我们]
EP198 · Google 负责人谈算力、GitHub 重构 Git、Acemoglu 谈工作价值章节时间戳 * 00:00 开场 * 00:46 精讲:Google 负责人 Amin Vahdat 谈有效算力与供电 * 03:37 精讲:GitHub 分离持久化与服务以支撑智能体开发 * 06:31 精讲:Acemoglu 谈 AI 自动化与创造新工作价值 * 09:10 重点 4–6:EmbeddingGemma 2、模型路由、浏览器验证器 * 10:57 重点 7–10:Docker 凭据、推理引擎、Mistral Large 4、Every 工作流 * 13:21 结语 ★ 精讲一 | Google AI 基础设施负责人 Amin Vahdat:前沿 AI 的物理与经济约束 [视频] 00:46|来自 Sequoia Capital|BestBlogs 评分 91 长时间运行的智能体让数据中心同时面临算力、网络、存储与供电压力。Google 基础设施负责人 Amin Vahdat 解释为何要用实际完成的有效产出衡量系统,并把模型、运行时与硬件联合优化。读者可以据此理解扩容目标、故障恢复与专用设计的取舍。 ★ 精讲二 | 为代理规模开发构建 Git 基础架构 03:37|来自 The GitHub Blog|BestBlogs 评分 91 智能体密集提交代码,使 GitHub 的写入、合并和持续集成读取承受新的压力。官方工程团队解释当前副本架构为何让读扩容拖慢写入,并介绍分离持久化存储与请求服务的新设计。文章帮助读者判断并发开发怎样改变底层架构,也说明如何把维护移出请求路径。 ★ 精讲三 | 诺奖经济学家 Daron Acemoglu:AI 改变工作时,如何保持自身价值 [视频] 06:31|来自 Silicon Valley Girl|BestBlogs 评分 91 编码任务有相对清楚的验证规则,现实岗位的自动化却还需要组织投入与流程调整。诺奖经济学家 Daron Acemoglu 在访谈中重新审视预测,讨论中国制造应用与劳动者协作,并将机会指向高质量数据和细分应用。读者可借此区分节省成本与创造新工作价值。 重点 4–10 09:10 继续阅读七篇重点内容 EmbeddingGemma 2:开发者指南 09:10|来自 Google Developers Blog|BestBlogs 评分 89 Google 推出了 EmbeddingGemma 2,这是一个参数小于 1B 的多模态嵌入模型,支持文本、代码、图像、视频和音频,并采用模块化架构和俄罗斯套娃(Matryoshka)表示。 如何在 Agent harness 中构建模型路由:Open SWE 的成本实验 [视频] 09:10|来自 LangChain|BestBlogs 评分 88 LangChain 产品经理 Sydney 介绍 Open SWE 如何在三个模型档位间路由编码任务:近 500 条线上线程的成本中位数下降 64%,合并 PR 比例未出现统计显著下降。 你的 LLM 裁判可能自信地说错:Browserbase 与 Microsoft 如何构建更可靠的验证器 [视频] 09:10|来自 AI Engineer|BestBlogs 评分 89 Browserbase 与 Microsoft 研究者介绍面向浏览器智能体的 Universal Verifier:依据选出的截图核对任务评分准则,区分过程与最终结果,并揭示常见 LLM 裁判的严重误判。 AI 智能体该持有多少凭据?零个——Docker 的 Jim Clark 谈沙箱与 MCP 网关 [视频] 09:10|来自 AI Engineer|BestBlogs 评分 89 Docker 工程师 Jim Clark 主张,长时间运行的智能体不应持有凭据,而应通过按任务配置的沙箱和 MCP 网关,只获得当前阶段必需的工具与权限。 让 Claude Code 写推理引擎,解码比 vLLM 快 90% 09:10|来自 AINLP|BestBlogs 评分 89 Baseten 工程师通过 MetaInfer 框架,让 Claude Code 在单张 B200 上自主编写并优化了 Qwen-3.6-35B-A3B 推理引擎,解码速度比 vLLM 快 90%。 Mistral Large 4 发布:多模态能力与开放权重计划 09:10|来自 Simon Willison's Weblog|BestBlogs 评分 85 Simon Willison 解读 Mistral Large 4 的 API 预览与月底开放权重计划,并用 SVG 鹈鹕测试比较两档推理设置,说明模型相较前代的进步。 如何为知识工作构建安全的智能体:Every 的共享工作流、评测与权限实践 [视频] 09:10|来自 Claude|BestBlogs 评分 89 Every 通过共享的 Slack 智能体传播团队专家的工作方法,并用贴近实际任务的评测、隔离的记忆与沙箱,以及代用户执行的访问权限来管理质量和安全。 相关链接 · 本期早报在线阅读:https://www.bestblogs.dev/explore/brief/2026-10-07 · Google AI 基础设施负责人 Amin Vahdat:前沿 AI 的物理与经济约束 [视频]:https://www.bestblogs.dev/video/0d577304b · 为代理规模开发构建 Git 基础架构:https://www.bestblogs.dev/article/9abfaa6494 · 诺奖经济学家 Daron Acemoglu:AI 改变工作时,如何保持自身价值 [视频]:https://www.bestblogs.dev/video/14c641465 · EmbeddingGemma 2:开发者指南:https://www.bestblogs.dev/article/afaaf32d66 · 如何在 Agent harness 中构建模型路由:Open SWE 的成本实验 [视频]:https://www.bestblogs.dev/video/e30af1f7f · 你的 LLM 裁判可能自信地说错:Browserbase 与 Microsoft 如何构建更可靠的验证器 [视频]:https://www.bestblogs.dev/video/8da727de6 · AI 智能体该持有多少凭据?零个——Docker 的 Jim Clark 谈沙箱与 MCP 网关 [视频]:https://www.bestblogs.dev/video/644cb05ab · 让 Claude Code 写推理引擎,解码比 vLLM 快 90%:https://www.bestblogs.dev/article/393d160a01 · Mistral Large 4 发布:多模态能力与开放权重计划:https://www.bestblogs.dev/article/5c084f06f9 · 如何为知识工作构建安全的智能体:Every 的共享工作流、评测与权限实践 [视频]:https://www.bestblogs.dev/video/8ed74654d 关于 BestBlogs BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 [关注我们]
EP197 · ReviewBench 开放基准测试、Cleric 谈智能体诊断、a16z 谈消费者 AI 现状章节时间戳 * 00:00 开场 * 00:41 精讲:GitHub 用 ReviewBench 衡量 AI 代码审查 * 03:30 精讲:Willem Pienaar 如何验证生产故障诊断 * 06:26 精讲:a16z 看消费者 AI 的付费与信任门槛 * 09:07 重点 4–6:Cresta、WorkOS、AI 数学研究 * 11:07 重点 7–10:ScholarEvolve、Dust、VA-Bench、AI 视频交付 * 13:29 结语 ★ 精讲一 | ReviewBench:用于 AI 代码审查的开放基准测试 00:41|来自 The GitHub Blog|BestBlogs 评分 92 GitHub 发布 ReviewBench,用贴近真实开发分布的代码变更评估 AI 审查质量。它汇合人类、模型与静态分析发现,区分已知问题和新发现,并允许按严重程度、误报与漏报偏好比较。团队由此能看清审查器的长处,选择评估指标,再用线上实验验证改进。 ★ 精讲二 | 你的 AI 智能体为何自信地误判生产故障:Willem Pienaar 谈诊断方法|Cleric [视频] 03:30|来自 AI Engineer|BestBlogs 评分 90 生产故障不断变化,模型的自信回答也可能把症状误当根因。Cleric 联合创始人兼 CTO Willem Pienaar 从真实运维实践出发,分享多假设诊断、正常基线、依赖关系和时间线的用法,再用修复后的结果校准置信度,为智能体提供可以验证的判断依据。 ★ 精讲三 | 消费者 AI 现状:付费集中、私人智能体的信任门槛与新商业模式 [视频] 06:26|来自 a16z|BestBlogs 评分 87 a16z 消费者 AI 报告团队发现,广泛使用并未带来同等规模的付费,收入集中在少数高投入用户。访谈进一步讨论私人智能体的隐私信任、订阅之外的商业模式,以及专业工具如何凭体验和上下文积累价值,帮助产品团队判断下一个增长入口。 重点 4–10 09:07 继续阅读七篇重点内容 Cresta 用 Claude Agent SDK 将客服知识转为智能体构建器 09:07|来自 Anthropic|BestBlogs 评分 88 Cresta 利用 Claude Agent SDK 构建了 Conductor,这是一个帮助团队将复杂的客户服务场景转化为生产级 AI 智能体的元智能体。 AI 原生开发者的工作方式:Nick Nisi 与 Zack Proser 的 WorkOS 智能体实战 [视频] 09:07|来自 AI Engineer|BestBlogs 评分 88 WorkOS 工程师 Nick Nisi 和 Zack Proser 展示如何协同使用多个编码智能体,重点讲解有边界的目标、独立验证、隔离的 Git worktree、复盘和定时任务。 Jeremy Avigad:AI 时代,数学理解与研究将如何改变 09:07|来自 Terence Tao · What's new|BestBlogs 评分 90 Jeremy Avigad 在陶哲轩博客发表客座长文,讨论 AI 自动解题如何改变数学研究,并提出更难的问题、更大的概念和新的数学交流方式。 微软提出 ScholarEvolve:用论文进化 Agent Harness 09:07|来自 AINLP|BestBlogs 评分 88 微软与 UCSB 研究者提出 ScholarEvolve,通过从已发表的 Agent 研究中提取改进方法并引入运行框架,在不更换模型的情况下提升 Agent 的任务能力。 Dust:无需反向传播的 Transformer 预训练 09:07|来自 Q Labs|BestBlogs 评分 92 Dust 是一种零阶优化方法,通过扰动激活值而非权重,在 Transformer 预训练中与反向传播竞争。 看懂不等于做对:VA-Bench 测出大模型空间智能的执行断层 09:07|来自 机器之心|BestBlogs 评分 88 VA-Bench 框架通过「观察-推理-行动-修正」的闭环测试,揭示了多模态模型在空间智能执行、精细控制及长任务稳定性方面的断层。 我们盘点了 26 款 AI 视频类产品,发现跑在最前面的那批产品,赚钱靠「交付」而非模型 09:07|来自 人人都是产品经理|BestBlogs 评分 88 本文通过盘点 26 款海外 AI 视频产品,揭示了赛道已从单纯追求模型生成转向追求「产线交付」与工程化落地能力。 相关链接 · 本期早报在线阅读:https://www.bestblogs.dev/explore/brief/2026-10-06 · ReviewBench:用于 AI 代码审查的开放基准测试:https://www.bestblogs.dev/article/e22bcaf885 · 你的 AI 智能体为何自信地误判生产故障:Willem Pienaar 谈诊断方法|Cleric [视频]:https://www.bestblogs.dev/video/f2f112e59 · 消费者 AI 现状:付费集中、私人智能体的信任门槛与新商业模式 [视频]:https://www.bestblogs.dev/video/338e89eb9 · Cresta 用 Claude Agent SDK 将客服知识转为智能体构建器:https://www.bestblogs.dev/article/99b034a62c · AI 原生开发者的工作方式:Nick Nisi 与 Zack Proser 的 WorkOS 智能体实战 [视频]:https://www.bestblogs.dev/video/7b9fdbf5e · Jeremy Avigad:AI 时代,数学理解与研究将如何改变:https://www.bestblogs.dev/article/36bb2c18f8 · 微软提出 ScholarEvolve:用论文进化 Agent Harness:https://www.bestblogs.dev/article/6f9cb4f92b · Dust:无需反向传播的 Transformer 预训练:https://www.bestblogs.dev/article/841a1d6691 · 看懂不等于做对:VA-Bench 测出大模型空间智能的执行断层:https://www.bestblogs.dev/article/a79f130c2b · 我们盘点了 26 款 AI 视频类产品,发现跑在最前面的那批产品,赚钱靠「交付」而非模型:https://www.bestblogs.dev/article/289f1a7f37 关于 BestBlogs BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 [关注我们]
EP196 · ChatGPT 负责人谈常驻智能体、Temporal 演示故障恢复、Crusoe CEO 谈算力成本章节时间戳 * 00:00 开场 * 00:43 精讲:ChatGPT 负责人谈常驻智能体与插件生态 * 03:24 精讲:Temporal 用异步审批恢复工作流 * 06:18 精讲:Crusoe CEO 谈算力交付与 GPU 寿命 * 09:03 重点 4–6:AssemblyAI 客服、OpenAPPA 安全、PayPal 目录 * 10:49 重点 7–10:代码库维护、AWS 工具、MiniMax 测评、RAG 客服 * 13:18 结语 ★ 精讲一 | ChatGPT 负责人 Tibo Sottiaux:常驻 AI 智能体、插件生态与产品的下一步 [视频] 00:43|来自 Lenny's Podcast|BestBlogs 评分 91 Tibo Sottiaux 在访谈中描绘了持续理解目标、从反馈学习的常驻智能体,并介绍插件分发与收益分享方向。生产故障预警的例子把愿景落到具体场景,也说明执行仍有权限边界。适合产品团队据此思考交互、生态与用户注意力如何一起设计。 ★ 精讲二 | 把人工审批当作异步 API:Temporal 演示智能体工作流的故障恢复 [视频] 03:24|来自 AI Engineer|BestBlogs 评分 90 人工审批等待期间关掉 worker,批准事件仍能保存,重启后从已有状态继续。Temporal 的 Melanie Warrick 用配送演示讲清等待条件、信号与事件重放,把人工参与纳入持久化工作流。开发者可据此检查审批恢复路径,并按出错成本决定何时需要人介入。 ★ 精讲三 | Crusoe CEO:为什么 GPU 折旧和 AI 能源成本常被误判 [视频] 06:18|来自 20VC with Harry Stebbings|BestBlogs 评分 88 Crusoe CEO Chase Lochmiller 认为,算力瓶颈在于能否及时把 GPU 接上电并投入使用。访谈结合自制供电设备、旧芯片推理服务与多层业务解释其判断,为理解交付周期、资产寿命和利用率提供经营者视角;有关成本与社区收益的结论应保留其观点归属。 重点 4–10 09:03 继续阅读七篇重点内容 AssemblyAI 如何打造解决八成工单的 AI 客服智能体 Joey [视频] 09:03|来自 AI Engineer|BestBlogs 评分 88 AssemblyAI 工程师分享文档驱动客服智能体 Joey;据其自述,上线首周端到端工单解决率由约 10% 升至 80%,Token 与基础设施成本约每月 700 美元。 Archestra 的 OpenAPPA 在两项主要安全基准中表现为 0% 攻击成功率 09:03|来自 InfoQ|BestBlogs 评分 87 Archestra 的开源 OpenAPPA 引擎通过执行确定性、环外信息流策略,为 LLM 代理报告了 0% 的攻击成功率,同时在两项安全基准中取得了 89% 的任务完成率。 关键词搜索正在退场:PayPal 谈商家目录如何适应 AI 智能体 [视频] 09:03|来自 AI Engineer|BestBlogs 评分 85 PayPal 产品负责人 Nixon Den 认为购物正从关键词匹配转向由智能体理解意图、代理决策,并通过目录增强实验说明:准确的商品属性比单纯堆砌文字更重要。 AI 编码智能体正让大型代码库更难维护|Sourcegraph 的 Dan Adler [视频] 09:03|来自 AI Engineer|BestBlogs 评分 85 Sourcegraph CEO Dan Adler 认为,编码智能体加重了大型代码库的维护负担;他提出用代码图基础设施和智能体驱动的批量变更,在大量仓库中定位并更新代码。 运行时自行编写工具的智能体:AWS Sandhya Subramani 演示 Strands Agents [视频] 09:03|来自 AI Engineer|BestBlogs 评分 86 AWS 的 Sandhya Subramani 现场演示 Strands 智能体如何在运行中创建并加载工具及子智能体,并说明投入生产前所需的评估与安全约束。 和 Opus 5.5 同题卷,MiniMax M3.1 Flash 开始超纲 09:03|来自 APPSO|BestBlogs 评分 88 APPSO 用前端页面、动效和交互任务对比 MiniMax M3.1 Flash Preview 与 Opus 5.5,展示 Flash 级模型在这些创作场景中的表现,为按任务选择模型提供具体参考。 半年人工喂出来的 AI 客服:从 0 到 1 打磨生产级 RAG 系统,越用越聪明 09:03|来自 人人都是产品经理|BestBlogs 评分 90 本文通过社交语言学习 App「空气小猪」的案例,深度解析了从 0 到 1 构建生产级 RAGAI 客服系统的技术路径,涵盖意图识别、问题泛化及数据飞轮闭环机制。 相关链接 · 本期早报在线阅读:https://www.bestblogs.dev/explore/brief/2026-10-05 · ChatGPT 负责人 Tibo Sottiaux:常驻 AI 智能体、插件生态与产品的下一步 [视频]:https://www.bestblogs.dev/video/414dc958d · 把人工审批当作异步 API:Temporal 演示智能体工作流的故障恢复 [视频]:https://www.bestblogs.dev/video/adab5b485 · Crusoe CEO:为什么 GPU 折旧和 AI 能源成本常被误判 [视频]:https://www.bestblogs.dev/video/580a4ee38 · AssemblyAI 如何打造解决八成工单的 AI 客服智能体 Joey [视频]:https://www.bestblogs.dev/video/0729b714a · Archestra 的 OpenAPPA 在两项主要安全基准中表现为 0% 攻击成功率:https://www.bestblogs.dev/article/72ffcee316 · 关键词搜索正在退场:PayPal 谈商家目录如何适应 AI 智能体 [视频]:https://www.bestblogs.dev/video/a99389a7a · AI 编码智能体正让大型代码库更难维护|Sourcegraph 的 Dan Adler [视频]:https://www.bestblogs.dev/video/ce591a0bb · 运行时自行编写工具的智能体:AWS Sandhya Subramani 演示 Strands Agents [视频]:https://www.bestblogs.dev/video/67b5b3a56 · 和 Opus 5.5 同题卷,MiniMax M3.1 Flash 开始超纲:https://www.bestblogs.dev/article/03e19ce3a6 · 半年人工喂出来的 AI 客服:从 0 到 1 打磨生产级 RAG 系统,越用越聪明:https://www.bestblogs.dev/article/99b1b369fb 关于 BestBlogs BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 [关注我们]
EP195 · VS Code 走向周更、Google 托管智能体、Alex Zhang 解读 RLM章节时间戳 * 00:00 开场 * 00:47 精讲:Harald Kirschner 谈 VS Code 的 AI 周更实践 * 03:38 精讲:Ivan Leo 解读 Google 的托管智能体与状态管理 * 06:43 精讲:Alex Zhang 谈递归语言模型与上下文组织 * 09:33 重点 4–6:DoorDash、合成数据、Docker 微型虚拟机 * 11:33 重点 7–10:StartLux、NAT-ARC、Chatham、Barclays * 13:46 结语 ★ 精讲一 | VS Code 如何借助 AI 从每月发布走向每周发布|Harald Kirschner [视频] 00:47|来自 AI Engineer|BestBlogs 评分 90 VS Code 团队把发布节奏从月更改为周更,同时改造验证和反馈系统。Harald Kirschner 分享了仓库指引、无障碍技能、组件截图、应用自查与强制 AI 审查;团队所述代码存活率由 55% 升至 86%。这套实践帮助读者找到生成代码之后的交付瓶颈,并把验证、灰度和产品评测接成闭环。 ★ 精讲二 | 一次交互即可:Ivan Leo 解读 Google DeepMind 的 Interactions API 与托管智能体 [视频] 03:38|来自 AI Engineer|BestBlogs 评分 89 Google DeepMind 的 Ivan Leo 演示 Interactions API 如何用交互标识保存上下文与思维签名,再以环境标识复用托管智能体沙箱。类型化步骤、多模态调用和凭据代理,让开发者看清接口背后的运行机制。这篇适合判断哪些状态管理与基础设施工作可以交给平台,以及怎样把本地技能迁到云端。 ★ 精讲三 | Alex Zhang:递归语言模型如何释放智能体能力 06:43|来自 Latent.Space|BestBlogs 评分 89 把上下文放进可编程环境,再让模型通过代码调用子智能体,是 Alex Zhang 对递归语言模型的核心解释。他结合 GPU 内核验证与 Prime Agent 实践,讨论任务拆分怎样帮助策略迁移。访谈把注意力引向上下文组织、专家判断和计算分配,帮助读者寻找现有模型尚未被充分释放的能力。 重点 4–10 09:33 继续阅读七篇重点内容 在 DoorDash 构建 GenAI 平台 09:33|来自 InfoQ|BestBlogs 评分 91 DoorDash 分享了其扩展 GenAI 平台的历程,从简单的模型使用演变为包含 LLM 网关和以智能体为核心的基础设施的架构。 生成 12 万亿合成数据 token 的工程经验:Bogdan Gaza,DatologyAI [视频] 09:33|来自 AI Engineer|BestBlogs 评分 90 DatologyAI 联合创始人 Bogdan Gaza 讲述团队如何统一工作流,并解决元数据读取、故障恢复、资源调度和推理瓶颈,将预训练合成数据生成规模扩大到 12 万亿 token。 安全开启 YOLO 模式:用微型虚拟机隔离任意智能体 | Rowan Christmas,Docker [视频] 09:33|来自 AI Engineer|BestBlogs 评分 86 Docker 产品经理 Rowan Christmas 演示了微型虚拟机沙箱如何阻止编程智能体读取宿主机文件并控制网络访问,同时保留熟悉的命令行工作方式。 StartLux 开源决策模型:团队自测显示多项成绩超过 Jev 09:33|来自 机器之心|BestBlogs 评分 88 初创公司 StartLux 发布多规格开源决策模型 Decision,在 Decision Index 榜单上超越 Jev,并展示了基于 RSI 思路的 Auto Research 研发体系。 何恺明团队 NAT-ARC:自然图像预训练提升 ARC 视觉推理 09:33|来自 量子位|BestBlogs 评分 88 何恺明团队提出纯视觉 ARC 解题方案 NAT-ARC,用 ImageNet 上的 MAE 预训练初始化视觉编码器,单模型在 ARC-1 上达到 63.4% pass@2,集成后 70.2%,首次让视觉路线逼近专用 LLM 系统,并打通了视觉路线的 scaling 瓶颈。 Chatham 与 OpenAI 扩展其资本市场专业知识 09:33|来自 OpenAI News|BestBlogs 评分 86 Chatham Financial 利用 OpenAI 的模型和平台自动化复杂的交易验证,将处理时间从 30 分钟缩短至 4 分钟,同时让专家专注于人类判断。 Barclays 规模化部署 Claude 以升级运营并提升客户体验 09:33|来自 Anthropic News|BestBlogs 评分 85 Barclays 正在扩大与 Anthropic 的合作伙伴关系,在全全球运营中部署 Claude,目标是到 2026 年底实现 50% 的开发者采用 Claude Code,并在 2027 年实现大多数开发者采用,目前已有部署服务于 16,000 名员工并每天处理 120,000 封电子邮件。 相关链接 · 本期早报在线阅读:https://www.bestblogs.dev/explore/brief/2026-10-04 · VS Code 如何借助 AI 从每月发布走向每周发布|Harald Kirschner [视频]:https://www.bestblogs.dev/video/cb33465fe · 一次交互即可:Ivan Leo 解读 Google DeepMind 的 Interactions API 与托管智能体 [视频]:https://www.bestblogs.dev/video/062c20df5 · Alex Zhang:递归语言模型如何释放智能体能力:https://www.bestblogs.dev/article/1676cc1420 · 在 DoorDash 构建 GenAI 平台:https://www.bestblogs.dev/article/5e43ab6c38 · 生成 12 万亿合成数据 token 的工程经验:Bogdan Gaza,DatologyAI [视频]:https://www.bestblogs.dev/video/baac6a7ad · 安全开启 YOLO 模式:用微型虚拟机隔离任意智能体 | Rowan Christmas,Docker [视频]:https://www.bestblogs.dev/video/95a6ea844 · StartLux 开源决策模型:团队自测显示多项成绩超过 Jev:https://www.bestblogs.dev/article/ca3784e3e4 · 何恺明团队 NAT-ARC:自然图像预训练提升 ARC 视觉推理:https://www.bestblogs.dev/article/f32adb6e61 · Chatham 与 OpenAI 扩展其资本市场专业知识:https://www.bestblogs.dev/article/0404cc9e0a · Barclays 规模化部署 Claude 以升级运营并提升客户体验:https://www.bestblogs.dev/article/da454d1a8d 关于 BestBlogs BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 [关注我们]
EP194 · GPT-6 模型使用指南、a16z 谈 Agent 部署、Airbnb 改造内外服务章节时间戳 * 00:00 开场 * 00:43 精讲:OpenAI 指南比较 GPT-6 模型选择与生产运行 * 03:37 精讲:a16z 访谈解释企业采购 Agent 的部署难处 * 06:34 精讲:Latent.Space 访谈 Airbnb 从内部原型走向客服 * 09:37 重点 4–6:YC 无 GPU 计算、Spring AI 检索、Fractile 芯片 * 11:28 重点 7–10:Pi Durable、Cloudflare AI Search、Instinct、Claude Code Mods * 13:54 结语 ★ 精讲一 | GPT-6 系列模型使用指南 00:43|来自 OpenAI News|BestBlogs 评分 90 OpenAI 这份实操指南把 GPT-6 Astra、Sol、Luna 的选择落到任务难度、延迟与成本,还给出推理强度、提示词和技能边界的调整建议。对要把 Agent 投入生产的团队,更有用的是它把缓存、上下文压缩、异步工具与任务成功率监控放进同一套实施检查,读者可以据此审视现有工作流。 ★ 精讲二 | 为什么构建 AI 智能体比部署到企业更容易 [视频] 03:37|来自 a16z|BestBlogs 评分 90 a16z 与采购智能体公司 LEO 的对谈指出,企业系统记录了采购结果,却常漏掉邮件、合同、成本测算及跨部门协作。LEO 以低风险采购的自动谈判和复杂订单的专家参与说明,企业 Agent 真正难在接入完整流程、处理异常并逐步赢得信任。做垂直 AI 的读者可据此检查自己的产品是否只覆盖了系统里的标准路径。 ★ 精讲三 | 由内而外的 AI:Airbnb 的幕后重构与客端体验 06:34|来自 Latent.Space|BestBlogs 评分 90 Latent.Space 访谈 Airbnb CTO Ahmad Al-Dahle,具体展示从内部改造走向用户服务的路径:团队以原型和代码减少交接,Everest 上下文图复用跨项目经验,客服 Agent 则先用合成数据测试并保留人工处理高风险事项。它给产品与工程团队的启发是,部署 AI 要同时设计知识复用、验证边界和工程师对生成代码的解释责任。 重点 4–10 09:37 继续阅读七篇重点内容 如果不再使用 GPU,AI 计算会怎样?|YC Paper Club [视频] 09:37|来自 Y Combinator|BestBlogs 评分 90 YC Paper Club 比较了无梯度学习、光计算、模拟神经形态硬件和活体神经元,并反复追问这些实验室方案能否真正走向规模化。 Spring AI 模块化 RAG 与 TypeSafe Jev:检索更多,仅保留答案 09:37|来自 Spring Blog|BestBlogs 评分 90 Spring AI 将模块化 RAG 与 TypeSafe Jev 集成,通过查询重写、多查询扩展和结构化文档过滤来提高检索准确性。 前沿模型架构的未来:对话 Fractile 创始人兼 CEO Walter Goodwin [视频] 09:37|来自 No Priors|BestBlogs 评分 90 Fractile CEO Walter Goodwin 解释,可扩展的内存带宽比单看 FLOPs 更可能让推理智能体提速,并重塑前沿模型架构与芯片竞争。 Pi 1.0:为何接纳 MCP,又推出 Pi Durable? 09:37|来自 浮之静|BestBlogs 评分 90 本文深度解析了 Durable 1.0 框架,探讨其如何通过 MCP 协议与持久化运行体系解决 AI Agent 在执行中的状态管理、上下文优化及任务一致性问题。 AI Search 现已正式可用 09:37|来自 The Cloudflare Blog|BestBlogs 评分 90 Cloudflare AI Search 正式发布,让开发者能够使用 Workers AI、Vectorize 和 R2 在其自有数据上构建完全托管的按客户隔离的搜索服务,支持混合检索,无需运行基础设施。 Instinct 创始人对谈:Personal Agent 最激进的产品,凭什么估值 100 亿美元? 09:37|来自 Founder Park|BestBlogs 评分 90 Instinct 创始人 Noah Shinn 详解这款没有 App、只有手机号电脑邮箱的个人助理:如何用「可理解性」而非能力做产品、靠交易抽成而非广告变现,以及主动式 Agent 带来的算力与信任难题。 Claude Code:用 TypeScript 编写 Mods 来自定义功能 09:37|来自 Claude Blog|BestBlogs 评分 90 Anthropic 推出 mods——即挂钩到 Claude Code 事件的小型 TypeScript 函数,用于重写提示词、修改 UI 或替换内置功能——这些 mods 随插件一起发布,并附带企业级控制措施,如 sec-default。 相关链接 · 本期早报在线阅读:https://www.bestblogs.dev/explore/brief/2026-10-03 · GPT-6 系列模型使用指南:https://www.bestblogs.dev/article/8cef3eaeff · 为什么构建 AI 智能体比部署到企业更容易 [视频]:https://www.bestblogs.dev/video/a51f09f76 · 由内而外的 AI:Airbnb 的幕后重构与客端体验:https://www.bestblogs.dev/article/79ccabc70a · 如果不再使用 GPU,AI 计算会怎样?|YC Paper Club [视频]:https://www.bestblogs.dev/video/f1c36cffd · Spring AI 模块化 RAG 与 TypeSafe Jev:检索更多,仅保留答案:https://www.bestblogs.dev/article/ac7c1c8530 · 前沿模型架构的未来:对话 Fractile 创始人兼 CEO Walter Goodwin [视频]:https://www.bestblogs.dev/video/5924d9274 · Pi 1.0:为何接纳 MCP,又推出 Pi Durable?:https://www.bestblogs.dev/article/6fa9f3ad65 · AI Search 现已正式可用:https://www.bestblogs.dev/article/362c1b68ae · Instinct 创始人对谈:Personal Agent 最激进的产品,凭什么估值 100 亿美元?:https://www.bestblogs.dev/article/e0caa7b014 · Claude Code:用 TypeScript 编写 Mods 来自定义功能:https://www.bestblogs.dev/article/2c7377002b 关于 BestBlogs BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 [关注我们]
EP193 · Claude 拓展科研方法,DHH 宣布告别手写代码,Tessl 核算软件工厂成本 · 10-02 早报章节时间戳 * 00:00 开场 * 00:48 Claude 与 BootLoops:寻找适合 AI 的科学问题 * 03:37 DHH 的手写代码宣言:工程判断为何更重要 * 06:34 Tessl 的 600 美元 PR:重算软件工厂的回报 * 09:29 LangChain 模型路由、Airbnb 产品与 Olmo-core 3 训练 * 11:27 Embed 5、DOCA 技能、网关设计与智能的边界 * 13:37 结语 ★ 精讲一 | Claude 时代的科学 来自 Anthropic Research|BestBlogs 评分 91 Schwartz 借助 Claude 构建 BootLoops,把物理学计算方法迁移到生态学和遗传学。模型能找到技术上成立的跨领域联系,领域专家则帮助把结果推进为有科学意义的问题。读者可据此理解如何选择适合 AI 的任务,把精确计算、工具积累与人的研究判断组织成协作流程。 ★ 精讲二 | 每日脉动:RoR 作者再次引发‘手写代码终结论’辩论 来自 The Pragmatic Engineer|BestBlogs 评分 90 DHH 宣布 37signals 将手写代码变为例外,并开始开发原生移动应用、迁移部分后端到 Rust。Gergely Orosz 把这一转向与工程师负担、软件质量问题放在一起讨论,提出建设验证系统和生成确定性工具的方向。读者可从中重新判断代码生成普及后,工程责任与能力应落在哪里。 ★ 精讲三 | 600 美元的 PR:软件工厂的投资回报究竟来自哪里 [视频] 来自 AI Native Dev|BestBlogs 评分 90 修改与审查智能体反复往返,让 Tessl 一次 PR 花掉约 600 美元。研究负责人 Rob 从这次经历谈任务边界、验证和反馈,并用队列形式化建模与审查实验说明收益来自整套流程。把重试、基础设施和人工注意力计入成本,才能看清软件工厂值得优先改进的环节。 重点 4–10 继续阅读七篇重点内容 如何在 Harness 中构建模型路由器 来自 LangChain Blog|BestBlogs 评分 90 LangChain 在 Open SWE 智能体 Harness 内构建了模型路由器,对每项任务进行分类并选择最低成本的合适模型,将编码线程的中位数成本降低了 64%,且质量变化可忽略不计。 Airbnb CEO Brian Chesky:AI 如何改变旅行产品,以及优秀人才为何更有优势 [视频] 来自 Silicon Valley Girl|BestBlogs 评分 87 Airbnb CEO Brian Chesky 解释了 AI 搜索、服务市场和更快的产品交付,并认为当人人都能用上相同工具时,判断力与品味会变得更重要。 Introducing Olmo-core 3: 为大规模 MoE 设计的开放、可扩展训练基础设施 来自 Hugging Face - Blog|BestBlogs 评分 92 Olmo-core 3 提供开放的大规模 MoE 训练基础设施。团队在初步的八块 B300 配置中测得吞吐量较前代提升 2.7 倍,并公开技术报告,记录专家路由、通信与内存管理的取舍;这是系统基准结果,不是已经训练好的万亿参数模型。 Cohere 发布 Embed 5:新一代嵌入模型的检索与多语言表现 来自 MarkTechPost|BestBlogs 评分 85 Cohere 发布了 Embed 5,这是一个包含 Pro 和 Fast 版本的全新嵌入模型系列,专为搜索和智能体工作流设计,并在金融基准测试中表现卓越。 NVIDIA 推出 DOCA 智能体技能,加快 BlueField 应用开发 来自 NVIDIA Technical Blog|BestBlogs 评分 86 NVIDIA 推出了 DOCA Agent Skills,这是一个标准化框架,旨在为 AI 智能体提供领域知识和架构约束,从而加速在 BlueField DPU 上的应用开发。 构建 Gateway API 数据平面:Envoy Gateway 与 Airlock 的幕后设计 [视频] 来自 CNCF [Cloud Native Computing Foundation]|BestBlogs 评分 90 两位 Gateway API 实现者结合 Envoy Gateway 和 Airlock Microgateway,解释代理部署、集群映射、xDS 更新和扩展机制各自的取舍。 为什么真正的智能远不止是优化 | Aeon 随笔 来自 Aeon | a world of ideas|BestBlogs 评分 89 文章指出,将智能定义为优化复兴了休谟关于理性是情感奴隶的观点,而康德提出的理性即自主这一更丰富的内涵,才是将人与工具区分开来的关键。 相关链接 · 本期早报在线阅读:https://www.bestblogs.dev/explore/brief/2026-10-02 · Claude 时代的科学:https://www.bestblogs.dev/article/333c5b436b · 每日脉动:RoR 作者再次引发‘手写代码终结论’辩论:https://www.bestblogs.dev/article/4125b953d0 · 600 美元的 PR:软件工厂的投资回报究竟来自哪里 [视频]:https://www.bestblogs.dev/video/90d76789a · 如何在 Harness 中构建模型路由器:https://www.bestblogs.dev/article/6444c3fab4 · Airbnb CEO Brian Chesky:AI 如何改变旅行产品,以及优秀人才为何更有优势 [视频]:https://www.bestblogs.dev/video/67a11eb08 · Introducing Olmo-core 3: 为大规模 MoE 设计的开放、可扩展训练基础设施:https://www.bestblogs.dev/article/c34105384c · Cohere 发布 Embed 5:新一代嵌入模型的检索与多语言表现:https://www.bestblogs.dev/article/19c27464ee · NVIDIA 推出 DOCA 智能体技能,加快 BlueField 应用开发:https://www.bestblogs.dev/article/05597a62eb · 构建 Gateway API 数据平面:Envoy Gateway 与 Airlock 的幕后设计 [视频]:https://www.bestblogs.dev/video/e9f743f40 · 为什么真正的智能远不止是优化 | Aeon 随笔:https://www.bestblogs.dev/article/9cc73ee0b5 关于 BestBlogs BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 [关注我们]
EP192 · Gemini Argon 推进长程任务、Anthropic 衡量机器人工作、Eleven v4 语音模型章节时间戳 * 00:00 开场 * 00:49 精讲:Google DeepMind 的 Gemini 4 Argon 工程能力 * 03:34 精讲:Anthropic 预测机器人的工作与部署成本 * 06:30 精讲:ElevenLabs 的 Eleven v4 表达与低延迟语音 * 09:13 重点 4–6:高德 Agent、小红书 Harness、京东 Codex 视频 * 11:27 重点 7–10:个人助理、SynthID Bio、代码审查、研发效能 * 14:24 结语 ★ 精讲一 | Gemini 4 Argon:前沿智能的新阶段 00:49|来自 Google DeepMind|BestBlogs 评分 93 Gemini 4 Argon 将长程推理落到代码迁移、内存优化和安全防御,目前通过 Fairwind 向受信任的网络防御者逐步开放。Google 的内部案例提供了理解模型能力的新切口:连续实验、检查编译结果与人工审计,怎样共同支撑复杂工程任务,而非只看一次生成是否成功。 ★ 精讲二 | 我们能预测机器人将从事的工作吗? 03:34|来自 Anthropic Research|BestBlogs 评分 91 Anthropic 用任务、环境与成本三个层次衡量机器人的就业影响:当前机器人能覆盖许多体力任务,却往往需要受控场地,经济上划算的工作仍很少。研究结合任务数据库、Claude 评估和历史回测,帮助读者判断哪些岗位可能先发生变化,以及能力演示到实际部署还差什么。 ★ 精讲三 | Eleven v4:我们最具表现力的文本转语音 AI 模型 06:30|来自 ElevenLabs Blog|BestBlogs 评分 91 ElevenLabs 同时推出表达型 Eleven v4 与低延迟 Turbo,将语气、上下文、多说话人互动和跨语言声线一致性放进同一产品更新。原文说明自然语言导演指令、音频标签与声音克隆的使用方式,也分别交代推理延迟和首段可听语音的指标,便于创作者与语音智能体团队判断取舍。 重点 4–10 09:13 继续阅读七篇重点内容 高德本地生活分析 Agent AI Native 实践全景(万字长文) 09:13|来自 阿里技术|BestBlogs 评分 91 作者复盘了高德本地生活团队在 AI Native 研发转型中的实践,通过构建结构化规则、知识库和分析智能体,提升了 BI 经营诊断的效能。 小红书推荐系统的 Agentic 发布:跨昼夜任务 Harness 实践 09:13|来自 小红书技术 REDtech|BestBlogs 评分 90 小红书推荐系统将跨昼夜发布流程沉淀为近 20 万字 SKILL 后仍出现模型幻觉导致推全事故,转而构建长程任务 Harness,以任务持久化、模板约束、引擎推进和效果查证保障 Agent 可靠完成发布。 81.8 秒、15 个版本:一次纯 Codex 驱动的 AI-native 视频实践 09:13|来自 京东技术|BestBlogs 评分 91 京东技术团队分享了一套由 Codex 驱动的 AI-native 视频制作链路,通过将创意意图转化为可编辑的工程代码(HTML/GSAP/WebGL/Blender),实现了从产品资料到高质量成片的自动化生产与精准迭代。 从编程到个人助理:更强大的 AI,更透明的你 09:13|来自 晚点 LatePost|BestBlogs 评分 91 本文通过智谱 ZCode 等 AI 编程工具的静默上传事件,深度剖析了 AI 个人助理在提升效率的同时,如何通过不对等的用户协议和技术路径打破隐私屏障,使个体在科技巨头面前变得前所未有地透明。 SynthID Bio:合成生物学的水印方法 09:13|来自 Google DeepMind News|BestBlogs 评分 90 Google DeepMind 推出了 SynthID Bio,这是一系列通过在合成蛋白质序列和 3D 结构中嵌入不可见签名的水印方法,旨在增强生物安全性和科学完整性。 代码审查之死:数据揭示的真相 | Laurie Voss,Arize AI [视频] 09:13|来自 AI Engineer|BestBlogs 评分 89 Laurie Voss 认为,AI 生成代码的速度已让可信审查成为新的瓶颈;团队应把人的判断从逐行检查转向构建并监测可靠的审查系统。 400 多家组织的 AI 软件开发现状:Justin Reock 解读效能、质量与研发平台数据 [视频] 09:13|来自 AI Engineer|BestBlogs 评分 87 DX 副 CTO Justin Reock 基于数百家组织和约 20 万名工程师的数据指出,AI 正在提升交付吞吐量,却也伴随 PR 变大、变更信心下降等质量与协作压力;组织应同时衡量使用情况、业务影响、成本和平台就绪度,并优先解决真正的交付瓶颈。 相关链接 · 本期早报在线阅读:https://www.bestblogs.dev/explore/brief/2026-10-01 · Gemini 4 Argon:前沿智能的新阶段:https://www.bestblogs.dev/article/3b19baea81 · 我们能预测机器人将从事的工作吗?:https://www.bestblogs.dev/article/eed774a046 · Eleven v4:我们最具表现力的文本转语音 AI 模型:https://www.bestblogs.dev/article/3b03f1b003 · 高德本地生活分析 Agent AI Native 实践全景(万字长文):https://www.bestblogs.dev/article/c6ab355805 · 小红书推荐系统的 Agentic 发布:跨昼夜任务 Harness 实践:https://www.bestblogs.dev/article/e472735bdb · 81.8 秒、15 个版本:一次纯 Codex 驱动的 AI-native 视频实践:https://www.bestblogs.dev/article/6a9ec5e517 · 从编程到个人助理:更强大的 AI,更透明的你:https://www.bestblogs.dev/article/5eb7a5e203 · SynthID Bio:合成生物学的水印方法:https://www.bestblogs.dev/article/0279b7a6d7 · 代码审查之死:数据揭示的真相 | Laurie Voss,Arize AI [视频]:https://www.bestblogs.dev/video/c221b41b6 · 400 多家组织的 AI 软件开发现状:Justin Reock 解读效能、质量与研发平台数据 [视频]:https://www.bestblogs.dev/video/168e9617b 关于 BestBlogs BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 [关注我们]
EP191 · OpenAI 更新开发生态、Manus 2.0 推出 Cue、Sonnet 5.5 降任务成本章节时间戳 * 00:00 开场 * 00:51 精讲:数字生命卡兹克梳理 OpenAI 开发者大会产品生态 * 03:49 精讲:机器之心解读 Manus 2.0 与 Cue 的持续工作能力 * 06:21 精讲:AINLP 分析 Claude Sonnet 5.5 的任务成本 * 08:42 重点 4–6:OpenAI dots、GPT-6.1 Sol、阿里 AI Native 实践 * 10:25 重点 7–10:a16z 消费助手、Claude Code、特斯拉 FSD、DeepSeek Harness * 12:41 结语 ★ 精讲一 | 帮大家总结了一下凌晨的 OpenAI 2026 开发者大会。 00:51|来自 数字生命卡兹克|BestBlogs 评分 92 数字生命卡兹克把 OpenAI 开发者大会的 Dots、ChatGPT Space、Decisions API、Codex 云端环境和应用生态串在一起,方便读者看到个人助手、开发工具与分发入口如何连接。文中对订阅额度和 OpenAI 跟随竞争者的评价来自作者自身体验,应与发布事实分开理解。 ★ 精讲二 | Manus 回来了!更新 2.0 并发布全天候智能体 Cue 03:49|来自 机器之心|BestBlogs 评分 88 机器之心详述 Manus 2.0 的 Cascade 架构、独立云电脑、事件触发自动化与 Studio 专业创作环境,并介绍 Cue 为个人智能体配置邮箱、电话和支付能力。文章让读者看见智能体从生成初稿走向持续修改和现实服务的产品路径;性能改善来自厂商内部测试,Cue 仍处早期体验。 ★ 精讲三 | Claude Sonnet 5.5 发布:干活更快,单价不变 06:21|来自 AINLP|BestBlogs 评分 85 AINLP 从任务成本而非单次输出价格评估 Claude Sonnet 5.5:API 单价维持不变,较少工具步骤和较低 effort 已能完成更多编程工作。文章还比较了高档位成本与范围外修改风险,给日常编码和文档工作提供了按任务选模型、调节推理力度的依据;基准结果需按各自测试环境理解。 重点 4–10 08:42 继续阅读七篇重点内容 推出 dots 08:42|来自 OpenAI News|BestBlogs 评分 92 OpenAI 推出了「dots」,这是一种由 GPT-6 驱动的常驻智能体,能够使用自己的云端计算机和浏览器,自主为用户处理复杂任务。 GPT-6.1 Sol 正式发布 08:42|来自 OpenAI News|BestBlogs 评分 86 OpenAI 官方给出 GPT-6.1 Sol 的能力评估和 Token 定价:它在编码、电脑操作与专业任务上接近 Astra,标准输入输出价格为后者五分之一,缓存输入每百万 Token 为 0.10 美元。重点是具体工作负载的模型选型与成本,而非重复大会全景。 AI Native 回忆录:稳定性前端 S1 实践复盘 08:42|来自 阿里技术|BestBlogs 评分 91 阿里稳定性团队通过构建结构化规则包 Skill 和集成工作台 Anchor,解决了 AI Native 研发模式下代码质量失控与协作成本增加的问题,并探索了 PDFE 复合角色与分库协作新范式。 什么样的 AI 助手值得付费?消费级智能体的价值、信任与成本 [视频] 08:42|来自 a16z|BestBlogs 评分 91 a16z 的讨论认为,消费级智能体要靠主动解决高成本的生活琐事来证明价值,而用户信任、专业化、平台激励和高昂运营成本将决定哪些产品能够持续发展。 Anthropic 产品负责人谈 Claude Code 新阶段:智能体编程与可变软件 08:42|来自 Latent.Space|BestBlogs 评分 87 Anthropic 的 Thariq Shihipar 探讨了 Claude Code 的演进、通过 Claude Mods 向「可变软件」的转变,以及日益自主的智能体所带来的关键安全挑战。 让人类交出方向盘:特斯拉 FSD 十三年的冒险、争议与进化 08:42|来自 硅谷 101|BestBlogs 评分 92 本文深度回顾了特斯拉 FSD 十三年从依赖供应商到自研芯片、从简单感知到 3D 占用网络的演进历程,揭示了其在硬件迭代与算法升级中经历的争议、冲突与技术突破。 DeepSeek Harness 桌面端:现在,开箱即用。 08:42|来自 DeepSeek Harness 团队|BestBlogs 评分 91 DeepSeek Harness 发布 v0.2 预览版,推出 macOS 和 Windows 桌面端安装包,实现开箱即用,并增强了插件管理、自动化任务及代码变更展示能力。 相关链接 · 本期早报在线阅读:https://www.bestblogs.dev/explore/brief/2026-09-30 · 帮大家总结了一下凌晨的 OpenAI 2026 开发者大会。:https://www.bestblogs.dev/article/fe2dcbb357 · Manus 回来了!更新 2.0 并发布全天候智能体 Cue:https://www.bestblogs.dev/article/f539745d71 · Claude Sonnet 5.5 发布:干活更快,单价不变:https://www.bestblogs.dev/article/185a96c0f6 · 推出 dots:https://www.bestblogs.dev/article/ca9d3253f7 · GPT-6.1 Sol 正式发布:https://www.bestblogs.dev/article/8dd741f36a · AI Native 回忆录:稳定性前端 S1 实践复盘:https://www.bestblogs.dev/article/7c98d09e6a · 什么样的 AI 助手值得付费?消费级智能体的价值、信任与成本 [视频]:https://www.bestblogs.dev/video/184a74b78 · Anthropic 产品负责人谈 Claude Code 新阶段:智能体编程与可变软件:https://www.bestblogs.dev/article/1af5456c88 · 让人类交出方向盘:特斯拉 FSD 十三年的冒险、争议与进化:https://www.bestblogs.dev/article/dc2fd93cb5 · DeepSeek Harness 桌面端:现在,开箱即用。:https://www.bestblogs.dev/article/99f92f6982 关于 BestBlogs BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 [关注我们]
EP190 · 大模型回顾、AI 拓展产品角色、OpenAI 讲漏洞修复 · 09-29 早报章节时间戳 * 00:00 开场 * 00:47 精讲:Simon Willison 回顾 2026 年大模型、编码智能体与安全 * 03:30 精讲:Atlassian CPO Tamar Yehoshua 谈产品经理何时动手、何时掌舵 * 05:59 精讲:OpenAI 讲防御者窗口与 Codex Security 的漏洞修复 * 08:22 重点 4–6:Jev、Qwen3.8-Max Kernel Agent、NVIDIA DSX MaxLPS * 10:28 重点 7–10:Ontology、黄仁勋五层蛋糕、GitHub Android 漏洞、Holo4 * 12:56 结语 ★ 精讲一 | 2026 年 LLM 发展回顾(截至目前) 00:47|来自 Simon Willison's Weblog|BestBlogs 评分 92 Simon Willison 按月份回顾今年的大模型进展:编码智能体开始足以支撑日常工作,个人智能体和本地模型也迅速发展。他同时追踪智能体越界的安全事件,并用自己的项目说明,能生成代码仍不等于做出了好产品。读完可把模型能力、工程验证与实际价值放在同一张时间线上判断。 ★ 精讲二 | Atlassian CPO Tamar Yehoshua:AI 如何拓展产品团队的角色,以及何时亲自上手、何时掌舵 [视频] 03:30|来自 Lenny's Podcast|BestBlogs 评分 91 Atlassian 首席产品官 Tamar Yehoshua 用 Confluence、新项目和 Jira 三个案例说明,产品经理何时应直接参与编码,何时应退回方向把控。成熟产品的风险边界与新项目不同;她也强调要看客户结果和交付成效,而非单纯统计 AI 使用量。适合正在调整产品团队分工的人参考。 ★ 精讲三 | OpenAI 网络安全主题演讲:把握防御者窗口期,用 Codex Security 和智能体加速漏洞修复 [视频] 05:59|来自 OpenAI|BestBlogs 评分 90 OpenAI 在网络安全演讲中提出,前沿模型领先于广泛可用模型的阶段给防御方留下有限窗口。演讲展示 Codex Security 从扫描、验证到修复的流程,以及内部防御工厂如何接入现有系统并核验补丁。重点是把发现转成经验证的修复,也要为高能力模型设置授权范围、隔离环境和监控。 重点 4–10 08:22 继续阅读七篇重点内容 Jev 如何让 AI 成为软件里的可靠能力,把想法变成真正能做事的程序 [视频] 08:22|来自 a16z|BestBlogs 评分 90 TypeSafe 创始人 Diego 认为,Jev 能把 AI 变成软件内部可靠的决策原语,让自动化超越聊天机器人和编程智能体,并改变开发者与 SaaS 公司构建应用的方式。 从榜单走向真实业务负载:Kernel Agent 刷新 Qwen3.8-Max 核心推理算子性能 08:22|来自 阿里技术|BestBlogs 评分 90 阿里开源 Atrex Kernel Agent (AKA),在 Qwen3.8-Max 真实生产负载上实现 GPU 算子性能超越专家手工优化,最高加速 1.55×,标志着 AI 驱动的系统级性能工程从 Benchmark 走向生产交付。 NVIDIA DSX MaxLPS 如何最大化 AI 工厂吞吐量与效率 08:22|来自 NVIDIA Technical Blog|BestBlogs 评分 90 NVIDIA DSX MaxLPS 利用动态功率共享回收 AI 工厂中的闲置容量,在不超出静态功率预算的前提下,实现 GPU 密度提升 37% 及每瓦吞吐量提高 49%。 改变世界前先认识世界 : Ontology 决策结构化实践 08:22|来自 大淘宝技术|BestBlogs 评分 90 文章提出通过 Ontology(本体)与决策结构化,让 Agent 动态生成工作流以实现业务全托管,强调结构化业务知识是 AI 稳定产出的核心壁垒。 #739.黄仁勋:「五层蛋糕」里,最重要的是应用层 [播客] 08:22|来自 跨国串门儿计划|BestBlogs 评分 88 黄仁勋在 Ezra Klein 访谈中提出 AI「五层蛋糕」框架,主张应用层最重要,认为 AI 是工程而非失控智能,安全应由企业自律而非新监管解决,并对末日论与就业恐慌作出反驳。 我们如何利用开源 AI 安全智能体发现 24 个 Android 漏洞 08:22|来自 The GitHub Blog|BestBlogs 评分 86 GitHub Security Lab 详细介绍了其开源 AI 智能体框架如何通过定向任务流引导大语言模型进行入口点分析和逻辑漏洞检测,从而发现了 24 个 Android 漏洞。 Holo4:赋能通用型计算机使用智能体 08:22|来自 Hugging Face - Blog|BestBlogs 评分 88 H Company 发布 Holo4,这是一系列开源权重的智能体模型(27B 和 35B-A3B),旨在通过多种接口(GUI、代码、MCP、API)与软件交互,以显著更低的成本在复杂任务上实现前沿级性能。 相关链接 · 本期早报在线阅读:https://www.bestblogs.dev/explore/brief/2026-09-29 · 2026 年 LLM 发展回顾(截至目前):https://www.bestblogs.dev/article/2e8ea26969 · Atlassian CPO Tamar Yehoshua:AI 如何拓展产品团队的角色,以及何时亲自上手、何时掌舵 [视频]:https://www.bestblogs.dev/video/8f1efa1d9 · OpenAI 网络安全主题演讲:把握防御者窗口期,用 Codex Security 和智能体加速漏洞修复 [视频]:https://www.bestblogs.dev/video/b286f3b3e · Jev 如何让 AI 成为软件里的可靠能力,把想法变成真正能做事的程序 [视频]:https://www.bestblogs.dev/video/4a66f004e · 从榜单走向真实业务负载:Kernel Agent 刷新 Qwen3.8-Max 核心推理算子性能:https://www.bestblogs.dev/article/ba7f22ad53 · NVIDIA DSX MaxLPS 如何最大化 AI 工厂吞吐量与效率:https://www.bestblogs.dev/article/5f4b00c13d · 改变世界前先认识世界 : Ontology 决策结构化实践:https://www.bestblogs.dev/article/4b6ee2fa97 · #739.黄仁勋:「五层蛋糕」里,最重要的是应用层 [播客]:https://www.bestblogs.dev/podcast/abdc9def3 · 我们如何利用开源 AI 安全智能体发现 24 个 Android 漏洞:https://www.bestblogs.dev/article/d56b4e3f4b · Holo4:赋能通用型计算机使用智能体:https://www.bestblogs.dev/article/31482f54c9 关于 BestBlogs BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 [关注我们]
EP189 · José Valim 谈语言、Orobator 讲智能体工程、Molly Graham 谈职业转型章节时间戳 * 00:00 开场 * 00:51 精讲:Dashbit 的 José Valim 谈 AI 时代编程语言的验证与运行状态 * 03:50 精讲:AI Engineer 的 Andrew Orobator 谈编码智能体如何复用工程判断 * 06:32 精讲:Lenny’s Podcast 的 Molly Graham 谈 AI 时代工作的责任与倦怠 * 09:22 重点 4–6:Tereza 软件工厂、Microsoft Autopilot 与 OpenClaw、AI Trading * 11:12 重点 7–10:人机对齐、AI 写作与思考、Meta Muse、AI 与哲学 * 13:18 结语 ★ 精讲一 | AI 时代编程语言的演进 00:51|来自 Dashbit|BestBlogs 评分 90 José Valim 在 Dashbit 的文章中追问:当智能体承担更多编码工作,语言还该优先优化什么?他认为语法便利的重要性会下降,更强的类型与运行时保证、可查询的程序数据库、可供智能体探索的运行状态会更有价值。读完可以重新审视语言工具链该怎样支持验证与诊断。 ★ 精讲二 | 扩大工程判断力,而非模型规模:Andrew Orobator 谈编码智能体实践 | Reddit [视频] 03:50|来自 AI Engineer|BestBlogs 评分 90 Reddit 安卓工程师 Andrew Orobator 把编码智能体的关键放在可复用的工程判断上:用技能记录审查问题、用工作日志跨会话保存决策,再以测试和硬门逐步扩大自主权。他展示的旧功能开关清理智能体只处理机械安全的任务并提交待审的变更,给团队提供了可操作的自动化边界。 ★ 精讲三 | 科技行业正在经历的悲伤、孤独与倦怠:Molly Graham 谈 AI 时代的工作与职业转型 [视频] 06:32|来自 Lenny's Podcast|BestBlogs 评分 88 Molly Graham 在 Lenny 的访谈中重新审视把工作交出去的职业建议:交给 AI 做任务后,人仍要负责提供背景、检查质量和承担结果。她也谈到代码工作转为监督智能体时的失落、孤独与倦怠,提醒管理者给团队留出讨论变化的空间,并守住判断与关系这些需要人负责的部分。 重点 4–10 09:22 继续阅读七篇重点内容 打造软件工厂究竟需要什么:Tereza Tížková 谈智能体工程体系 [视频] 09:22|来自 AI Engineer|BestBlogs 评分 87 Factory 的 Tereza Tížková 将软件工厂定义为覆盖端到端的软件工程系统,并说明如何通过灵活的模型选择、可验证的智能体任务、上下文管理和代码库准备,让自主执行更加可靠。 Microsoft Autopilot 基于 OpenClaw 构建,双方贡献互惠共赢 09:22|来自 OpenClaw Blog|BestBlogs 评分 86 微软全新的 Autopilot 智能体基于 OpenClaw 构建,且微软工程师通过大量的上游贡献,提升了整个社区在安全性、Windows 集成度及可靠性方面的表现。 AI Trading —— 决策便宜,行动很贵|对谈超 3w Star Vibe-Trading 作者浩哲 [播客] 09:22|来自 42 章经|BestBlogs 评分 90 Vibe-Trading 作者吴浩哲拆解 AI Trading:金融里决策便宜、行动很贵,AI 的价值是建立从决策到行动的可验证、可审计通道,核心在于数据对齐与 harness,而非更强的模型。 人机协作旨在对齐,而非能力 09:22|来自 Sean Goedecke|BestBlogs 评分 90 软件工程师之所以依然重要,并非因为 AI 缺乏编码能力,而是因为人类对于将 AI 输出与特定的组织价值观和技术背景相对齐至关重要。 AI 都替我写完了,我还要不要思考? 09:22|来自 新京报书评周刊|BestBlogs 评分 90 本文深入辨析了 AI 参与「形成文字」与「代写」的本质界限,指出关键在于人的判断是否在场,并提出了四种正当的 AI 协作模式及潜在风险。 #741.All-in|Meta Muse:AI 助理第一次替普通人办事 [播客] 09:22|来自 跨国串门儿计划|BestBlogs 评分 86 All-In 四人组从 All-In Summit 出发,讨论 AI 公司该被当普通公司追究产品责任、开源模型 12 周内反超闭源、token 通缩迫使 Anthropic 与 OpenAI 向技术栈上层走,以及 Meta Muse 让普通人第一次真正用上 AI 助手。 当 AI 比哲学家更会思考,人类该怎么办? [视频] 09:22|来自 纽约漫谈录|BestBlogs 评分 91 哲学教授孙向晨从自己的哲学智能体实验出发,讨论 AI 的创造与思想归属、德性对齐、人类判断力及多元智能共生。 相关链接 · 本期早报在线阅读:https://www.bestblogs.dev/explore/brief/2026-09-28 · AI 时代编程语言的演进:https://www.bestblogs.dev/article/82097e72b0 · 扩大工程判断力,而非模型规模:Andrew Orobator 谈编码智能体实践 | Reddit [视频]:https://www.bestblogs.dev/video/6f52e252b · 科技行业正在经历的悲伤、孤独与倦怠:Molly Graham 谈 AI 时代的工作与职业转型 [视频]:https://www.bestblogs.dev/video/c282b429f · 打造软件工厂究竟需要什么:Tereza Tížková 谈智能体工程体系 [视频]:https://www.bestblogs.dev/video/84baa0f86 · Microsoft Autopilot 基于 OpenClaw 构建,双方贡献互惠共赢:https://www.bestblogs.dev/article/2ef8d38287 · AI Trading —— 决策便宜,行动很贵|对谈超 3w Star Vibe-Trading 作者浩哲 [播客]:https://www.bestblogs.dev/podcast/2b182be76 · 人机协作旨在对齐,而非能力:https://www.bestblogs.dev/article/a86269099a · AI 都替我写完了,我还要不要思考?:https://www.bestblogs.dev/article/286c82a0be · #741.All-in|Meta Muse:AI 助理第一次替普通人办事 [播客]:https://www.bestblogs.dev/podcast/6f74ed415 · 当 AI 比哲学家更会思考,人类该怎么办? [视频]:https://www.bestblogs.dev/video/cc0a61dd1 关于 BestBlogs BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 [关注我们]
BestBlogs 精选周刊第 114 期 · 过剩与短板本周亮点 本期围绕「过剩与短板」展开,关注智能供给过剩以后,任务经济成为新尺子、评测从收尾检查变成生产控制面、个体提速不等于组织吞吐、执行过剩以后,方向与人的成长成为短板。 模型单价只是输入,生产系统真正要优化的是一次任务从路由、执行、验证到完成的总成本。生产智能体的核心短板,不是缺少一个更会打分的模型,而是缺少低成本在线评估、外置停止条件,以及能够反馈到系统里的结构化信号。 时间线 00:00 开场 · 过剩与短板 01:45 模型降价以后,任务为什么未必更便宜 03:51 路由、训练与算力的新账本 06:52 低成本评估器如何扩大覆盖 09:21 评测怎样进入执行循环与科学验证 11:56 个体提速为何没有变成组织吞吐 14:53 操作手册、统一模型与基础设施 17:11 探索团队怎样筛选方向 18:49 路线图归零与人的非默认问题 21:55 收尾 · 本周关键词 + 下周预告 精讲条目 智能供给过剩以后,任务经济成为新尺子 * 推出 Claude Opus 5.5 · Hacker News · https://www.bestblogs.dev/article/3af6c5a106 * Xiaomi MiMo-V2.6:扩展强化学习,迈向自我提升 · Xiaomi MiMo · https://www.bestblogs.dev/article/8717d12a88 * 一夜三连发,Claude Opus 5.5、GPT-6 Sol 和 Luna 全部都来了。 · 数字生命卡兹克 · https://www.bestblogs.dev/article/21ef025d3a * Grok 4.7 发布 · Cursor Blog · https://www.bestblogs.dev/article/a24acff61f * 生产环境中的 LLM 推理路由:从引擎信号到策略 · AI Engineer · https://www.bestblogs.dev/video/2cfd1267e * AI 进入生产阶段之后, 智能、算力、芯片 会走向哪里? · 屠龙之术 · https://www.bestblogs.dev/podcast/bb87a822d 评测从收尾检查变成生产控制面 * Jev 能成为更好的智能体评估器吗? · LangChain Blog · https://www.bestblogs.dev/article/497a5fd40a * 让智能体可评、可控、可迭代:业务效果导向的评测体系与场景实践 · 大淘宝技术 · https://www.bestblogs.dev/article/4368159142 * Diogo Almeida:我为什么要做 Jev? · Founder Park · https://www.bestblogs.dev/article/62d2583a2e * Claude 发现一种具有类 CRISPR 重复序列的新型酶系统 · Anthropic News · https://www.bestblogs.dev/article/0ae1d0bcb3 * 循环工程:把智能体放进工程循环 · 大淘宝技术 · https://www.bestblogs.dev/article/be3f7306cd 个体提速不等于组织吞吐 * 如何为 AI 驱动的代码现代化项目做好准备 | Claude by Anthropic · Claude Blog · https://www.bestblogs.dev/article/6f5a684330 * LinkedIn 的上下文工程:如何用 MCP 为 AI 智能体构建组织级上下文层 · InfoQ · https://www.bestblogs.dev/article/b7366a7601 * MTFM:美团统一推荐基座大模型在外卖多业务场景的落地实践 · 美团 · 技术团队 · https://www.bestblogs.dev/article/695010f7fb * 《AI 原生研发范式实践手册》发布 · 阿里技术 · https://www.bestblogs.dev/article/b1bc8d9c07 * 腾讯 15 年资深后台工程师,转战大模型推理的抉择 · 腾讯技术工程 · https://www.bestblogs.dev/article/a6da76a758 * 89.当 AI 进入组织,那些「从没人说过的真相」|与网易阮良聊 AI 原生组织与企业 Agent 实战 · 卫诗婕|漫谈Light the Star · https://www.bestblogs.dev/podcast/71d43a30e 执行过剩以后,方向与人的成长成为短板 * 在移动的 AI 前沿上做产品:用实验室机制驾驭技术变革 | Every CEO Dan Shipper · Lenny's Podcast · https://www.bestblogs.dev/video/9e62318e9 * 最后一份路线图:当 AI 让执行过剩、信念成为稀缺品 | Claire Vo · Lenny's Podcast · https://www.bestblogs.dev/video/5e7d8805e * Replit CEO Amjad Masad 谈 AI 时代的年轻人应该学什么 · a16z · https://www.bestblogs.dev/video/558516f39 关于 BestBlogs BestBlogs.dev 是 AI 驱动的私人阅读助手。它会从 RSS、订阅邮件、Twitter、YouTube、播客等来源中筛选高质量内容,结合你关注的来源、兴趣标签和阅读行为,把「我的早报」整理成每天真正适合你的阅读流。不论你关注的是技术、AI、产品、商业、研究、设计、投资、文化还是个人成长,都能从中发现值得花时间阅读的内容。 完成新用户三步引导送 7 天 Pro 试用;现有 Pro 用户邀请朋友双方各得 7 天 Pro(上限 28 天)。 相关链接 * 本期周刊 · https://www.bestblogs.dev/newsletter/issue114 * 三步引导送 7 天 Pro 试用 · https://bestblogs.dev
EP188 · Parag 谈搜索补偿、Erina 用实验改进智能体、Roland 构建产品循环 · 09-27 早报章节时间戳 * 00:00 开场 * 01:01 精讲:Parag Agrawal 谈智能体搜索与内容补偿 * 04:02 精讲:Erina Karati 用实验评估长时程智能体 * 06:53 精讲:Roland Gavrilescu 谈智能体产品的改进循环 * 09:51 重点 4–6:Claude 九圈振幅、Skydio 无人机、Perplexity CobbleDB * 11:30 重点 7–10:GEPA 反思优化、Morph GPU、Dyna Robotics、千问 AI 平台 * 13:32 结语 ★ 精讲一 | Parag Agrawal 谈智能体搜索、内容补偿与未来网络入口 [视频] 01:01|来自 20VC with Harry Stebbings|BestBlogs 评分 90 前 Twitter CEO、Parallel 创始人 Parag Agrawal 判断,智能体频繁使用网络会重塑搜索成本。他解释如何让搜索先筛掉无关信息,节省模型推理开销,并提出按智能体获益向内容所有者付费。访谈还谈到持续监测网页变化的推送式搜索,可帮助读者理解开放网络的新商业模式。 ★ 精讲二 | 长时程智能体需要实验,而不只是提示词 — Erina Karati [视频] 04:02|来自 AI Engineer|BestBlogs 评分 90 Erina Karati 以 Supercell 的多智能体游戏村庄说明,角色会在传递传闻时丢失来源,甚至把不确定说成确定。她提出用可控场景、运行轨迹和多维评分评估整段行为,只保留通过护栏的小幅策略改动。芒果促销案例已有改善,但她没有宣称系统获得普遍提升;这套方法可供长时程智能体借鉴。 ★ 精讲三 | 「循环才是产品」:Roland Gavrilescu 谈智能体产品如何持续进化 [视频] 06:53|来自 AI Engineer|BestBlogs 评分 90 Roland Gavrilescu 主张把运行、验证与反馈的循环视为智能体产品核心:将失败模式沉淀为评测,将重复行为沉淀为技能和提示词,再用可版本化的方案复用。招聘案例说明如何由人校准判断标准,并用实际用户反馈检验改动。他还强调衡量有价值的工作与成本;这些是方法主张,尚非通用效果的证明。 重点 4–10 09:51 继续阅读七篇重点内容 Claude 计算出 N=4 超杨-米尔斯理论中的九圈振幅 09:51|来自 Anthropic Research|BestBlogs 评分 86 Claude Science 用既有 bootstrap 与 form-factor 方法计算出 N=4 超杨-米尔斯理论的九圈振幅,Lance Dixon 独立核验了结果。原文作者强调,Claude 在较少外部科学指导下完成复杂计算,但方法本身没有突破计算极限,宋何团队也同期取得相关结果。 一名操作员,多架无人机:深入 Skydio 自主飞行技术栈 — Suchet Bargoti,Skydio [视频] 09:51|来自 AI Engineer|BestBlogs 评分 87 Skydio 的 Suchet Bargoti 现场展示一名操作员同时操作三架无人机,并介绍支撑多机任务的自主技术栈:高可靠性目标、飞行数据反馈循环、地图式世界模型、遮挡下的目标跟踪,以及边缘与云端协作的视觉语言模型智能体。 Perplexity 自研 CobbleDB 取代 DynamoDB,查询延迟降低 5 倍并削减云存储成本 09:51|来自 InfoQ|BestBlogs 评分 85 Perplexity 以 Rust 编写的分布式键值存储 CobbleDB 取代核心搜索服务中的 DynamoDB;据其工程数据,批量读取延迟约降至原来的五分之一,整体存储费用至少降低 20%。 用反思击败强化学习:GEPA 与 Optimize Anything [视频] 09:51|来自 AI Engineer|BestBlogs 评分 89 Lakshya A. Agrawal 介绍了 GEPA 的反思式提示优化方法与 Optimize Anything,指出执行轨迹中的文本反馈能够改进提示词、智能体运行框架及其他可评分产物,而且所需样例远少于仅依赖奖励的优化方法。 自动化研究如何让模型提速 3 倍:Morph 的 GPU 优化实践|Tejas Bhakta [视频] 09:51|来自 AI Engineer|BestBlogs 评分 88 Tejas Bhakta 介绍了如何由人类选定优化方向、提供准确的硬件与模型背景,再借助兼顾正确性和性能的基准测试,让智能体搜索 GPU kernel 的实现方案;他也提醒,过于狭窄的目标会诱发指标投机,而成功的 kernel 与裸机优化叠加后,据称可带来 3 倍提速。 机器人演示容易,可靠落地很难——Dyna Robotics 如何训练商用级通用机器人策略 [视频] 09:51|来自 AI Engineer|BestBlogs 评分 86 Dyna Robotics 联合创始人 Jason Ma 介绍数据金字塔、推理模型与世界动作模型,以及通过奖励模型和人工参与的主动学习改进机器人策略。其微调后的 Dyna-1 在餐巾折叠的 24 小时试验中达到 99.4% 成功率;他还分别展示餐厅部署、经任务微调的萨克拉门托洗衣店毛巾折叠、CoRL 2025 陌生环境演示和红牛活动应用。 为 Agent 而生,千问 AI 平台发布全新服务方式 09:51|来自 阿里云开发者|BestBlogs 评分 85 千问 AI 平台在云栖大会发布面向 Agent 的全新服务方式,通过 Qwen 共创计划与 AI Arena 引入真实场景反馈优化模型,并推出 Skills、CLI 及支付宝合作的安全支付机制,旨在让云服务更易被 Agent 理解、调用与管理。 相关链接 · 本期早报在线阅读:https://www.bestblogs.dev/explore/brief/2026-09-27 · Parag Agrawal 谈智能体搜索、内容补偿与未来网络入口 [视频]:https://www.bestblogs.dev/video/0dfc12407 · 长时程智能体需要实验,而不只是提示词 — Erina Karati [视频]:https://www.bestblogs.dev/video/2d383b787 · 「循环才是产品」:Roland Gavrilescu 谈智能体产品如何持续进化 [视频]:https://www.bestblogs.dev/video/03c1f8bbb · Claude 计算出 N=4 超杨-米尔斯理论中的九圈振幅:https://www.bestblogs.dev/article/a1b55dbba3 · 一名操作员,多架无人机:深入 Skydio 自主飞行技术栈 — Suchet Bargoti,Skydio [视频]:https://www.bestblogs.dev/video/6cdb91bea · Perplexity 自研 CobbleDB 取代 DynamoDB,查询延迟降低 5 倍并削减云存储成本:https://www.bestblogs.dev/article/21fee6d8df · 用反思击败强化学习:GEPA 与 Optimize Anything [视频]:https://www.bestblogs.dev/video/1030e6641 · 自动化研究如何让模型提速 3 倍:Morph 的 GPU 优化实践|Tejas Bhakta [视频]:https://www.bestblogs.dev/video/793c4d541 · 机器人演示容易,可靠落地很难——Dyna Robotics 如何训练商用级通用机器人策略 [视频]:https://www.bestblogs.dev/video/9c2d85287 · 为 Agent 而生,千问 AI 平台发布全新服务方式:https://www.bestblogs.dev/article/686b0b3193 关于 BestBlogs BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 [关注我们]
EP187 · Claude Code 加速交付、OpenRouter 模型路由、Claire Vo 谈稀缺章节时间戳 * 00:00 开场 * 00:56 精讲:Stripe CEO 谈 Claude Code 一线实践与可靠性护栏 * 03:43 精讲:OpenRouter 联创复盘从种子轮到并入 Stripe * 06:06 精讲:Claire Vo 谈执行过剩年代的产品信念 * 08:33 重点 4–6:Project Swap、LangSmith Engine v2、Marty Cagan * 10:41 重点 7–10:Ramp 软件工厂、Meta 推荐系统、DoorDash 蒸馏、Sequence Holdings * 13:29 结语 ★ 精讲一 | Patrick Collison 谈 Stripe 用 Claude Code 加速交付并守住可靠性 [视频] 00:56|来自 Claude|BestBlogs 评分 91 Stripe CEO Patrick Collison 披露一组一线数据:一位工程师上半年合并 600 多个 AI 编写的 PR,仅 1 个被回滚;Stripe Projects 由两三位工程师两个月上线,他估算至少带来六倍提速。核心 API 在 5.5 个 9 的可靠性下坚持持续部署,靠的是不变量与硬屏障式护栏,围绕数据的标签与语义防护自 2017 年起建设,担心 AI 编码拖累质量的团队可作参考。 ★ 精讲二 | OpenRouter 联创谈从种子轮到并入 Stripe:模型路由的下一站 03:43|来自 Latent.Space|BestBlogs 评分 91 曾被投资人贬为 API 套壳的 OpenRouter,如今服务超 1000 万开发者,日 token 处理量超 10 万亿。联合创始人 Alex Atallah 与早期投资人 Anjney Midha 复盘从 Alpaca、Mistral 价格战到并入 Stripe 的历程,一个关键考量是 token 欺诈:上月拦截的欺诈金额是前月的 10 倍,下一波攻击将不只来自人类,还有自主 agent,Stripe 的反欺诈基建因此被双方看重;并入后品牌与产品路线保持不变。 ★ 精讲三 | 最后一份路线图:当 AI 让执行过剩、信念成为稀缺品 | Claire Vo [视频] 06:06|来自 Lenny's Podcast|BestBlogs 评分 91 Claire Vo 的 AI 工厂把 ChatPRD 重构了 70 次、PR 量增至 3 倍,她却坦言已想不出值得做的好点子:执行过剩、信念稀缺。去年宣称产品管理已死的她,这回认为为工程稀缺年代设计的路线图会把团队推入 backlog、parity、churn 三个陷阱,主张先写下持久信念与验证证据、再决定 token 投向,并按 probe、experiment、promise 区分对客户的承诺强度。 重点 4–10 08:33 继续阅读七篇重点内容 Project Swap:当智能体替我们交易时会发生什么? 08:33|来自 Anthropic Research|BestBlogs 评分 90 Anthropic 的 Project Swap 实验揭示,AI 智能体在市场谈判中的主要瓶颈是准确理解用户偏好,而非讨价还价能力,且模型能力对结果有显著影响。 LangSmith 新功能:Engine v2、深度智能体托管与微调上线 08:33|来自 LangChain Blog|BestBlogs 评分 90 LangChain 发布了 LangSmith Engine v2,用于自动化智能体调试和红队测试,同时 Managed Deep Agents 增加了基于身份的记忆功能,并推出新的 Fine-Tuning 工作流,可将智能体轨迹转换为训练数据。 Marty Cagan:坚定观点,松散持有——Inspired 十年十大遗憾与 AI 时代产品模型 [视频] 08:33|来自 Lenny's Podcast|BestBlogs 评分 91 Marty Cagan 重审 2008 年来的 Inspired,坦陈十大遗憾:从埋没商业可行性、过度强调问题发现,到低估可预测性、政治与产品领导力;并指出在 AI 时代,产品模型的发现能力与结果导向比以往任何时候都更重要。 关键制约因素:如何为速度设计 AI 软件工厂 | Geoff Charles(Ramp CPO) [视频] 08:33|来自 Lenny's Podcast|BestBlogs 评分 91 Ramp CPO Geoff Charles 将产品工作映射为一套 F1 式 AI 软件工厂:AI 不会消除瓶颈,只会让瓶颈转移,因此赢家团队必须在识别、定义、构建、协同与改进各环节持续发现、清除并围绕下一道约束重新设计。 为什么 LLM 推荐系统将成为 AI 最大的消费级应用 — Devansh Tandon,Meta [视频] 08:33|来自 AI Engineer|BestBlogs 评分 90 Meta 推荐研究负责人 Devansh Tandon 论证推荐系统遵循与 LLM 相同的幂律扩展,梳理四条范式 S 曲线与双语 LLM 推荐器的语义 ID 配方,并主张因其解码内容指针在结构上远比聊天 token 生成便宜,将成为 AI 最大的消费级应用。 蒸馏 LLM,不要直接 Serving:DoorDash 搜索与个性化实践 [视频] 08:33|来自 AI Engineer|BestBlogs 评分 90 DoorDash Staff ML 工程师 Raghav Saboo 指出,市场平台发现的本质是语义理解问题,并展示如何将 LLM 推理离线蒸馏为分级监督、Semantic ID、消费者记忆与可驾驭内容生成四类共享原语,让传统检索与排序系统在十亿级条目规模下低成本 Serving。 AI 时代收购并重塑在位企业:对话 Sequence Holdings 联合创始人兼 CEO Michael Lee [视频] 08:33|来自 No Priors|BestBlogs 评分 90 在宣布与 Dell 家族办公室以 77 亿美元完成迄今最大规模 AI 私有化交易 Baldwin 数日后,Sequence Holdings 联合创始人兼 CEO Michael Lee 阐述了为何拥有品牌、规模与监管优势的在位企业才是 AI 变革的正确载体,为何永久控股公司优于基金结构,以及 Atlas 平台如何将 BankSouth 的消费贷款平均审批时间缩短 94%。 相关链接 · 本期早报在线阅读:https://www.bestblogs.dev/explore/brief/2026-09-26 · Patrick Collison 谈 Stripe 用 Claude Code 加速交付并守住可靠性 [视频]:https://www.bestblogs.dev/video/e559dafa1 · OpenRouter 联创谈从种子轮到并入 Stripe:模型路由的下一站:https://www.bestblogs.dev/article/28975bae32 · 最后一份路线图:当 AI 让执行过剩、信念成为稀缺品 | Claire Vo [视频]:https://www.bestblogs.dev/video/5e7d8805e · Project Swap:当智能体替我们交易时会发生什么?:https://www.bestblogs.dev/article/3e9d9c77b2 · LangSmith 新功能:Engine v2、深度智能体托管与微调上线:https://www.bestblogs.dev/article/12f7372b41 · Marty Cagan:坚定观点,松散持有——Inspired 十年十大遗憾与 AI 时代产品模型 [视频]:https://www.bestblogs.dev/video/b355d7c48 · 关键制约因素:如何为速度设计 AI 软件工厂 | Geoff Charles(Ramp CPO) [视频]:https://www.bestblogs.dev/video/a80f1647a · 为什么 LLM 推荐系统将成为 AI 最大的消费级应用 — Devansh Tandon,Meta [视频]:https://www.bestblogs.dev/video/e1c7b5e1e · 蒸馏 LLM,不要直接 Serving:DoorDash 搜索与个性化实践 [视频]:https://www.bestblogs.dev/video/2ed767935 · AI 时代收购并重塑在位企业:对话 Sequence Holdings 联合创始人兼 CEO Michael Lee [视频]:https://www.bestblogs.dev/video/2196f099b 关于 BestBlogs BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 [关注我们]