Agili 的 Hacker Podcast 2026-08-05

Agili 的 Hacker Podcast 2026-08-05

NaN分钟 ·
播放数6
·
评论数0

今天的话题从编程代理的极简哲学延伸到科学发现的直觉边界,中间穿过 MCP 协议的无状态跃迁、软件工程迷思的解构,以及 Cloudflare 把个人应用平台开源的新尝试。以下是 Agili 的 Hacker Podcast 为你整理的今日博客。

Pi 的极简主义是它的优势

默认只有 4 个工具和不到 1,000 token 的系统提示

大多数编程代理框架在变得越来越臃肿,Pi 却走了相反的路。它默认只带 4 个工具,系统提示词和工具定义加起来不到 1,000 token。Pi 不把大量默认指令包在模型外面,避免这些指令在模型的指令层级里被忽略;它的核心思路是:大部分工作用基础工具就能完成,想要更多,自己构建。

Databricks 基准测试揭示的“上下文纪律”

Databricks 用自家工程师的日常任务做了一套基准测试,结论是“模型被放在哪个 harness 里调用,对成本和质量的影响很大”,而且“在很多任务上,像 Pi 这样简单的 harness 表现最好”。同一模型搭配不同 harness,单任务成本能差两倍以上,质量却相同。Pi 每轮发送的上下文大约只有其他 harness 的三分之一,Pi 团队把这称为“上下文纪律”。更强的模型配上高效的 harness,可能比便宜模型搭配低效 harness 更省钱。

Shopify 的 Autoresearch 扩展

Shopify 工程师 David Cortés 直接用 Pi 创建了一个 Autoresearch 扩展。它是一个自主优化循环:你提出变更请求,它跑实验找出什么有效、什么导致回归,只要目标可度量,就持续自我改进。Shopify 报告说单元测试快 300 倍,React 组件挂载快 20%,多个项目的构建时间缩短,pnpm 性能也有改善。Pi 没有内置这些能力,它只是让用户自己构建变得很简单。

社区争论:安全、性能与工具的边界

Hacker News 上的反馈很分裂。有人把 Pi 比作编辑器里的 Neovim——需要自己配置,换来可塑性。也有人批评它不遵循 XDG 目录规范、Emacs 按键不工作、启动慢。安全方面,Pi 没有成熟的“自动批准加沙箱”方案,有用户第一次使用就看到它跑出启动目录改了隔壁 git 仓库的文件。还有评论认为,即使自称极简,bash 工具也没法禁用,不算真正的极简。比较务实的使用心得是:先用 vanilla Pi,等遇到真实痛点再让 Pi 自己写扩展,同时做好回滚准备。

无状态 MCP 重新点燃了我的兴趣

MCP 2.0 的一次请求设计

2026 年 7 月发布的 MCP 2.0 把客户端和服务端的实现难度大幅降低。旧版 MCP 需要两次 HTTP 请求来初始化会话并拿到会话 ID,新版把协议版本、方法名和名称直接放进 HTTP 头,请求体仍为 JSON-RPC,一次请求就能完成工具调用。对需要水平扩展的 Web 应用,这意味着不用再维护服务器端会话状态。

Simon Willison 三件套

新规范发布当周,Simon Willison 就动手做了三个工具。mcp-explorer 是一个无状态的 Python CLI,能列出 MCP 服务器的工具、检查输入输出 schema 并带参数调用。datasette-mcp 给 Datasette 添加一个 MCP 端点,接进 ChatGPT 或 Claude 后就能直接对数据实例运行 SQL 查询。llm-mcp-client 是 LLM 工具的官方插件 alpha 版,一条命令就能把 MCP 端点变成 LLM 的数据源。

为什么选 MCP 而不给模型终端

Willison 解释了他态度转变的安全理由:给 agent 一个能联网的 shell 环境风险太高,而且需要很强的模型才能安全驾驭。MCP 工具的能力边界更清楚,出问题时更容易审计和控制,简单到笔记本上的小模型也能稳定驱动。他计划在基于 LLM 的敏感应用上更依赖 MCP。

新墨西哥州医疗飞机坠毁与军方 GPS 干扰有关

事故时间线

今年 5 月,一架双引擎比奇空中国王医疗救援飞机从新墨西哥州罗斯韦尔起飞,向西飞往鲁伊多索接病人,机上四人全部遇难。NTSB 初步报告显示,飞机在该区域军方 GPS 干扰演习期间偏离高度,飞行员报告 GPS 失效并请求航向引导。军方曾一度暂停干扰配合,飞行员报告看到机场、转入目视进近后干扰才恢复。飞机最终撞进卡皮坦山脉。

争论:飞行员责任还是多重失效

多位有飞行背景的读者认为,GPS 干扰的航行通告在当时是常见操作,飞行员应提前调好 VOR 等备用导航设备。批评点集中于:机组申请并获准的是目视进近,有责任自己保持与地形间隔;当晚山区无月光,但山峰清楚标注在航图上。另一部分观点反对简化责任,指出当时当地自动天气观测系统也故障,两条仪表进近程序都因无法获得本地气压设定而不能使用,可用手段被一件件剥掉,是典型的“瑞士奶酪”多重失效。

对自动化依赖的讨论

讨论延伸到了飞行员基本飞行素养的退化。有评论推荐讲座《Children of the Magenta Line》,警示过度信任自动驾驶和屏幕会让飞行员在异常出现时失去情景意识。一位在乌克兰附近经历过 GPS 欺骗的滑翔伞飞行员说,坐在办公室里讲“没有 GPS 也不难”很容易,真实飞行中一边操纵飞机一边判断发生了什么完全是另一回事。

生成式 AI 的八个软件工程神话

写代码只占工作时间的 14%

Microsoft 2025 年对 450 多名工程师的研究显示,写代码只占工作时间的 14%。即使 AI 让编码速度翻倍,理论上的整体生产力提升也不到 15%。有微软开发者说,被 GitHub Copilot 触及的工作环节“相对较小”。这个结论在 Hacker News 上引发激烈反驳:有人认为编码前置的会议和同步会随代码变便宜而减少,不能假装自动化掉写代码只值 15% 的提升;Simon Willison 则说自己现在花在写代码或驱动 agent 写代码上的时间反而更多了,因为 agent 可以并行做调研和规划。

代码行数和平均主义神话

微软 CEO 曾公开说公司约 30% 的代码由 AI 编写。文章指出这类指标会诱导团队追求代码量、牺牲设计质量。关于“AI 对所有任务所有工程师助益均等”的神话,文章引述的研究显示,语义等价但措辞不同的提示词,在 46% 的用例中产生了不同代码,28% 的用例改变了正确性。不过有评论者尖锐指出,文章引用的一些“近期”研究已被原研究者撤回或修正,而 2025 年底以来变化太快,当时的证据已不适用。

10x 开发者和组织采纳

文章认为个体在孤立任务上的加速无法直接转化为团队环境中的产出,而且让 AI 发挥作用不应该只是每个开发者自己的事。据称 80% 的开发者使用 AI 工具,但只有 29% 信任其准确性,许多人花在调试 AI 输出上的时间比直接写代码还多。有评论提到,仍有资深开发者拒绝使用 AI 或偷偷用但不分享,拖慢了团队学习曲线。也有读者用自己的经验支持相反结论:AI 能帮他起草 API 重构设计文档、发现未考虑的本地头文件接口、生成测试计划,直接加快了那 86% 的非编码工作。

DuckDB:笔记本电脑上的数据利器,现在有了 Clojure 版

50GB CSV 加载与秒级查询

一个 50GB 的 CSV 文件,4 亿行交易数据,加载进 DuckDB 只需要 1 分 50 秒,压缩到 18GB 并自动建好索引。从 Clojure 里做 SELECT COUNT(*) 大约 10 毫秒。两台普通电脑就能处理此前需要分布式系统才能应对的数据。

14 亿行连接与分组查询

文中展示了 4 亿条交易记录与颜色映射表的内连接,结果 14.17 亿行,在笔记本电脑上耗时 2.5 秒。然后按颜色分组统计某月的销量,1 秒出结果。如果后续不想用 SQL,TMD 支持把查询结果按批次拉回 Clojure 做归约处理,零拷贝路径还能进一步降低内存开销。这套方案让小型团队不需要依赖昂贵的分布式系统。

WebKit 的 IP 和 DNS 泄漏影响代理浏览器和 iCloud Private Relay

三个绕过代理的功能

研究者发现 WebKit 的 DNS prefetching、WebAuthn Related Origin Requests 和 WebTransport 会绕过应用层代理配置,直接向目标服务器发送请求,暴露用户的真实 IP 或真实 DNS 服务器。DNS prefetching 从 iOS 26.0 开始支持,攻击者可以通过嵌入独有主机名的页面在权威 DNS 服务器上看到访客来源。WebAuthn 的跨域验证文件请求从 iOS 18.0 起就存在,不需要用户交互即可触发。WebTransport 在 iOS 26.4 正式开放,服务器直接看到设备真实 IP。

对 iCloud Private Relay 的影响与修复

iCloud Private Relay 同样无法拦截这些泄漏请求。Psylo 1.3.1 已修复三个泄漏:阻止 dns-prefetch 提示,默认关闭 WebTransport 和 WebAuthn,用户可在每个数据隔离区单独开启。研究者提供了 leaks.psylo.app 供用户自查,并已联系 Tor Project 和 Onion Browser 团队。

Discovery Loop:Google 核心团队出走,想自动化科学实验循环

四位创始人与他们的履历

Jeff Dean、Sanjay Ghemawat、Quoc Le 和 Oriol Vinyals 共同创立了 Discovery Loop。他们参与过的项目包括多代 Google Search、MapReduce、BigTable、TensorFlow、TPU、AlphaFold 和 Gemini。公司官网写道:科学方法本身强大,但“提出实验、运行、查看结果、迭代”的循环靠人工执行,规模上不去。他们打算用前沿 AI 和大规模计算把这些循环自动化,先从机器学习研究做起。

“自动发现”能走多远

社区对“科学被瓶颈卡住”这个判断有不同理解。有人认为这只有在很窄的科学定义下才成立,真正困难的不是计算,而是物理世界的反馈循环。化学、生物化学和材料科学领域仍有很多博士生做的重复实验,数量级的提速确有价值。但仪器、传感器、受限数据和机构合作都比单纯优化实验循环复杂得多,目前招聘页面看起来只是一个纯 ML 实验室。有评论预测公司三年后会被 Google 收回,也有人认为 Google 品牌已留不住顶尖人才,这批人出走合理。

Cloudflare OS:面向代理、应用与工作的开源平台

Sandstorm 的十年后重做

Cloudflare OS 本质上是 Kenton Varda 十年前创办的 Sandstorm 项目的重做版,这次跑在 Cloudflare Workers 上并深度结合了 AI。它让组织内每个人都能拥有代理和专属工作空间,沙箱安全到 AI 写出的代码不会引入严重安全漏洞。平台已在 GitHub 以 Apache 2.0 协议完全开源。

安全模型:零权限、Gatekeeper 与观察跟随

代理和应用默认零权限,凭据始终与代理隔离。网关层 Gatekeeper 对外部服务的 API 有专门理解,可以只给代理单个仓库的访问权、屏蔽字段、限流,并在合并 PR 前要求人工审批。关键设计是“策略跟随观察”:平台记录代理看过哪些资源,分享工作空间或产出时,Gatekeeper 会验证对方对这些资源的直接访问权限。如果代理读过敏感表并生成实时仪表盘,分享仪表盘不等于分享那张表。

应用即文件

每个代理写的应用都是完整全栈程序,有独立 SQLite 数据库,不需要常驻服务器或容器。用户可以分享应用本身供实时协作,也可以分享 blueprint,让其他人基于代码创建不含原始数据和凭据的独立副本。这意味着团队里的人可以用 AI 自己改应用,不用提交工单等别人来做。社区里有人把这称为“AI 原生的 SharePoint”,但也有人担心会重演维护噩梦。

Bugtraq 回来了

全披露列表的历史

Bugtraq 于 1993 年由 Scott Chasin 创建,是一个供安全研究人员公开披露漏洞的邮件列表。它不需要通过把关人,不受行业政治影响,十多年里一直是漏洞研究的心脏。后来随着域名易手列表沉寂,档案下线,一代研究人员没赶上它的时代。

买下域名重新开启对话

Jonathan Brossard 买下了 securityfocus.com 和 Bugtraq 这个名字,重新开启列表。使命不变:全披露、研究者优先、没有企业过滤。旧档案来自社区保存的公开邮件,会单独整理并开放查阅。Brossard 说,在 AI 大量制造知识和虚假信息的时代,保存真实发生过的事和真正有效的技术变得更重要。

重启后的现实

老派安全研究者反应并不完全乐观。有人指出 Bugtraq 在关闭前至少十年就已不再处于核心位置,漏洞研究已从小众领域变成成熟行业,披露规范也完全变了,重启后的位置还不清楚。也有人调侃说下一步该把最初的 Packet Storm 也带回来。

立场论文:LLM 无法跳跃

归纳、演绎与溯因

DeepMind 研究员 Tom Zahavy 在 ICML 2026 立场论文中借用爱因斯坦的故事,提出生成式 AI 掌握了归纳和演绎,但缺少溯因——即提出全新解释性假设的能力。他认为,LLM 可以执行从既有前提证明定理的演绎阶段,但结构上无法完成构建前提所需的那次跳跃。论文提议用物理一致的多模态世界模型来为人工科学发明提供感官基础。

历史与直觉的争议

评论者指出,爱因斯坦 1905 年的论文并非凭空跳跃,洛伦兹变换和相对性原理都有前人工作,爱因斯坦的贡献是给了已有数学结构一个干净的物理诠释。关于物理直觉,有人认同语言是有损编码,读遍所有关于大峡谷的书不等于站在峡谷边缘感受温度和风;但也有人认为普朗克的能量量子化没有身体模拟参与,物理直觉有时反而是障碍。

方法论与定位

作者澄清说这是个人立场,不是公司观点,自己可能错误。论文被批评不可证伪,没有定义“跳跃”,也没有对比实验。有评论提出可检验的方案:让知识截止于 2025 年的 LLM 重新推导 2026 年发表的“跳跃型”成果。很多评论认为“LLM 不能 X”的断言历史上多次被推翻,这篇论文的价值不在裁决,而在于把“从经验到公理的跳跃需要什么”这个问题摆上桌面。


相关链接: