Agili 的 Hacker Podcast 2026-09-23

Agili 的 Hacker Podcast 2026-09-23

NaN分钟 ·
播放数2
·
评论数0

欢迎阅读 Agili 的 Hacker Podcast 每日精选。今天我们将探讨智能推理成本断崖式下跌引发的工程重构、AI 在生物科学发现与军用决策中的两极现实,以及纯数据内存攻击给系统防御带来的新考验。

Tokens 便宜到无需计量

成本暴跌的技术推力

使用机器学习模型的单次推理成本正在以惊人的速度下滑。硬件能效的持续迭代构成了底层支撑,开源推理引擎(如 vLLM)在 15 个月内将单 Token(模型处理文本的基本词元单位)能耗削减了约 40%,配合底层系统栈的深度调优,让数据中心在不更换芯片的情况下实现了数倍的吞吐提升。在架构层面,混合专家架构(MoE,仅在需要时激活特定子网络的稀疏结构)显著压缩了激活参数量,配合低比特量化(降低数值精度的压缩手段),使得高能力模型可以在消费级硬件上直接运行。根据研究机构 Epoch AI 的统计,前沿模型达到相同能力等级的推理成本在初期平均每季度下降 66%。

软件开发逻辑的迁移

单次模型调用的开销正在逼近美分的分数级别,调用轻量模型的资源消耗甚至已经低于耗时数十秒的本地代码编译。开发者开始尝试把小型决策模型直接嵌入命令行,构建类似 jgrep 的文本过滤管道。当编写通用代码的门槛被彻底抹平,现成软件库本身的壁垒正在消退。技术工程的关注焦点正在从“如何写出代码”加速转向系统运维、访问权限控制、需求精确定义以及界面交互,专有行业数据和业务壁垒的价值被进一步放大。

边际极限与商业回报的疑虑

这种成本下探存在物理与工程极限。有工程师在讨论中指出,用 C 语言等底层语言编写的确定性工具代表了物理执行效率的下限,依靠概率统计运行的大模型更可能无限逼近这一极限,而无法在能效上超越纯算法逻辑。为了弥补统计模型的偶发幻觉,团队往往需要投入巨大的工程时间进行提示词调谐和边界测试,这些隐形成本常常超出预期。此外,万亿美元规模的数据中心资本开支要求行业催生海量真实现金流,如果硬件与算法的能耗压缩速度快于终端需求的增长节奏,超前建设的基础设施可能面临闲置风险。

25 行 Python 代码解构轻量决策模型 Jev

极简脚本与本质还原

开源开发者 Duarte O.Carmo 用 25 行 Python 代码,利用 llama-cpp-python 加载 0.6B 参数的量化小模型,在输入末尾手动闭合推理标签,直接提取对应多选选项(如 A、B、C)首个 Token 的 logits(未归一化的原始输出得分),并转换为概率。该实现表明,主打高速决策的专用模型本质上是将多选题转化为单一 Token 的分类预测,不需要生成完整的自然语言长句,完全可以在普通设备本地离线执行。

对数概率与置信度的工程陷阱

这一演示在社区引发了对“概率输出是否等同于决策系统”的争论。多位工程师指出,原始语言模型的 logprobs(对数概率)绝非真实世界的决策置信度,深度网络普遍存在过度自信问题,未经充分校准的模型极易给错误选项赋予接近 100% 的虚假概率。针对 Jev 提供的置信度指标,有开发者发现其本质是利用线性公式将最高概率进行重整,并没有提供额外的独立可靠性指标。此外,自回归模型对排列在最前面的选项存在先验偏好,且容易受到后续自然语言句式潜在走向的干扰。

专用分类路径的实际价值

开发团队对于这类模型的评价保持分化。赞成者认为,让通用大模型生成长文本只是为了取回一个分类标签在计算上极其浪费,轻量决策模型省去了冗余的文本生成显存和网络调用开销,有效避免了 JSON 格式解析失败的工程风险。质疑者则提出,一旦完全放弃思维链(Chain of Thought)推理预算,小模型在面对复杂歧义时的准确率将大幅下跌;在 CPU 上运行简单的文本嵌入向量结合岭回归与共形预测算法,往往能在更低延迟下取得更可靠的校准结果。

Claude 发现具有类 CRISPR 重复序列的新型酶系统

代理集群的主动挖掘

Anthropic 成立了生命科学研究团队并配置了自有湿实验室,首次展示了由 Claude 主导的早期基础生物学发现。研究人员部署了约 950 个模型代理实例,消耗 2.1 亿 Token,对超过 20 万个巨型噬菌体逆转录酶(RT,能将 RNA 反向复制为 DNA 的酶)进行了为期 21 小时的筛选。其中一个代理实例在未标注的原始序列中,自主识别出一段紧邻 RT 基因的规则串联重复序列,并完成了文献排查与特征报告。该系统被命名为阵列相关逆转录酶(ART)。

实验室验证与科学评价

随后的湿实验验证了这一计算推论:该复合系统由一个 RT 基因、一个未知功能的伴侣蛋白以及类似 CRISPR 的间隔重复序列构成,该重复序列能够在实验中正常转录出一组短 RNA。CRISPR 先驱张锋教授评价认为,识别与逆转录酶关联的 RNA 重复阵列具有启发性,体现了 AI 工具在生命科学假说生成层面的实用价值。但在具体功能上,该酶系统是否具备像 CRISPR 那样的序列特异性切割能力,仍需等待长周期的生物学机制验证。

商业模式的纵向演进

讨论普遍关注到头部模型厂商策略的转变。随着底层基础模型和 Token 销售走向同质化与价格内卷,AI 企业自建实验室、深入垂直领域寻求知识产权壁垒成为新的方向。从利用算力跨文献分析生成非结构化假说,到利用内部湿实验室完成实体闭环,大型实验室正在向掌握核心生物资产的技术研发实体转型。

纯数据攻击比想象中更容易实现

避开控制流防御的盲区

微软等机构的统计表明,约 70% 的高危漏洞源自内存安全问题。长久以来,工业界主要依赖数据执行保护(DEP)和控制流完整性(CFI)等手段,阻止攻击者劫持函数指针或篡改指令跳转。阿姆斯特丹自由大学 VUSec 实验室在 USENIX Security 2024 上展示了自动化纯数据攻击工具 Einstein。该研究证明,即便完全不破坏程序的既定控制流,只要关键内存数据被替换,程序就会在完全合规的函数和系统调用序列中执行攻击者的恶意意图。

传统攻击(控制流劫持):[正常输入] -> [内存溢出覆写指针] -> [强行跳转恶意代码/ROP链] -> (被 CFI/DEP 拦截)纯数据攻击(Data-Only):[正常输入] -> [内存溢出篡改关键路径数据] -> [程序调用合法的 execve()] -> [以合法指令执行恶意目标]

聚焦系统调用的自动化挖掘

Einstein 摒弃了针对特定协议的复杂业务逻辑分析,把注意力集中在通用的操作系统底层系统调用(Syscalls)。工具通过二进制插桩运行程序,采用动态污点分析追踪由不可信输入控制的内存数据。一旦发现这些数据能够无须加工直接流入敏感系统调用(如负责执行外部程序的 execve 或写盘的 write),系统就会自动构造内存覆写方案,并重启目标服务发送看似正常的网络请求进行复核。在对 nginx 的测试中,该工具自动发掘出包含任意命令执行和任意文件写入在内的 944 个可用攻击原语。

全面内存安全的防御困局

纯数据攻击将防御体系推入了工程两难。传统的控制流拦截技术开销极低且通用性好,但它们默认信任程序内部正在处理的数据内容。要完全抵御纯数据利用,要么依靠全面的数据流完整性(DFI)追踪,要么将系统彻底使用内存安全语言重写,这两种方案在既有大型 C/C++ 软件基础设施上的重构成熟度和性能成本都极其高昂,使得低开销的系统级纯数据防护依然是一项未决的技术挑战。

五角大楼将伊朗学校误炸事件归咎于过度依赖 AI

流程失控导致的目标误判

2026 年 2 月底,美军巡航导弹击中伊朗米纳卜的沙贾拉·塔耶巴小学,导致包含 123 名儿童在内的超过 150 名平民遇难。彭博社援引五角大楼内部调查透露,在美伊冲突爆发首日,决策层下达了 24 小时内轰炸超过 1000 个目标的高额指标,原需数小时的目标核查被压缩至数分钟。在此之前,军方的平民伤害缓解编制被缩减约 90%,致使该次空袭完全脱离了平民风险审核。

涉事校址早在十年前就已从伊斯兰革命卫队海军用地改建为独立学校,拥有明确的围墙隔断、卫星可辨识的运动场地与公开网站。情报分析人员曾于 2019 年记录过该变更,但该记录保存在未互通的孤立系统内。任务人员最终调取了国防情报局至少七年未更新的旧数据,导入 Palantir 开发的 Maven 军用智能系统生成了打击清单。

算法对决策责任的稀释

调查指出,操作人员误以为平台具有自动校验底层数据真实性与时效性的能力,但系统合同仅限定软件负责整合数据源,数据正确性仍由军方承担。技术社区分析指出,将事故单方面定性为“过度依赖 AI”掩盖了系统性的管理失职。当上级指令要求在极短时间内凑齐上千个打击清单、并强制跳过地面与空中多方独立交叉验证规程时,无论使用自动化工具还是传统数据库,都会产生同样的悲剧。高度集成的算法界面输出的高确信度结论,容易诱导操作者放弃审慎复核,并在事故发生后成为推卸指挥责任的技术屏障。

Claude Code 仅在开启遥测时加载 AGENTS.md 的问题已修复

远程开关与本地文件的绑定失误

Anthropic 在 Claude Code 命令行工具 2.1.277 版本中加入了对通用代理描述文件 AGENTS.md 的支持。但大量用户发现,一旦通过环境变量关闭了遥测(Telemetry,用于软件回传使用指标的机制)或拦截非必要网络流量,本地的 AGENTS.md 就会在没有任何告警的情况下被静默忽略。逆向分析显示,团队将该加载逻辑设计为一个依赖远程 Feature Flag(功能开关)控制的内置模块,当遥测管道被阻断或处于内网代理环境时,该开关拉取失败,导致客户端放弃读取本地磁盘文件。

过度工程化与修复响应

Anthropic 工程师随后在社区致歉并推送了 2.1.281 修复版本。官方解释称该功能是基于新开发的 Mods(模组系统)机制接入的,远程开关原本是为了提供未知故障时的远程熔断能力,但在编码时误将其网络通道与遥测逻辑混杂在一起。这起事故在开发者中引发了对过度设计的讨论:读取本地备用配置这一原本仅需几十行条件判断的逻辑,被包装成复杂的动态插件,并违背了“本地优先”的命令行工具设计原则。

ReBarUEFI:为老旧主板解锁 Resizable BAR 支持

突破 256MB 传输瓶颈

PCIe 设备的基地址寄存器(BAR)规定了 CPU 与外设内存之间的数据交互通道。受早期 32 位系统兼容性限制,该映射窗口通常被硬件固件死死锁定在 256MB。当图形处理器运行当代重载纹理时,CPU 必须频繁切片调度显存。Resizable BAR 技术允许 CPU 直接寻址完整显存空间,虽然硬件层面上自英特尔 Sandy Bridge 架构起就具备支持能力,但多数老旧主板的 BIOS 固件并未开放配置接口。开源项目 ReBarUEFI 通过向 UEFI 固件的驱动执行环境(DXE)动态注入补丁驱动,在总线枚举阶段替换资源分配函数,让缺少官方支持的老平台也能按需映射大容量显存。

部署风险与实际收益权衡

在旧平台上启用该技术需要手动修补固件,开启 4G 以上解码并配合专用补丁绕过固件自带的寻址上限。由于修改涉及底层 NVRAM 参数和 BIOS 刷写,若显存分配参数设置不当可能导致硬件无法点亮,需要物理清空 CMOS 恢复。同时,更大尺寸的映射并不绝对等同于更流畅的帧率。在显卡显存完全耗尽并与系统主内存发生频繁页面置换(Thrashing)的高负载场景下,开启全量映射在缺少驱动级细粒度调度的老显卡上,有时反而会加剧瞬时卡顿。

Waymo 推出公共交通联运奖励计划

依靠银行卡网络的短途接驳

Waymo 在旧金山湾区推出了 Transit Rewards 计划。乘客使用同一张绑定的 Visa 信用卡在两小时内先后刷卡乘坐 Waymo 和参与计划的 27 家本地公共交通线路,即可自动获得 2.85 美元的平台返现,金额等同于旧金山单程公交票价。加州通勤铁路(Caltrain)同时向 Waymo 出租了 40 个车站专用车位供车辆驻留。利用 Visa 的现有清算网络,Waymo 得以绕过湾区复杂的 20 余个独立公共交通票务系统,规避了深度系统对接的技术阻力。

最后一公里生态与公共投入争议

部分交通规划分析指出,该项目本质上是用折扣换取用户黏性的商业获客手段,返还额度只能在站内抵扣下一次打车。依赖私营打车系统填补火车站与住宅区之间的“最后一公里”,虽然能在短途调度上提供灵活性,但也有可能分流公众对扩建基础常规公交路线的关注度与财政预算支持。

跳过事故细节的技术管理权衡

在一次团队故障复盘中,高级管理者直接打断了工程师对技术细节的详细铺陈,明确指出自己不需要技术细节:“如果深入细节,当事人在当时场景下的每一个操作看起来都合理;我只想知道工作系统层面必须做出什么改变。”

大多数复盘容易将精力消耗在复盘时间线和当事人心态上。当结论走向“所有人都在尽责做事”时,推动系统实质改良的动力往往就此丧失,最终产出诸如“提高警惕”“增强沟通”等口头约定。这套做法支持将重点直接放在系统性防御上:既然默认所有工程师都是理性且称职的,那么诱发故障的职责边界模糊、无序的突发变更流程或密集的误报告警才是需要被消除的系统病灶。

但基层工程师同样指出了这一管理风格的潜在代价。完全剥离细节可能掩盖过紧的工期排期、资源枯竭等深层次管理缺陷。若将“杜绝一切事故”作为机械性指标,可能导致组织不断叠加繁琐的审批流程,反而大幅拖累研发交付效率。

意大利议会投票通过重启核电法案

意大利参议院以 81 票赞成、51 票反对的表决结果通过法案,正式启动了建立核电监管与许可框架的立法程序。该国曾在 1986 年切尔诺贝利事故和 2011 年福岛事故后的全民公投中两次叫停核电业务。

本次法案的切入点集中在小型模块化反应堆(SMR)等新一代技术上。支持者认为模块化工厂预制有助于规避传统大型核电机组工期拖延与预算失控的问题,能为可再生能源提供坚实的基础负载。然而反对观点集中于经济性与现实物理条件:一套 300 兆瓦的 SMR 成本依然居高不下且缺乏欧洲商业化先例;而随着光伏成本大幅走低,白天廉价的太阳能严重压低了电力现货价格,这给需要 24 小时满负荷运转才能平衡收支的核电站带来了巨大的财务挑战。此外,欧洲内陆河流夏季的水温升高与水量锐减,也对未来的冷却系统选址提出了新的考验。


相关链接: