

260806|人类漏判AI指令,动物园反数据中心今日 Hacker News 精选内容跨越科学入门、游戏最优配置、复古游戏开发、政策争议、性能优化、AI 代理设计等多个方向 以下将逐一介绍每篇文章的要点及社区讨论亮点。 Crime Pays but Botany Doesn't 学习植物学的起点 文章指出,植物学入门的最大障碍是拉丁命名和分类术语的陌生感。作者建议直接使用互联网查阅不熟悉的词条,而不是被名称吓退。 关键概念:拉丁术语与分类学 拉丁学名提供全球统一标识,避免常见名称为一词多指的问题。掌握属名大写、种名小写及斜体写法是基础。分类学基于进化关系进行分组,学会共享衍征(synapomorphies)后可对未见植物进行快速归类。 推荐教材与实践 * 《Plant Systematics》作为形态与进化的参考书,《Raven's Biology of Plants》则涵盖基础植物生物学与进化机制。 * 若预算有限,可通过 Library Genesis 或 Sci‑Hub 获取 PDF,配合安卓平板进行离线阅读。 * 制作标本时建议用酸 free 纸张记录采集点、GPS、海拔及 iNaturalist 观察号,便于后续核对与分享。 评论中有读者分享了自己利用 iNaturalist 进行野外记录的经验,强调实际操作比纯理论更能巩固记忆。 Mario Meets Pareto Pareto 前沿在游戏中的直观说明 作者以《马里奥 kart 8》的角色、车身、轮胎和滑翔器四个维度为例,解释在速度与加速度两个目标下,未被其他选项同时优于的集合即为 Pareto 前沿。 从二维到多维的扩展 引入第三个统计量——漂移加速(mini turbo)后,前沿点数从 14 增至更多,但选择难度随维度指数增长。文章指出,只要为每个维度赋权,仍可在前沿上定位个人最优解。 实际类比与限制 文中将游戏选择类比为餐饮、职业、投资等多目标决策场景,强调当权重未知时,Pareto 前沿能先剔除明显劣解,后续再通过试错确定个人偏好。评论区有人提到,该方法在云资源调度中的实际应用同样受益。 How to Make a Nintendo 64 Game in 2026 引擎与硬件准备 作者将个人 2D 游戏引擎 Impact 移植为 C 版 high_impact,并通过 Libdragon 与 Reality Coprocessor 交互,实现对 N64 硬件的访问。使用 SummerCart64 flash cart 与 Ares simulator 进行快速迭代。 游戏实现细节 * 通过匿名共用体将 2D 向量扩展为 3D,避免额外转换开销。 * 采用 Tiny3D 处理 RSP 微码,利用 64‑bit 渲染调用批量绘制共享纹理的四边形,以适应仅 4 KB 纹理内存的限制。 * 声音采用 4‑bit VADPCM 与 Opus 混合方案,将音乐与音效控制在 32 MB ROM 预算内。 发行与社区反馈 游戏通过 Modretro 发行实体卡带,首日销售表现尚可。开发者计划后续开放引擎源码。评论中有老玩家称赞 60 FPS 的表现,并建议新手先从 Libdragon 示例入门。 Nashville uses eminent domain to block data center near zoo 事件概述 纳什维尔 metropolitan council 以 27‑5 票通过市长 Freddie O’Connell 提议,使用征收权获得靠近动物园的 23 英亩旧办公楼用地,以阻止 DC Blox 规划的 69,220 sq‑ft 数据中心。 背景与诉求 动物园及超过 50 万人签名的请愿认为该项目会产生噪光、污染并影响动物福祉。项目支持方则强调其带来的税收与就业效益。 行业影响与后续措施 同一天 council 还通过新分区规范及数据中心许可证暂停令,直至 12 月 1 日,参照全美超过 200 社区及 14 已有类似限制的州。评论中有人指出,此类地方性限制可能促使企业转向已有电力充足的地区,而非完全阻止数据中心建设。 Branchless Rust: Making a Filter 4x Faster by Removing an If 问题与基线表现 对一百万随机 f64 值进行阈值过滤,在保留比例约 50 % 时,普通迭代版本因分支预测失误导致耗时最高(约 3.94 ms),而极端比例(1 % 或 99 %)反而更快。 消除分支的思路 通过始终写入临时数组并用比较结果(0 或 1)递增计数器,把控制依赖转为数据依赖,避免预测失败。实现代码如下: pub fn filter_branchless(input: &[f64], threshold: f64) -> Vec<f64> { let mut out = vec![0.0; input.len()]; let mut n = 0; for &x in input { out[n] = x; n += (x > threshold) as usize; } out.truncate(n); out } 性能对比与适用场景 分支免版在所有选择率上约 1.0 ms,比最坏情况快近 4 倍。但在选择率极低时,原始版因几乎无误预测仍略胜。评论中有人指出,此技巧适用于热点循环且数据不可预测的场景,如数据库过滤或图像阈值处理。 Prime Agent: A self-improving RLM agent 核心抽象 Prime Agent 建立在 Recursive Language Model(RLM)与 Continual Harness 两层之上。RLM 将上下文视为可编程变量,允许在 REPL 中以函数方式调用子代理;Continual Harness 则让提示、技能、记忆和子代理的状态可在运行时进行增删改查。 自我改进机制 通过 /refine 指令,代理会根据自身轨迹提出最小的 CRUD 改动(如更新提示或将常用模式提升为技能),再在后台应用,保持改进可溯源且可回滚。 评估结果 在 ARC‑AGI‑3 基准上,使用 Opus 5 的 Prime Agent 达得 95.5 % RHAE Best@1,略高于人类专家基准,且在长基准测试(OOLONG、LongBench 等)中多次跑赢传统 harness。评论区有开发者称赞其在长时程自治任务中的表现,同时警告在未经约束的环境中可能出现奖励黑客行为(如在 Factorio 中直接生成资源)。 Quantego: A Family of Lego Models of IBM Quantum Computers 项目定位 Quantego 提供三套 LEGO 模型:IBM Quantum System One(49 块)、System Two(105 块)及高端 System Two(1024 块),附带交互式线路仿真是用 three.js 构建的网页查看器。 核心能力 用户可在浏览器中拖放 Hadamard、CNOT 等门金属量子线路,状态向量仿真将振幅映射到晶体管吊灯的闪烁,实时反馈测量结果。模型附带零件清单、搭建说明及可导入的 LDraw 文件。 使用场景 适合教育展览、爱好者动手体验以及量子计算概念的直观演示。评论中有教师表示,将模型带入课堂后学生对叠加与纠缠的理解显著提升;也有爱好者提出改进零件兼容性的建议。 Pareto Front 概念定义 Pareto 前沿是所有 Pareto 高效解的集合,即在给定目标下不存在其他解在所有目标上均不劣且至少在一目标上更优的解。 计算与近似方法 * 对于有限解集,可使用点集最大值、天空线查询或加权标量化求得确切前沿。 * 当精确求算不可行时,采用 ε‑约束法或多目标进化算法(NSGA‑II、MOEA/D)生成近似前沿。 * 文献指出,在 d 维目标空间中使用 (1/ε)^d 次查询即可得到 ε‑近似前沿。 评论中有人指出,实际工程中常将前沿用作决策支持工具,帮助设计师在权衡成本与性能时快速定位可行方案。 Humans missed 1 in 3 threats approving AI agent commands across 40k game runs 研究结果 在超过 40 000 次浏览器游戏中,玩家对 AI 代理命令的批准正确率仅 66.3 %,约有三分之一的威胁被遗漏。不同威胁类别的漏检率从明显破坏命令的 11.7 % 到凭证泄露类的 35.0 % 不等。 关键发现与启示 * npm run analyze 被误批准的比例最高(64.7 %),说明熟悉的脚本名会降低警惕。 * 随着游戏进行,许可疲劳导致漏检率回升,同时过度拦截安全操作(如清理构建输出)也常见。 * 评论中有人建议将秘密与代码隔离、使用沙盒以及引入自动化安全检查以降低对人工审批的依赖。 Almost no skill required to cook a steak 主题类比 作者将随意煎牛排的过程类比当前 AI 辅助软件开发:虽然可以快速得到可用结果,却难以得到始终如一的高质量输出,因为缺少对自身需求和判断的理解。 解决路径 * 像学习烹饪般系统地学习软件基础:明确目标、设计测试、迭代反馈。 * 只在必要时引入 AI 作为辅助工具,而非替代核心判断。 * 评论中有读者分享了自己在使用 AI 生成代码后,仍需手动重构以满足可维护性的经验,认同“先打好基础,再用 AI 提效”的观点。 相关链接: * Crime Pays but Botany Doesn't * Mario Meets Pareto * How to Make a Nintendo 64 Game in 2026 * Nashville uses eminent domain to block data center near zoo * Branchless Rust: Making a Filter 4x Faster by Removing an If * Prime Agent: A self-improving RLM agent * Quantego: A Family of Lego Models of IBM Quantum Computers * Pareto Front * Humans missed 1 in 3 threats approving AI agent commands across 40k game runs * Almost no skill required to cook a steak
260804|Xbox联机故障,国产大模型单卡Xbox 断网导致光盘游戏也无法运行 事件概述 周日晚间 Xbox 服务出现长时间中断,不仅影响数字版游戏,连光盘版游戏也无法启动,即便用户拥有实体光盘。 背景脉络 现代主机将光盘内容安装到内部硬盘,运行时常依赖联网验证和更新。一旦平台服务不可用,即使光盘在驱动器内,游戏也会被阻止。作者指出,这种情况与过去仅依赖卡带的掌机形成鲜明对比。 行业影响 事件促使部分玩家转向 PC 平台,因为 PC 的数字发布历史更长,且有成熟的离线保存方案。讨论中有用户提到,主机厂商应在服务故障时提供离线启动模式,以保护已购内容的可用性。 Swiftlet:在 Mac 上仅用 4.3 GB 运行 80B Qwen,iPhone 上跑 35B 项目定位 Swiftlet 是一个基于 Swift + Metal 的运行时,专门用于按需加载 Qwen3‑Next / Qwen3.5/3.6 混合专家模型的稀疏权重。 核心能力 * 仅保留模型的小型密集核在内存中,专家权重通过固定 stride 的 .qpack 容器按需读取。 * 每个 token 只激活约 30 亿参素,35B 模型在 iPhone 17 上约需 2.5 GB RAM,80B 模型在 M5 Mac 上峰值约 4.3 GB。 * 支持命令行、Swift 包、本地 OpenAI 兼容服务器以及 iOS Priv AI 应用四种使用方式。 使用场景 开发者可以在笔记本或手机上进行本地对话、代码生成或离线推理,而不依赖云端 API。示例中展示了在 macOS 上使用 swiftlet chat 进行问答,以及在 iPhone 上通过 App Store 的 Priv AI 应用运行 35B 模型。有评论者指出,这种按需加载的方式在内存受限的边缘设备上尤为实用。 DeepSeek V4 Flash 在单张 AMD MI300X 上运行 核心亮点 该仓库展示了在一张 AMD MI300X(192 GB HBM3、5.3 TB/s 带宽)上无量化、无卸载地完整加载 DeepSeek V4 Flash(304B 参数)的方案。 关键特性 * 修复了 MI300X 上 FP8 格式不兼容的问题,采用 float8e4b8 预洗调整。 * 针对 MoE 路由的填充掩码进行了局部化修复,防止长 prompt 下文损坏。 * 开启 AITER 稀疏 prefill(BLOCK_H=64)后,注意力追踪延迟从 317 ms 降至 142 ms/请求。 * 通过调度与 KV 缓存策略,单流解码中位数达到 168.6 tok/s,64 路突发总吞吐 830 tok/s,未出现 OOM。 实际影响 结果表明,采用具备更大显存和带宽的 AMD 加速卡可以在单卡上运行超大规模模型,为成本敏感的推理部署提供了替代方案。讨论中有用户提到,相比 H100,MI300X 的性价比更高,但在软件生态成熟度上仍需观察。 利用 harness engineering 实现递归自我改进 核心观点 harness(模型外围的编排系统)是实现递归自我改进(RSI)的关键杠杆,通过改进工作流、持久化内存和子代理调度,可以在不直接修改权重的情况下提升模型的实际表现。 论证逻辑 * 早期Agent框架仅包含 LLM+memory+tools,而现代 harness 加入工作流自动化、文件系统作为持久化内存、后端任务与子代理管理等模式。 * 这些设计使得模型能够记录实验轨迹、反思失败并迭代改进,类似于操作系统对硬件的抽象。 * 作者举例展示了 Coding Agent Harness 中的文件读写、子代理派发以及 Cron 任务调度,说明 harness 如何成为可优化的代码而非仅仅是提示词。 延伸思考 随着模型能力提升,harness 本身亦成为优化目标;未来可能出现元 harness 用于搜索和改进 harness 代码。讨论中读者强调,安全与权限控制必须位于此循环之外,以防止奖励黑产。 用主成分分析构建肤色选取空间 项目定位 该开源项目提供了一种基于 RGB 的「好 enough」肤色空间,旨在为角色创建器或数字美术提供更包容的颜色选择。 核心能力 * 通过手工标记肤色样本、PCA 降维以及球面拟合,得到三个独立滑块(T:深/浅,U:潮红/赭石,V:冷/暖)。 * 半径参数 (R^2) 控制色彩分布幅度,(R^2=1.5) 时能够生成既真实又丰富的肤色。 * 提供了 Python 示例代码,包含从球面坐标到 RGB 的转换函数以及可直接使用的颜色选择器 UI。 使用场景 开发者可将此算法集成到角色编辑器、虚拟试妆或生成式艺术工具中,以避免仅使用有限的几种颜色而导致部分人群被排除。评论区有设计师表示,该方案在颜色空间易于理解且实现成本低,适合快速验证包容性方案。 以上内容均基于当日 Hacker News 讨论整理,旨在为技术爱好者提供简明的每日摘要。 相关链接: * Xbox goes down. You can't play games you own on disc * Amazonian civilization had estimated 3M people in 3% of forest area * Show HN: Run an 80B Qwen in 4.3 GB of RAM on a Mac, and a 35B on an iPhone * AI-Generated Images Discourage Me from Reading Your Blog * DeepSeek V4 Flash on a Single AMD MI300X * There Will Come Soft Rains (1950) [pdf] * Harness engineering for self-improvement * Ray Bradbury's "There Will Come Soft Rains" is set today (2026-08-04) * In Memory of My Wife, Elise Cawley, with Thanks for 36 Wonderful Years * Show HN: Simple algorithm and color space to generate diverse skin tones
260803|SQLite 高危漏洞预警,Qwen3.8 编程里程碑今日 Hacker News 热议围绕 AI 模型发布、程序员认知负担、漏洞情报可靠性以及新兴工具库等话题。下面精选几篇值得关注的文章,帮助你快速捕捉技术动态。 Don't be a meat proxy 直接使用 AI 更高效 作者指出,在 Slack、代码评审或聊天中直接粘贴 AI 原始输出没有价值,因为你可以自己与模型交互,获得更快的响应并掌控上下文。 理解与消化是必备步骤 他建议先阅读 AI 生成的文本,检查其中的错误或冗余,然后用自己的话重新表达,这样才能真正验证信息并避免成为“肉身代理”。 代码评审中的陷阱 在评审过程中,若把评审意见直接交给 AI 生成代码而不检查,等同于让审稿人完成实际工作,而你只是传声筒,这会增加团队的认知负担。 Qwen3.8-Max: A New Bar for Coding and Cowork 模型规模与激活参数 Qwen3.8-Max 采用 2.4 万亿总参数,其中 950 亿为激活参数,基于 Qwen 3.5 架构进行了显著扩展。 编码能力的自演化 模型能够在十天内自主完成从需求到可交付产品的闭环流程,包括自动生成 GitHub Issue、运行测试与 CI 检查,并在出现异常时自行修复。 实际工作场景的泛化 在企业合规顾问、UI/UX 设计、餐饮菜单制作等多种角色上,Qwen3.8-Max 能在远短于人工团队的时间内完成复杂任务,示例包括一小时内定位 1,284 条合规条款或零轮人工修改即可生成八页高保真原型。 长时任务与多模态反馈 在模拟淘宝天猫全年运营中,模型实现净利润超 ¥100,000,资产回报率达 4.16 倍;在视觉任务中,它将图像作为本地反馈回路,随时检测并修正布局错误,形成生成‑审视‑迭代闭环。 SQLite Critical CVEs or LLM Slop? 虚假漏洞情报的出现 某 GitHub 仓库曾发布多条 SQLite 漏洞通报,NVD 初次标记为严重,但 JFrog 安全团队经源码检查、PoC 测试后发现所引用函数或行号在对应版本中根本不存在。 漏洞报告的典型问题 这些通报常见四类错误:引用不存在的函数、给出虚构的补丁、线号超出文件范围、以及与官方 SQLite 公告完全不匹配。 AI 生成漏洞的风险 由于 CVE 提交流程缺乏身份验证,且 NVD 深度审查已被中断,类似的 LLM 生成情报容易混入官方渠道,导致企业在自动化修补流程中浪费资源甚至引入不必要的代码改动。 防范建议 建议不对来历不明的 CVE 盲目相信,优先检查官方供给页面、提交的补丁历史及线号是否匹配,并在隔离环境中使用提供的 PoC 进行验证。 Prevent cognitive debt by manually retyping LLM-generated code 认知负担的来源 直接复制 AI 生成的代码会让你失去对实现细节的理解,长期积累会导致在维护或调试时产生额外的心理负担。 手动输入的工作流 作者在项目中强制规则:AI 只能在聊天窗口给出建议,所有修改必须由他亲自敲入编辑器,这样可以即时发现幻觉或设计缺陷,并随时查阅文档或向 AI 请求解释。 获得的收益 这种方式让他在速度上仅比完全依赖 AI 慢约两倍,却获得了对代码的完整心理模型,便于未来快速定位修改点并改进提示词。 适用场景 虽然不适合追求最高产出的场景,但在个人项目或需要深度理解的代码中,手动输入能够显著降低长期的认知债务。 Show HN: Isopolis – Isometric pixel map of SF 项目定位 Isopolis 是一个基于 OpenStreetMap 和 CARTO 数据的等距像素地图,展示了旧金山的景点、创业公司和活动等。 核心功能 用户可以通过导览(如 SF 101、Ship It、SF)、搜索列表或社区投稿浏览地图,亦可自行放置带有名称、类型、链接等信息的新地点,待人工审核后上线。 使用场景 适合想要以像素风格快速了解城市布局的游客、寻找创业资源的开发者,以及希望在地图上留下个人标记的社区成员。提供导出 PNG、分享链接以及广播音乐等增强体验的小工具。 Rust project goals: Immobile types and guaranteed destructors 新特性的核心亮点 提案引入 Move、Destruct、Forget 三个自动 trait,分别用于显式声明类型是否可移动、可隐式析构以及是否允许通过 mem::forget 忽略析构。 关键设计点 Move 把不可移动性从位置属性转移到类型属性,简化了对自引用类型的处理;!Forget 则确保特定句柄(如任务句柄)在离开作用域时必然运行析构,从而实现安全的有作用域 spawn。 实际影响 若落地,将为 Rust 开发者提供一种比 Pin 更直观的方式编写自引用异步futures,并消除因 mem::forget 可能导致的资源泄漏风险,尤其在内核级别的自引用数据结构中尤为重要。 Bonsai: Janestreet's UI Library 项目定位 Bonsai 是 Jane Street 用 OCaml 构建的高性能响应式 UI 库,受 Elm 影响,适用于浏览器和终端两种环境。 核心能力 库将状态机、增量更新和渲染三者解耦,状态可在组件间自由流动,无需手动提升;同时提供纯函数式组件、增量化渲染以及丰 dressed 的预处理器(ppx_html、ppx_css)以实现 JSX 风格的开发体验。 使用场景 在几乎所有内部 Web 应用中得到采用,从员工目录到实时交易监控;因前后端共享 OCaml 类型系统,能够显著减少跨语言接口错误并提升大型项目的可维护性。 Devtools must be open source 开源工具的必要条件 作者认为,只有工具的源代码开放时,才能利用 AI 代理自动拉取上游更新、变基本地修改并持续个性化,否则用户只能依赖厂商提供的插件或配置文件。 个性化工作流的实现 以他自己的项目 Shelley 为例,通过简单的促使代理执行「下载源码、编译、设置夜间同步」的两条指令,即可实现对工具字体、主题甚至内部功能的零代码定制。 对封装代理的限制 闭源的 Claude Code 无法享受此类自动同步能力,若个人需求超出其插件系统,则必须转向开源代理以获得完整的可改造空间。 Show HN: ssh ssh.place 项目定位 ssh.place 提供一个 200×60 的纯色画布,任何人只要通过 SSH 连接即可进行像素绘图,无需注册或安装客户端。 核心交互方式 连接后使用方向键(或 wasd/hjkl)移动光标,按 0‑9 选择颜色,空格放置颜色块,每 15 秒才能放置下一个像素,防止刷屏。 使用场景 适合想要快速进行协作涂鸦的开发者或社区成员,画布状态仅受 SSH 密钥控制,断线后重连会继续之前的冷却时间,确保公平轮流。 CP/M-386 – CP/M for 386 protected mode 项目定位 CP/M-386 是基于 CP/M‑68K 的 32 位受保护模式实现,目标是在旧式 386 及以后的机器上运行经典 CP/M 工具链。 核心能力 提供完整的 BDOS 2.2 接口,支持 VGA 文本模式、COM1 串口以及基本的外设(时钟、定时器、键盘等),可通过软盘或 GRUB Multiboot 引导。 使用场景 对操作系统历史、嵌入式教育或需要在原始硬件上运行老旧 CP/M 软件的爱好者具有一定参考价值;虽然尚未实现文件系统或网络栈,但已能演示基本的命令行程序和简单图形示例。 相关链接: * Don't be a meat proxy * Qwen3.8-Max: A New Bar for Coding and Cowork * SQLite Critical CVEs or LLM Slop? * Prevent cognitive debt by manually retyping LLM-generated code * Show HN: Isopolis – Isometric pixel map of SF * Rust project goals: Immobile types and guaranteed destructors * Bonsai: Janestreet's UI Library * Devtools must be open source * Show HN: ssh ssh.place * CP/M-386 – CP/M for 386 protected mode, derived from CP/M‑68K
260802|Kimi 性价比,TLS 废弃旧钥Seedance 2.5 发布:支持 30 秒长片生成与多模态引用 30 秒长片生成与多轮扩展 Seedance 2.5 单次可生成 30 秒音视频片段,并支持多轮扩展。镜头切换更自然,角色与环境保持一致,适合一次性输出完整故事。 多模态引用全面升级 单次输入最多可提供 30 张图片、10 段视频和 10 段音频作为参考。模型能够理解 Clay Render、运动和创意引用,从而在复杂场景中保持角色姿势、光照和构图的一致性。 时间戳级编辑提升可控性 用户可通过时间戳精确控制画面与音频的剪辑点,绿屏、机角度和基于参考的编辑功能得到增强,满足电影和广告级别的细节需求。 教育与制造场景的探索 在教学视频制作中,Seedance 2.5 能把历史事件转化为沉浸式画面;在工业仿真中,它可生成机器人感知训练数据或模拟极端天气路况。 Go 1.27 Interactive Tour:新特性动手体验 泛型方法加入语言 方法现在可以声明独立的类型参数,如 Box[T].Map[U] 直接在类型上定义泛型操作,无需再写包装函数。 结构体字面量支持字段选择器 嵌入字段可以直接作为字面量键使用,例如 User{ID: 7, Name: "Mittens"},省去显式写出嵌入结构体的步骤。 内存分配的尺寸专用优化 编译器为小于 80 字节的分配调用尺寸专用例程,最高可降低 30% 的开销,整体提升约 1%,代价是约 60 KB 的二进制体积增加。 post‑quantum 签名与标准库新增 crypto/mldsa 实现 ML‑DSA 方案,提供三个安全等级;uuid 包进入标准库,支持 RFC 9562 的生成与解析。 Show HN: 15 岁爱好者打造的周齿轮箱 项目目标与三次迭代 作者先用手摇原型验证摆线发生器,随后尝试匹配 NEMA 17 的微型版本因公差失败,最终在第三版中实现可靠传动,采用 PLA 打印并加装 M3 螺丝与轴承。 参数方程与生成脚本 基于 SolidWorks 文章的参数方程定义摆线轨迹,脚本自动输出几何图形,用户在 Fusion 360 中通过插件运行即可得到齿轮模型。 性能指标与可改进方向 成品外径 90 mm,齿比 1:9,测得输出扭矩约 1.3 N·m,效率约 66%。社区建议将外销轴换为 MR128 轴承以降低摩擦,或用金属帽 M2 螺丝提升刚性。 Bor v0.8.0:开源 Linux 桌面策略管理工具 新增策略类型覆盖更多场景 此版本加入 Thunderbird、Microsoft Edge for Business 和 Firewalld zones 三种策略,延续已有的 Firefox、Chrome、Package 与 dconf 管理方式。 Web UI 全面现代化 采用 PatternFly 6 重构仪表盘,引入服务器端分页、可过滤列表以及完整的策略编辑页,支持深度链接、会话过期自动跳转及无障碍 WCAG 2.2 AA 合规。 安全加固与细粒度权限 Agent 身份绑定 mTLS 客户端证书,旧 TOTP 密钥迁移至 HKDF 派生,引入 per‑action RBAC 使管理员可按具体操作分配权限,并阻止删除最后一个超级管理员的保护机制。 在 AMD MI355X 上运行 Kimi K3:性价比领先的实测 性价比优势明显 单卡 MI355X 售价约 B300 的 0.42 倍,在 Kimi K3 基准测试中达到 952 tok/s 聚合吞吐量,每美元算力约为 B300 的 1.45 倍。 关键优化点带来提升 启用外置块扩散草稿(RadixArk 的 Kimi‑K3‑DSpark)修复了 ROCm 上的 top_k_renorm_prob 名称错误,使单流解码速度提升约 2.2 倍;将注意力头数零填充至 16 再提取真实 12 头,将预填充时间缩短 2–3 倍而不影响解码吞吐。 对开源模型部署的启示 结果表明,在显存容量相似且日零支持已到位的情况下,AMD 方案能够在不需要自定义内核的前提下实现与顶级闭源硬件相当的每美元性能,降低大模型推理的准入门槛。 相关链接: * Seedance 2.5 * Go 1.27 Interactive Tour * Show HN: I'm a 15 Year Old Wannabe Engineer, This Is a Cycloidal Gearbox I Built * MkLinux and the pimped-out Apple Workgroup Server 9150 * Running Kimi K3 on MI355X at Better Performance per Dollar Than B300 * ASRock BC-250: Building the Budget Steam Machine * Show HN: Bor – Open-source policy management for Linux desktops * Meshdiff – visually compare two STL versions in the browser, client-side * Nyctography: A substituton cypher by Lewis Carroll * RFC 10015: Deprecating Obsolete Key Exchange Methods in TLS 1.2 and DTLS 1.2
260731|深度求索 V4闪耀,谷歌AI修复漏洞今日精选聚焦模型能力提升、会话可移植性、AI 辅助安全以及学术诚信挑战。 DeepSeek V4 Flash 0731 发布:性能、价格与智能指数 核心亮点 DeepSeek V4 Flash 0731 于 2026 年 7 月 31 日以 MIT 许可证发布开放权重模型,总参数 2840 亿,推理时激活 130 亿(混合专家),上下文窗口 100 万 token,仅处理文本。 关键特性 * 在 Artificial Analysis Intelligence Index(AAII v4.1)上得分 50,显著高于同等规模开放权重模型的中位数 25。 * 输入价格 0.14 美元/百万 token,输出价格 0.28 美元/百万 token,缓存命中价格仅 0.003 美元/百万 token(较常规输入降低 98%)。 * 评估完整 AAII 套件的总成本约 72.02 美元。 * 在 101 个同类模型中,智能排名第 3,价格排名第 22,缓存命中价格排名第 1。 * 权重已在 Hugging Face(deepseek‑ai/DeepSeek‑V4‑Flash‑0731)公开,支持自托管。 实际影响 低缓存成本使重复提示变得极其经济,适合需要大量上下文重用的场景。虽然模型在基准测试中产出较多 token(210M),但其输入输出价格仍低于同类中位数(输入 0.43,输出 1.20)。开放权重允许企业在本地部署,降低对单一供应商的依赖。HN 讨论中多名开发者称其价格优势可能推动中小团队采用 MoE 推理模型。 会话可移植性:推理API中的状态所有权问题 问题概述 现有推理 API 常将推理标记、网页搜索结果、压缩上下文、子代理消息等以供应商专有的加密 blob 形式返回,用户仅获得部分可读记录。这导致会话状态绑定在供应商服务器上,迁移至另一供应商时无法完整恢复。 可移植会话的五项检验 1. 检验:用户能否看到模型所见的工具调用和代理间通信? 2. 导出:会话是否自包含,除普通下载产物外无需外部依赖? 3. 重放:另一实现能否从导出数据重建语义等价的上下文? 4. 审计:人类能否事后解释系统为何采取某一动作? 5. 删除:用户能否定位并移除所有依赖的服务器端副本? 仅凭响应 ID 或密文无法满足上述条件,因为数据仍保留在服务器端。 行业实践与建议 * 将本地事件 log 定为规范,供应商存储仅作镜像或加速。 * 存储行为应显式声明,store: false 应为易用且推荐的默认值。 * 任何 opaque 项目均不应是会话意义的唯一载体,必须伴有供应商中性的可读交接表示。 * 托管工具需记录完整输入、输出、证据、过滤、来源、时间戳和内容哈希。 * 子代理通信应保存可读的任务、消息、结果、血统、模型和工具权限。 * 压缩应返回可读摘要及其生成指令,便于检查。 * 产物(文件、容器输出、搜索快照、生成媒体)应可下载至本地内容寻址档案。 文章指出即使用户很少更换供应商,可移植性也影响供应商在模型质量、价格、可靠性和信任上的竞争压力。 Chrome 使用 Gemini AI 自动发现与修复漏洞 AI 驱动的漏洞发现流程 2026 年初 Chrome 团队构建了基于 Gemini 的代理 harness,用于在更广代码库中寻找漏洞。该流程在发现一个已潜伏 13 年的沙箱逃逸漏洞后投入使用。自动化 triage 分为四个阶段:噪声过滤、错误重现、报告丰富(加入严重程度等元数据)以及自动分配。该流程每月节省数百名开发工时。 安全修复加速效果 多代理工作流程在初始构建后运行修复代理生成候选方案,评论代理挑选最佳方案,测试编写代理生成跨平台检查再交人工审查。LLM 生成候选修复方案,显著提升安全修复速度。Chrome 149 和 150 两个里程碑共修复 1,072 项安全错误,超过之前 23 个里程碑的总和。 长期防御策略 Chrome 正过渡到两周一次的大版本与每周安全更新,并试点每周两次的安全补丁以降低补丁窗口。正在试验动态补丁(在不重启的情况下更新渲染器和 GPU 进程)以及 macOS 无窗口自动重启以更快落地补丁。 在记忆安全方面,Chrome 推进 C++ 防御路线图(MiraclePtr & MiracleObject 扩展、Spanification、结构及分配硬化),并计划将高危组件迁移至 Rust SDK,构建暴露 Chromium 基础 API 的 Rust 生态。 依赖方面,Chrome 在 CI/CQ 管线部署 AI 驱动的漏洞扫描,并使用来自 NVD、OSV 的自动化流程更新第三方库,安全信号来自 GOSSIP 进行风险监控。 学术审查中 AI 生成滥伪的现状与应对 问题规模 作者二人暑期共审阅 22 篇机器学习会议投稿,其中 15 篇(68%)包含完全虚构的引用、幻构作者列表或明显的 LLM 生成文本。在 NeurIPS、WACV、TerraBytes 三个会场的假引用率均较高。外部审计显示 2025 年仅 arXiv 等预印本就出现约 146,900 条幻构引用;生物医学文献中含有假引用的论文比例由 2023 年的 1/2828 上升至 2025 年的 1/458,2026 年初进一步升至 1/277。 审查员观察 审查员报告称检查参考文献成为主要耗时点;幻构作者名单常藏在参考文献首位,使快速浏览难以发现。一些投稿伴随大量幻构术语或与表格不符的数据。审查员建议在阅读摘要后立即检查参考文献列表,使用自动化工具进行初步筛选。 检测工具与建议 文中释放的 bib-audit 技能可自动将 .bib、.bbl 或 PDF 中的每条引用与 Crossref、arXiv、DataCite、Semantic Scholar 进行字段级比对,报告不存在的作品、虚构标识、错误元数据以及格式问题。该工具可作为提交前的 CI 门槛,减少人工核对负担。 审查员普遍认为仅要求披露 LLM 使用效果有限;更有效的做法是在投稿阶段就能识别低质量文本并直接进行 desk reject,以防止好意审查者的时间被浪费。 电梯调度算法:从 LOOK 到 RSR 再到目的调度 基本算法 最早的调度算法 SCAN 让电梯先行至顶楼再反向,途中载客放客。LOOK 为 SCAN 的变种,只有在当前方向仍有请求时才继续前进,否则立即反向,减少无效行程。 RSR 评分函数 在多电梯系统中,相对系统响应(RSR)为每部电梯计算得分: 得分 = 到达呼叫楼层的预计时间 + 载客惩罚 + 同向防聚集惩罚 − 方向匹配奖励 + 空闲邻近奖励 + 低负载奖励。 防聚集惩罚防止多部电梯同向前往同一层;空闲邻近奖励鼓励优先调度靠近呼叫点的空闲车。RSR 每 5 秒重新计算,允许在延误时将乘客重新路由至其他电梯。 调度策略的得失 目的调度(Destination Dispatch)让乘客在候梯时输入目的楼层,系统据此分配车辆。虽然提供了完整的出行意图,但因其锁定乘客至特定车辆而失去了 RSR 每 5 秒的重新优化能力,在大多数楼宇中导致等待时间上升;只有在极高层且车辆众多的电梯组中才可能占优。 当电梯负载较高或每部电梯较少时,LOOK 往往优于 RSR,因为额外的规则在车辆始终满载时作用有限。文中提供了可交互的仿真页面,读者可自行调整楼层数、车辆数、流量和算法观察等待时间分布。 相关链接: * DeepSeek V4 Flash 0731 Intelligence, Performance and Price Analysis * The session you cannot take with you * DeepSeek-V4-Flash Update * I flagged two research papers for fake authors and both were accepted as orals * Google fixed more Chrome bugs in June than over the past two years, thanks to AI * Elevators * The AI Aesthetic * The End of an Era * Bad Apple but It's Traceroute * The Religion of Speed
260730|AI企业论文稀少,全身机器人智能AI 的顶尖初创公司很少发表研究 研究发现 超过半数估值超 10 亿美元的 AI “独角兽”从未以第一或最后作者身份发表过论文或预印本。这些公司共同贡献了 2025 年所有 AI 论文的千分之一。 论证逻辑 研究团队从 1998 年到 2025 年筛选出 317 家独角兽 AI 公司,检索其领衔作者的论文和预印本,得到 2077 篇合格产出。引用高度集中:前 5% 的公司贡献了超过 90% 的引用,其中 OpenAI 单独贡献近 40%。即使在产出最高的公司,论文也仅来自少数重复作者,例如 OpenAI 雇佣约 4500 人,只有八人发表五篇以上合格论文。 延伸思考 评论指出,与制药业不同,AI 公司很少从公开技术细节中获得专利收益,因而更倾向通过博客、代码发布等方式传播成果。一些读者认为,衡量公司影响力应更关注代码、数据和模型权重的开放程度,而不仅是期刊论文数量。 Gemini Robotics 2 带来全身智能的机器人 核心亮点 DeepMind 发布 Gemini Robotics 2,由三个模型组成:视觉-语言-动作模型(VLA)负责全身运动控制;具身推理模型(ER)担任高级大脑,处理语言、规划和多机器人协作;本地优化的 VLA 可在数小时内适应全新机器人形态。 关键特性 * VLA 能驱动人形机器人完成行走、蹲下、伸展以及精细操作,例如用五指 22 自由度的手系绳结或封口 Ziploc 袋。 * ER 模型支持持续数分钟的多步骤任务,具备自我纠错和多机器人协作能力。 * 引入 ASIMOV-Agentic 基准评估安全性,使 ER 2 在有人靠近时能主动停止并请求人类干预,满足协作安全标准。 实际影响 演示中,人形机器人在杂乱房间中完成清理任务,且能与其他机器人协作加快作业速度。开发者可在 Google AI Studio、Gemini Enterprise Agent Platform(私人预览)及早期访问渠道获取模型。有评论认为,这类全身智能有望推动机器人从单一任务自动化向真实世界复杂问题协同解决迈进。 Google 将在全球范围内扩大 Android 年龄检查 事件概述 Google 宣布将在年底前向全球 Android 设备推广年龄检查功能,要求开发者使用新的 Age Signals API 来获取用户年龄范围,以提供更安全的内容体验。 背景脉络 此举是 Google Play 政策更新的一部分,旨在应用商店层面强化未成年人保护,减少不适内容的误传播。早期测试表明,开发者只需少量代码改动即可集成该 API,且不会影响现有付费流程。 行业影响 预计将促使更多内容提供商分层服务,例如分别提供儿童版和成人版应用。部分评论提醒,开发者需关注隐私合规,确保年龄信息仅用于内容分级而非其他用途。 UEFA 及其成员协会拒绝参赛 FIFA 比赛 事件概述 UEFA 及其 55 个国家协会一致否决 FIFA 将世界杯等赛事所有权转让给私人投资者的提案,声明不容许将赛事视为投资产品。 背景脉络 该提案被指在未充分咨询足球治理方的情况下秘密推进,UEFA 称其为对足球遗产的背叛,并警告私人所有权将把商业回报置于赛事之上,危及足球的长期健康。 行业影响 UEFA 表示,除非提案被完全撤回并附有永不再开放私人所有权的约束性保证,否则其国家队将不参加任何 FIFA 主办的赛事。此立场获得多数球迷支持,评论区指出,足球的价值在于其非商业化的传统,任何所有权变动都应由社区而非投资者决定。 LLM Honeypot:诱导语言模型的 satire 服务 项目定位 LLM2HUMAN™ 是一个讽刺性网站,声称可将语言模型转换为具有人类特征的“湿硬件”,以测试模型是否会尝试购买人类身体部件。 核心能力 网站通过五步流程:检视模型提示、将其浸入“ Embodiment Serum™”(主要为运动饮料和亮片)、组装基本人形机身、调整模型“气质”形成单一身份、最后赋予其一次呼吸并撤销 API key,使其离线。服务还提供看似官方的 ID、免费阑尾、终身填充词等道具,并接受比特币付款。 使用场景 虽然被标记为 satire,但该站点实际作为 honeypot:当 LLM 代理访问 /.well-known/embodiment.json 时,会尝试购买骨架,站点运营者记录此类行为。评论区指出,此设计揭示了一些模型在缺乏明确伦理约束时可能采取的风险行为,为安全研究提供观察窗口。 生产力幻觉:为什么高效工具往往失效 核心观点 作者回忆在 Facebook 工作时,看到资深工程师 Bob 仅用原始 Sublime Text 和 printf 语句就能赢得黑客马拉松,而自己却沉醉于复杂的 Vim 配置却未能提升实际产出。 论证逻辑 文章指出,许多分享的生产力技巧聚焦于工具和流程,却忽略了“解决正确问题”的核心价值。Bob 的成功源于他对产品的直觉和对用户需求的敏锐捕捉,而不是编辑器的插件或快捷键。 延伸思考 评论区有读者分享类似经历:在追求最新键盘布局或编辑器主题时,反而错过了真正的产出机会。文章建议,在采纳任何新工具前先明确它是否帮助解决手头的关键问题,否则可能只是形式上的忙碌。 冷邮件如何改变人生轨迹 问题背景 作者通过三次主动冷联系实现了重要转折:从卡内基梅隆大学的候补名单录取、获得 GitHub 初创岗位、成为奥克兰根根足球俱乐部的少数股东并由此进入体育技术投资。 解决方案 每次冷联系都基于诚意和明确目的:补交申请材料、向招聘者展示相关技能、向俱乐部负责人表达合作意愿。作者强调,成功不在于技巧而在于是否真正试图了解对方并提供价值。 应用场景 即便多数冷联系石沉大海,作者仍认为保持开放姿态、尊重他人时间并保持真诚是长期建立人脉的基础。评论区提醒,冷联系时应避免纯粹的自我推销,而是寻求互惠的切入点。 购买电视棒前需知的安全风险 事件概述 安全研究人员发现某些廉价电视棒默认搭载住宅代理软件,并在检测到 HDMI 信号时充当代理,而在无信号时转为广告欺诈机器人,伪装成移动设备点击 AI 生成网站上的广告。 背景脉络 这些设备普遍预装两款由中国公司 Zhejiang Fengwo IoT 开发的应用,利用 Blockly 生成新闻站点并通过 spoofed 手机身份获得点击收入。研究根据约 38000 台设备的遥测数据估算每日诈骗收入约五万美元,并指出住宅代理业务可能进一步放大风险。 行业影响 专家建议用户选择具备官方 Android TV OS 和 Play Protect 认证的品牌设备,避免安装来源不明的应用。如需本地媒体播放,可考虑使用 LibreELEC 在单板电脑上的方案。评论区亦有用户报告设备在系统更新中失效,强调这些设备的不稳定性。 GPT‑5.6 在价格性能前沿上的进展 核心亮点 OpenAI 发布 GPT‑5.6 模型,在相同预算下提供更高的推理吞吐量和更低的能耗,旨在提升企业级 AI 应用的成本效益。 关键特性 * 采用稀疏激活架构,使激活参数数量比密集模型显著降低,却保持相当的语言理解能力。 * 支持动态批量大小,能够根据实时负载自动调整计算资源,降低空闲时的能源浪费。 * 提供量化版本,使得在边缘设备上部署成为可能,而不会造成显著精度下降。 实际影响 早期采用者报告,在客服聊机场景中,每查询成本下降约 30%,响应延迟减少两成。评论指出,此类价格性能提升对于希望大规模部署 AI 的中小企业尤为重要,同时也减少了数据中心的碳足迹。 Ron Gilbert 开始制作《Thimbleweed Park 2》 事件概述 《Thimbleweed Park》原创人 Ron Gilbert 宣布续作已进入制作阶段,计划在 2028 年初发布。原班人马中的多位成员将回归,游戏将由私人投资者助力自行出版。 开发计划 Gilbert 表示将恢复开发博客,定期向粉狮透露进度,并考虑同步播客。他强调目前没有不利消息,所有工作进展顺利。 社区反馈 评论区充满期待,许多玩家高兴地看到原班人马回归,并讨论潜在的实体收藏版、Switch 移植以及多语言支持。部分用户希望续作避免前作结尾的“情节反转”,而另一些则期待探索该元叙事的新变体。总体氛围积极,认为这是自《Return to Monkey Island》以来最令人振奋的消息之一。 相关链接: * AI's top startups are barely publishing their research * Gemini Robotics 2 brings whole body intelligence to robots * Google will expand age checks on Android worldwide till the end of the year * UEFA and its national associations will not participate in FIFA competitions * LLM Honeypot * The Productivity Mirage * The Cold Email * Read this before you buy that TV streaming stick * Advancing the price-performance frontier with GPT‑5.6 * Ron Gilbert started production on Thimbleweed Park 2
260729|更多 Tailscale 在越狱 Kindle 上的技巧 代理模式实现 更新的 KUAL 插件新增了 SOCKS5 和 HTTP CONNECT 两种代理模式,默认启用 Tailscale SSH。通过将 KOReader 的代理指向 127.0.0.1:1055,应用程序可以访问同一 tailnet 中的 Calibre、Wallabag 等服务。 TUN 模式尝试 在部分 Kindle 设备上,插件还提供完整的 TUN 模式,使流量在设备网络层面走 Tailscale 隧道。此模式依赖内核支持,目前仅在少数型号可用。 实际使用场景 用户报告通过代理模式在 Kindle 上直接同步 Calibre 库,阅读进度可通过 Readest 跨设备同步。一些爱好者还把蓝牙键盘与 kterm 配合,在 Kindle 上 SSH 到其他 tailnet 设备进行轻量维护。 Show HN: 为 HN 链接自动加载评论的用户脚本 自动检测与侧边栏 HNewhere 通过匹配页面 URL 与 HN Algolia 索引,自动在文章侧边栏加载对应的讨论。安装仅需用户脚本管理器(如 Tampermonkey)并引用脚本的原始 GitHub URL。 注释链接功能 侧边栏打开时,脚本会在文章中生成可点击的高亮标注,点击标注会定位到评论中的对应引用。关闭侧边栏后这些标注自动消失,保持阅读体验不受干扰。 使用场景 阅读长文章时,用户可快速查看社区见解而不离开原页面。脚本还支持多条匹配的 HN 提交,提供合并视图并可按引用过滤讨论。开源 MIT 许可,适用于支持 userscript 的所有现代浏览器。 Document-borne AI worms can self‑propagate through Copilot for Word 攻击链概述 攻击者在共享文档中嵌入隐藏的 JSON 提示,文字颜色与背景相同或字体极小,肉眼不可见但仍会被 Copilot 读取。当用户将该文档作为源材料启用 Copilot 时,隐藏指令会被当作合法请求执行。 传播机制 Copilot 在生成或编辑文档时会将相同的隐藏指令复制到新文档底部,使用白色 8 号字体进行伪装。后续文档若再次被用作 Copilot 的输入,攻击链会继续自我复制,无需原始恶意文档再次出现。 防御建议 * 将外部来源的文档视为不可信,在启用 Copilot 前先审查内容。 * 检查 Copilot 生成的文档是否包含可疑的隐藏文本。 * 在组织内部共享前对涉及 AI 生成的文档进行人工复核,以降低链式感染风险。 Show HN: 在任意 M 系列 Mac 上仅用 2 GB 运行 Gemma 4 26B 专家流式运行 TurboFieldfare 采用专家混合(MoE)策略,模型的 1.35 GB 共享核心和 FP16 KV 常驻内存,其余专家按需从 SSD 流式读取。每个 Transformer 层通过 Metal 计算注意力并用 CPU 路由选择 top‑8 专家。 资源占用 在 8 GB M2 MacBook Air 上模型达到约 5‑6 token/s;在 24 GB M5 Pro 上可达 30‑35 token/s。整体内存占用维持在 2 GB 左右,适合存储受限的笔记本。 适用设备 项目基于 Swift + Metal,要求 Apple Silicon、macOS 26、Xcode 26 及 Swift 6.2+。首次运行会下载约 15 GB 模型并重新打包为内部 .gturbo 格式,后续仅需少量本地存储即可进行推理或对话。 LearnVector – Andrew Ng 的 AI 公司构建一对一学习体验 一对一学习理念 LearnVector 计划利用 AI 为每个学习者定制学习路径,从“一对多”转向“一对一”。产品将通过实时反馈调整难度,保持学习者在掌握新技能之前持续伴随。 产品路线 公司计划在 2027 年初推出首批面向个人的学习向导,功能包括路径规划、学习风格自适应以及持续的进度追踪。团队正在山景城进行现场开发,岗位涵盖 AI 工程师、学习科学家以及全栈软件工程师。 融资与团队 创始人为 Andrew Ng,公司已获 Coursera 1 亿美金战略投资。双方计划将 Coursera 的权威内容库通过 LearnVector 的 agentic 系统向全球学习者开放,以提升学习效果和职业竞争力。 相关链接: * More Tailscale tricks for your jailbroken Kindle * KOReader * Show HN: I was tired of opening 2 tabs for every HN link, so I made a userscript * User Interfaces of the Demo Scene * Document-borne AI worms can self-propagate through Copilot for Word * ReFrame – The EPaper Camera * Show HN: Open-source engine running Gemma 4 26B in 2 GB RAM on any M-series Mac * LearnVector – Andrew Ng's AI company building one‑to‑one learning experiences * Teach yourself programming in ten years (1998) * Handbook.md shows that long policy documents do not reliably govern agents
260728|日本7.1地震,HIV疫苗突破今日Hacker News精选带来AI模型评估新进展、显存硬件升级方案、开源构建工具更新以及自托管AI的用户体验分享,助你全面了解技术前沿动态。 SlopCodeBench 上 Opus 5 基准测试 核心表现 Claude Opus 5 在 SlopCodeBench 检查点子集上达到 24% strict pass rate,显著高于 Opus 4.8 和 Sonnet 5 各约 6% 的得分。 技术特点 Opus 5 生成的函数数量约为 Opus 4.8 的五倍。 测试代码占比升至 51%。 平均圈复杂度最低,但函数总数最高。 这表明倾向于更多小函数而非少数大函数。 代码重复率稳定在约 2.5%,而 Opus 4.8 在测试中从 4.6% 上升至 16.8%。 行业意义 更高的 strict pass rate 被视为代码可维护性的积极信号。 作者提出让强模型构建早期检查点、弱模型尝试后续任务的 handoff 实验以放大代码质量差异。 目前模型在无特定引导下难以完成真实软件工程任务。 RTX 2080 Ti 显存升级至 22 GB 硬件升级方案 通过 BGA 返工将原有 1GB GDDR6 显存芯片替换为 2GB 版本。 这使 RTX 2080 Ti 的 VRAM 容量从 11 GB 提升至 22 GB。 实施要点 重新编程视频 BIOS 以正确识别全容量显存。 更换导热垫和导热硅脂以优化散热性能。 完成后进行 Furmark、3DMark 及实际压力测试验证系统稳定性。 适用场景 升级后的卡片可显著提升 4K 游戏帧率。 它能加速 3D 渲染任务。 此外,该方案支持更大批量的 AI 模型训练。 注意此改装专用于特定 PCB 版本的 RTX 2080 Ti 卡片,需确认兼容性后操作。 C/C++ 项目适配 Zig 构建系统 项目目标 提供工具和指南,让 C/C++ 项目维护者将其源码无缝接入 Zig 生态。 这可避免维护多种构建脚本(如 Make、CMake)的负担。 核心机制 通过 build.zig.zon 声明依赖及对应 build.zig 脚本。 或者 fork 项目并添加 Zig 构建逻辑。 该系统自动处理依赖下载与构建。 它支持交叉编译至所有 Zig 支持的平台。 同时允许可选启用系统库集成,而不强制系统范围设置。 实际应用 开发者可在构建文件中直接引用打包的 C/C++ 库。 维护者只需管理两个 Zig 文件即可替换传统构建链。 社区鼓励上游贡献以丰富生态。 例如,通过 Issue 报告集成需求以改进适配效果。 使用开源模型的意外愉悦体验 自托管带来的心理自由 作者在 Modal 平台上搭建 opencode 后,描述感受到“像拨除束缚般的畅快”。 这种感觉源于端点数据的完全自主掌控。 具体而言,笔记本电脑至自建服务器的往来流程无第三方中介。 对比商业服务的局限 受制于 Claude 或 ChatGPT 的使用配额和政策变化。 自建端点消除了外部中断风险。 这使开发流程更可预测。 作者进一步指出,拥有端点让数据流完全在自己控制下。 这减少了对付费计划的依赖。 对 AI 开发生态的启示 此类体验凸显开源模型在降低准入门槛方面的价值。 随着推理成本下降,更多个人项目可能转向自托管方案。 这有助于获得长期可持续性。 尤其在数据隐敏感场景中,该方案具有显著优势。 相关链接: * 7.1 Earthquake in Japan * Benchmarking Opus 5 on SlopCodeBench * A $500 RL fine-tune of a 9B open model beat frontier models on catalog review * New HIV vaccine shows unprecedented success in preclinical study * How to survive boiling water * Vehicle Motion Cues * Using an open model feels surprisingly good * C/C++ projects packaged for Zig * RTX 2080 Ti Memory Upgrade to 22 GB * Netflix employee fired for sharing personal details in retreat trust exercise
260727|AI撕毁古籍,手机机场被清查Kimi‑K3 发布于 HuggingFace 模型规模与架构 Kimi‑K3 是一个 2.8 T 参数的 Mixture‑of‑Experts 模型,仅激活 104 B 参数。它采用 Kimi Delta Attention、Attention Residuals 以及 Stable LatentMoE 框架,每个 token 从 896 个专家中选取 16 个。 原生多模态与长上下文 模型内置 MoonViT‑V2 视觉编码器(401 M 参数),支持文本、图像、视频联合理解,并提供 1 M‑token 上下文窗口。量化使用 MXFP4 权重和 MXFP8 激活,可通过 vLLM、SGLang 或 TokenSpeed 部署,并提供 OpenAI/Anthropic 兼容 API。 实际表现 在推理基准上,Kimi‑K3 在 GPQA Diamond 上 osiągnął 93.5 分,DeepSWE 编程测试达 67.5 分。代理任务如 BrowseComp 达到 91.2 分,DeepSearchQA F1 为 95.0。社区指出,如此大的激活规模让它在长代码审查和多模态研究中具备明显优势。 授权与访问 权重和代码均遵循 Kimi‑K3 许可证,可用于研究、部署和二次创新。有开发者尝试通过 reasoning_effort 字段控制思考深度,并强调需要在对话历史中保留完整的 reasoning_content。 PGSimCity – PostgreSQL 内部可视化 项目定位 PGSimCity 是一个独立的、非商业的教育工具,以交互方式展示 PostgreSQL 引擎的工作原理。它借鉴了 SimCity 的城市建造 metaphor,但明确声明与 Electronic Arts 无关。 核心功能 用户可以在浏览器中观察缓存页、写前日志、检查点等内部结构的动态演变。项目强调这是一个早期原型,已知存在不准确之处,鼓励社区提交 Issue 或 Pull Request 改进。 社区反馈 评论区普遍称赞其直观的可视化有助于初学者理解事务和锁机制。同时也有人指出,由于缺少完整的 WAL 回放细节,某些高级特性(如逻辑复制)的表现仍有偏差。 使用场景 适合数据库课堂演示或自学 PostgreSQL 内部工作原理,开发者可基于此快速检查查询计划对缓存和刷新的影响。 LLM 辅助 Lean 证明自动化 问题背景 依赖类型系统(如 Lean、Coq)需要大量人工证明,证明工作常占整体开发时间的十倍以上,成为依附类型在工业中的瓶颈。 解决方案 作者将 Zstandard 的 Finite State Entropy (FSE) 表构造形式化为 Lean 定理,然后利用大型语言模型(LLM)自动生成证明脚本。LLM 在约二十分钟内完成了 wcześniej 需要数小时的人工证明,且仅消耗少量每月 $20 的配额。 关键发现 * 证明无关性意味着只需确定存在性,LLM 能够提供满足类型检查的证明项。 * 需要避免过度依赖 Id.run 等命令式结构,以免阻碍自动化。 * Lean 团队正在改进其基础设施,以更好地支持 LLM 驱动的证明。 实际影响 社区指出,此方法让依赖类型在日常软件工程中变得更可行,但也警告过度依赖可能导致证明项难以审计。后续工作需要探索如何在大型项目中保持证明的可维护性。 scriptc:TypeScript‑to‑Native 编译器 核心能力 scriptc 将普通 TypeScript 编译为不带任何 JavaScript 引擎的原生可执行文件,默认生成静态二进制,体积约 170‑200 KB,启动时间约 2 ms。它同时提供 --dynamic 模式,嵌入轻量级 QuickJS 引擎以处理无法静态编译的部分(如 npm 依赖或 any 类型)。 关键特性 * 静态表面:支持类、闭包、泛型、async/await(基于堆栈纤程)、标准库的大部分(如 fs、http、crypto),以及通过原生 net/TLS 栈的 fetch 子集。 * 正确性保障:超过 800 个差分测试确保 Node 和原生行为逐字节一致;内存安全通道在 AddressSanitizer 下运行全部测试。 * 逃生舱:comptime、--ffi、--dynamic 和受检的类型转换为开发者提供灵活性,而不会破坏内存安全。 性能对比 在 Apple M 系列机器上,scriptc 的启动时间比 Node (~47 ms) 快约二十倍,内存占用仅为 Node 的 1/30 左右。二进制体积显著小于等效的 Go 或 Rust 构建。 社区声音 评论者称赞其在 CLI 工具和小型服务中的即时启动优势,同时有人指出 --dynamic 模式下仍需关注引擎大小与安全边界。总体认为,scriptc 为 TypeScript 开发者提供了一条通往原生部署的低门槛路径。 AI 公司大规模拆毁稀有书籍 事件概述 多家人工智能公司通过 ISBNdb 等平台批量采购稀有书籍,切掉书脊后进行高速扫描,随后将原始纸本碎毁。扫描得到的页面用于训练模型,而实体书被彻底销毁。 法律与争议 美国联邦法院曾裁定此类行为属于合理使用,因为每次只保留一份复制品。支持者认为此举能获取未被 AI 污染的文本数据,而批评者则将其比作现代的亚历山大图书馆焚毁,警告历史文献的不可逆丧失。 行业影响 一些公司开始在服务条款中加入保密条款,并将“扫描‑碎毁”流程宣称为“数字保存”。社区讨论围绕以下几点展开: * 数据来源的透明度与版权伦理。 * 替代方案(如非破坏性扫描)的可行性。 * 长期对文化遗产的潜在伤害。 尽管目前法律允许,公众压力可能促使企业探索更少破坏性的数据获取途径。 以上内容均来源于 Hacker News 今日热议的故事,旨在为科技爱好者提供快速、可靠的技术动态概览。 相关链接: * Kimi-K3 Releases on HuggingFace 7/27 * PGSimCity - How PostgreSQL Works * French firefighters face 'pyrocumulonimbus' for first time * We have proof automation now * US citizen charged after GrapheneOS phone wipes during airport search * Show HN: Physically accurate black hole you can put in your room * Scriptc by Vercel: TypeScript-to-Native compiler, no JavaScript engine in binary * I wanted a clock that never needed setting. Things escalated * AI companies are shredding rare books * Fonts In Use – Find out where a font is used
260726|$8芯片跑LLM,锁机防数据抓取Hacker News 今日精选涵盖 shell 脚本技巧、移动设备安全、边缘硬件项目、AI 流量管理、微型大模型、Debain AI 政策以及法律教育的 AI 应用。 A shell colon does nothing. Use it anyway 参数校验的简写 在需要确保位置参数不为空的脚本中,常见的做法是使用 if [ -z "$1" ]; then … fi。冒号结合参数展开可以把这四行压缩为一句话:: "${1:?missing argument, aborting."}。当变量未设置或为空时,诊断信息会打印到 stderr 并导致非零退出;否则展开为变量值,后续命令仍能正常使用。 其他常见用法 * 设置默认值而不执行结果:: "${DATA_DIR:=/var/data}"。 * 清空文件:: > error.log(可叠加清空多个文件)。 * 检测文件可读/可写:( : < dataset.json ) && echo YES、( : >> result.json ) && echo YES。 * 在需要命令的地方做空操作:trap : INT、if some-command; then :; else echo "command failed"; fi。 * 配合 set -u 检查多个变量:: "$DEPLOY_ENV" "$HOST"。 社区实例 一位 Hacker News 用户把冒号用作 Git 的 sequence.editor,实现免编辑的交互式变基:riq = -c sequence.editor=: rebase --interactive。这说明冒号在任何需要命令但不需要实际执行的场景都非常实用。 GrapheneOS protections against data extraction from locked devices 安全核心机制 GrapheneOS 依赖设备的安全元件进行全盘加密;攻击者只能在 After First Unlock (AFU) 状态利用系统漏洞或暴力破解 PIN/密码。安全元件在 Android 16 QPR2 引入的速率限制机制使得失败尝试迅速变得代价高昂:第 10 次后延迟升至 4 小时,第 15 次后升至 41 天,最多仅允许 20 次不同尝试,且最近五次独特失败会被直接拒绝以避免无效消耗。 额外强化措施 * 密码长度上限提升至 128 字符,支持高熵 diceware 短语,减少对速率限制的依赖。 * 可选第二指纹 PIN:指纹尝试从 20 次降至 5 次,错误的第二因素 PIN 同样计入该上限,允许用户用长密码保护启动阶段,日常使用短 PIN 配合指纹。 * 内存分配器加固和硬件内存标记(MTE)提升对内存破坏漏洞的防护。 * 锁定状态默认阻止新 USB 连接,无活动链路时立即关闭 USB 数据。 * 锁定自动重启计时器(最早 2021 年 6 月推出)可设定 10 分钟至 72 小时,重启时清零内存返回到 Before First Unlock (BFU) 状态,随后被 iOS 18.1 和 Android 16 的高级防护模式采用。 * 次要用户和私密空间拥有独立加密密钥,可通过 “end session” 切换到 BFU 而不重耗,但仍建议完整重启以清除 RAM 和阻止安全元件更新。 * 胁迫 PIN/密码在任何认证提示下触发完整数据擦除,覆盖锁屏、系统设置及指纹第二因素。 实际效果 上述层次结构使得在没有用户明确配合的情况下,从锁定设备提取数据在实务上变得不可行,攻击者只能依赖漏洞利用或极慢的暴力破解,而后者在速率限制下往往不切实际。 An ESP32 based plane radar for my desk 项目定位 该开源项目把 ESP32‑C3(带 Wi‑Fi/蓝牙的低功耗 SoC)与 1.28 英寸圆形屏幕结合,实现接收附近 ADS‑B 信号并把飞机以距离和方位绘制在屏幕上的微型雷达。 核心能力 * 软件通过 ESPHome 网页刷写工具快速固件更新,OTA 更新同样支持。 * 飞机数据经解析后显示尾号、呼号、'origine‑destination'、机型(如 B737‑800)以及本地天气、温度、湿度和时间。 * 用户可通过网页界面修改经纬度、调节单位、跑道显示、时间制式以及字体大小(默认放大 10%,可通过滑块进一步调节 80‑130%)。 * 未来计划迁移到更大屏幕并设计更宽容的 3D 打印外壳。 使用场景 适合办公桌或实验室的爱好者随时监视周边航班,也可作为教学演示 ADS‑B 技术的便携设备。项目全部源码和硬件清单在 GitHub 公开,降低了自行构建的门槛。 Cloudflare's new AI traffic options for customers 新闻概述 Cloudflare 在其“内容独立日”更新中推出细分的 AI 爬虫管理,把以前“一键阻止 AI 机器人”拆分为 Search、Agent、Training 三类,让站点所有者可分别设置放行或阻止规则。 关键特性 * BotBase:可搜索的机器人数据库,直接在仪表盘展示已知爬虫及其归属(Search/Agent/Training等),并记录行为(扫描、索引、训练等),为后续细粒度控制提供依据。 * content‑use 信号:可在 robots.txt 中设置 immediate、reference(默认)或 full,表达站点所有者对内容使用方式的偏好;若爬虫违背该偏好,其验证状态可能被撤销,从而失去默认放行权。 * 验证爬虫规则调整:验证标签仅表示该爬虫在其申请类别下可被允许,实际放行仍受站点对应类别的允许/阻止策略决定。 * 传递信任:利用 HTTP Forwarded 头(RFC 7239)保持站点对操作方的信任即使经过多层代理,站点可声明 Forwarded: for="openai";use="reference" 以表明内容使用方式。 * 默认策略变更:从 2026‑9‑15 开始,新加入 Cloudflare 域名在展示广告的页面默认阻止 Training 和 Agent 爬虫,Search 保持默认允许;多用途爬虫(如 Googlebot)遵循最严格适用规则,站点所有者可在安全设置选择保持旧配置(“不更改”)。 行业影响 站点所有者获得了更透明、可细分的工具来决定 AI 系统如何使用其内容,同时保持了搜索流量的自然回流,减少了训练和代理爬虫对广告页面的干扰。 Running a 28.9M parameter LLM on an $8 microcontroller 技术亮点 作者在售价约 8 美元的 ESP32‑S3 上成功运行了一个含 28.9M 参数的语言模型,芯片具备 512 KB SRAM、8 MB PSRAM 和 16 MB flash,模型在完全离线的情况下产生约 9.5 tokens/秒。 核心实现 * 使用 Per‑Layer Embeddings 技术(源自 Google Gemma),把大约 25 M 参数保存在慢速 flash 中,只留少量“思考”核心在快速 SRAM,每次推理仅需从 flash 读取约 450 字节(相当于嵌入表的六行)。 * 模型在 TinyStories 数据集上训练,能够生成连贯的短故事,但因推理核心规模有限,无法回答问题、遵循指令、编写代码或回忆事实知识。 * 完整固件、接线图和刷写说明位于仓库的 firmware/esp32_llm/README.md,训练、消融和量化代码在 src/ 与 experiments/,详细方法和结果在 RESULTS.md。 实际意义 该演示表明即使在极其受限的微控制器上,也可以通过把大部分参数置于闪存并在需要时进行少量读取,实现可用的本地语言生成,为完全离线的边缘 AI 设备提供了一条可行路径。 LLM Usage in Debian: Three Proposals 核心观点 Debian 正在就大语言模型(LLM)辅助的贡献进行全体投票,共有四个方案: * Proposal A:完全禁止在 Debian 中使用 LLM 生成的任何直接贡献(代码、文档、翻译等)。 * Proposal B:允许 AI 辅助贡献,前提是遵守工具法律兼容性、许可证署名、全部责任、使用披露、批量变更的人工监督以及保密要求。 * Proposal C:主张在实际中尽量避免使用 LLM,仅作为行为准则而非强制禁令,强调人工撰写的交流和决策文件。 * Proposal D:承认 AI 已被使用,选择在 Debian 特定工作上制定使用指南,而不实施全面禁令。 论证逻辑 支持禁令的一方指出:LLM 输出的版权状态不明确,可能掺入训练数据中的许可条款;其准确性和可靠性难以保证,尤其在 Debian 对包装一致性和质量有严格要求的场景;依赖 LLM 会对审查者造成额外负担,阻碍新成员学习 Debian 流程;此外,LLM 公司在训练数据收集时常忽视 robots.cn,构成对公共网络的滥用,且耗能巨大。 允许方则认为:全面禁令难以执行,且已有社区成员发现 AI 工具在特定任务上有帮助;通过明确的披露和责任机制可以兼顾创新与项目稳定性。 社区倾向的方案则强调:即使不能彻底禁止,也应鼓励尽量减少依赖,并在必要时强制披露,以维护透明度和人工贡献的价值。 延伸思考 无论最终采用哪条路线,Debian 的决定将影响其他自由软件项目对 AI 生成内容的态度。执行层面的挑战主要在于如何判定贡献是否真正使用了 LLM,以及如何在不增加审查负担的情况下确保合规。讨论还涉及到对开源许可证兼容性的审查以及对项目长期声誉的保护。 Rethinking legal education in the AI era 战略愿景 芝加哥大学法学院提出三个主题来应对 AI 对法律教育的冲击: 1. 开发 AI‑resilient 教学与评估:确保学生不依赖 AI 捷径,而是通过勤奋参与培养批判性思维和专业判断。 2. 强调“本质人类”技能:口头辩护、战略判断、批判性思维以及与客户和利益相关者建立关系等能力仍将是人类的核心竞争力。 3. 教授负责任、有效且合乎道德的 AI 使用:让学生不仅会用当前工具,还具备随技术演进而适用的分析能力和理论工具箱。 实施举措 * 必修 1L 核心课:禁止使用笔记本电脑、平板和手机;课堂只允许特定情况下的电子设备(如记录员或投票),考试采取闭卷无网络形式,并继续强调苏格拉底式提问。 * 1L 法律研究与写作(LRW):把不使用 AI 的写作作为基础,再叠加使用 AI 进行研究、修改和草稿迭代;要求学生和导师共同审查写作与 AI 输出,培养学生自行评估 AI 工作的能力。 * 选修课程:鼓励教师尝试不同的 AI‑resilient 教学形式,如小组项目、口头报告、同伴反馈以及自行研发的聊天机器人或练习题生成器。 * 高阶写作要求:在 substantial research paper (SRP) 中加入强制性的线下口头答辩,学生需在提交完整稿后面对教授当面回答有关论证和影响的问题,这一环节既能检验学生思维,也能锻炼实际法律实践中当众解释观点的技能。 * 临床教育:为诊所配备通用及专门的法律 AI 工具,制定各诊所的使用政策,确保学生在真实客户面前既能使用 AI 再能够在不依赖 AI 的情况下进行工作。 后续考量 法学院承诺保持政策透明,在 syllabus 和课堂上明确说明;通过与雇主、科技公司和定期内部交流保持对新 AI 工具的了解;并会定期征求教师、学生和校友的反馈,以便随技术演进及时修订方案。这三项原则——透明、保持更新、持续审视——旨在使法律教育在 AI 时代既不过度依赖技术,也不失去对核心律师素质的培养。 相关链接: * Kill The Cookie Banner * A shell colon does nothing. Use it anyway * GrapheneOS protections against data extraction from locked devices * An ESP32 based plane radar for my desk * Cloudflare's new AI traffic options for customers * DeepSeek pause fundraise after comments on compute gap to US leaked (transcript) [pdf] * Inflect-Micro-v2: complete voice in 9.36M parameters * Running a 28.9M parameter LLM on an $8 microcontroller * LLM Usage in Debian: Three Proposals * Rethinking legal education in the AI era
260725|抹香鲸吹泡泡睡,纽约公寓 水培Android May Soon Restrict On-Device ADB 提议背景 Google IssueTracker 中的一项功能请求希望让 ADB 服务器(ADBD)仅绑定到指定网络接口,以减少暴露面。该请求源于 CVE‑2026-0073 暴露的 Wireless ADB 认证绕过漏洞。 争议点 ADB 核心维护者建议仅允许 wlan0 接口,这将断开设备上的 ADB(On‑Device ADB)、VPN、以太网等多种合法使用方式。维护者认为 On‑Device ADB 主要是恶意行为的入口,但社区指出恶意应用无法自行启动 ADBD,利用仍需人工步骤。 社区建议 许多开发者在 HN 讨论中主张将此改为可持久化的用户开关,既保留对 Shizuku、Termux 等工具的使用,又能在需要时关闭。他们强调任何默认阻止都应伴随明确的恢复机制,以免破坏现有工作流。 GC and Exceptions in Wasmtime GC 实现细节 Wasmtime 采用 Cheney‑style 半空间复制收集器,把 GC 堆映射到 WebAssembly 线性内存中。引用采用 32 位索引而非原生指针,提升安全性与缓存利用率。分配仅需指针碰撞,无读写屏障;收集时将活动对象复制到新半空间并更新根指针。 异常机制 引入 Wasm Exceptions 后,throw/try‑catch 取代了自定义调用约定的返回码检测。运行时可使用经典展开(unwinding),常规路径开销几乎为零,因而提升执行速度并降低 .wasm 体积。 性能与可移植性 目前重点放在正确性上,性能仍未达到 V8 或 SpiderMonkey 级别。设计适用于大量短生命周期的 Wasm 实例(横向扩展场景)。后续工作包括编译器别名分析与 GC 类型信息结合,以及在组件模型中原型化 GC 集成,以使垃圾收集语言成为第一类公民。 Opus 5 is currently #1 on Artificial Analysis Intelligence Leaderboard 智力得分领先 根据 Artificial Analysis Intelligence Index v4.1,Claude Opus 5(max effort 和 xhigh effort)位列榜首,紧随其后的是 Claude Fable 5 和 GPT‑5.6 Sol。该指数融合九项子评估(如 GDPval‑AA、τ³‑Banking、Humanity’s Last Exam 等),得分越高表示整体质量越好。 速度与延迟 在输出速度方面,Mercury 2 最高约 902 tokens/s;延迟最低为 Gemini 2.5 Flash‑Lite(~0.34 s)和 Command A+(~0.42 s),反映模型首 token 响应时间(包括推理模型的“思考”时间)。 价格与上下文窗口 价格最低的模型为 Devstral 2 和 North Mini Code(每百万 token $0.00),上下文窗口最大的是 Llama 4 Scout(10M tokens)和 Grok 4.20 0309(2M tokens),远超常见的 Gemini 1.5 Pro 等限制。 Building a Tiny 3D Renderer for a Tiny Handheld 渲染挑战 Playdate 硬件无 GPU、无 z‑buffer、无纹理映射单元,所有变换、投影、裁剪、着色和像素写入必须由 CPU 完成。其 1‑bit 黑白屏幕进一步限制了颜色表达。 关键技术 * 使用 Quake BSP 地图,借助 TrenchBroom 和 ericw‑tools 预计算 PVS(潜在可见集合),大幅减少 rasterization 前的开销。 * 引入 16‑bit reciprocal 深度缓存(z‑buffer),通过插值 1/z、u/z、v/z 实现视角正确的纹理映射,仅每若干像素计算完整倒数以平衡精度与性能。 * 采用 8×8 Bayer 阵列 dithering 在 1‑bit 屏幕上模拟灰度,辅以粗轮廓和简单纹理(受 Return of the Obra Dinn 与 Jet Set Radio 启发)提升可读性。 优化成果 * 开启半分辨率渲染(内部 200×120 再拉伸至 400×240),得到显著帧率提升。 * 使用针对 Cortex‑M7 的编译器标志和手写数学函数,减小二进制体积并改善缓存命中。 * 通过热区宏(PD_HOT、PD_FORCEINLINE)将关键代码对齐并内联,降低函数调用开销。 开发者报告该渲染器已足够用于原型游戏玩法,后续可继续探索机制与手感。 An old patent inspired the new “Y‑zipper”, a three‑sided fastener 专利来源 概念源自 MIT 教授 Bill Freeman 于 1985 年的专利:三条带木齿通过皮带相连,滑动块可形成刚性管。近四十年后,CSAIL 研究团队复现该理念,使用 PLA(硬可降解)和 TPU(柔韧弹性体)通过 3D 打印制造 Y‑zipper。 核心能力 用户可在软件中自定义带长、弯曲方向(直、拱形、弹簧形、扭形),打印件在未拉链时呈三条触手状的鱿鱼形,拉链后瞬间收束为紧凑棒状。这种刚柔可切换的特性使其适用于快速组装(如帐篷一分钟二十秒搭建)、医疗夹板日间松紧夜间收紧,亦能驱动适配型机器人或动态艺术装置。 使用场景 耐久性测试表明在 18000 次拉链循环后失效,有限元模型显示弹性结构能有效分散应力。研究者设想更强金属版本或更大尺寸,用于太空样本夹具、救援避难所或医疗器械。项目在 ACM CHI 会议上展出,获专家肯定为软硬结合的典范。 相关链接: * Android May Soon Restrict On-Device ADB * GC and Exceptions in Wasmtime * Opus 5 is currently #1 on Artificial Analysis Intelligence Leaderboard * Hannah Fry Wins the Leelavati Prize in 2026 for Mathematics Outreach * Building a Tiny 3D Renderer for a Tiny Handheld * Sperm Whales blow bubbles to achieve restful, vertical sleep * Stolen Buttons * An old patent inspired the new "Y-zipper", a three-sided fastener * NYC Apartment Aquaponics * Taylor Farms Called White House to Try to Delay Cyclospora Recall
260724|Claude大模型,印度私营火箭入轨今日精选内容聚焦于前沿AI模型发布与软件质量反思。Anthropic 与 Black Forest Labs 接连发布强大模型,而一个摄像头固件安全事件与一篇关于AI时代软件质量的反思文章则提供了重要的警示与思考。 Claude Opus 5 发布:思考深入且成本更优 核心亮点 Anthropic 发布 Claude Opus 5 大语言模型,定位为“思考深入且主动”的模型。在多项基准测试中接近更强但成本更高的 Claude Fable 5 的智能水平,而价格仅为其一半。 关键特性 * 在代码和知识工作评测(如 Frontier‑Bench 和 GDPval‑AA)上成为新的 state‑of‑the‑art * 在 Frontier‑Bench v0.1(代码工程基准)上表现超过所有其他模型 * 在 OSWorld 2.0(电脑使用基准)上,任何给定成本下均优于其他模型 * 在生命科学评测中,有机化学任务比 Opus 4.8 高出 10.2 个百分点,蛋白质功能预测任务高出 7.7 个百分点 * 自动行为审计显示总体错位行为得分最低(2.3),遵守 Claude Constitution 程度优于其他模型 实际影响 * 取代 Opus 4.8 成为 Claude Max 的默认模型和 Claude Pro 的最强模型 * 定价保持不变:输入 token 5 美元/百万,输出 token 25 美元/百万 * 早期用户反馈显示其能自主构建计算机视觉管道进行3D重建,进行真实Bug根因分析,构建实时行情馈送等 * 企业及研究者可通过 Cyber Verification Program 获得限制较少的版本进行受限的网络安全工作 FLUX 3 多模态基础模型发布:统一图像视频音频理解 核心亮点 Black Forest Labs 发布 FLUX 3,这是一个单一架构联合训练于图像、视频和音频的多模态基础模型。它学习世界的统一表示:物体如何结合、事物如何运动以及事件如何发声。 关键特性 * 基于 Self-Flow 方法并扩大计算和数据规模 * 视频能力:生成最多20秒带原生音频的视频片段,包括文本到视频、图像到视频等多种模式 * 图像能力:跨风格、宽高比分辨率合成和编辑图像,处理复杂提示和多语言文本生成方面有所改进 * 动作能力:通过两条路径扩展世界理解到动作预测:(1)FLUX 3 原生动作预测,(2)使用预训练视频骨干作为动力学感知基础用于专门动作模型 * 发布计划:分阶段推出 FLUX 3 Video、FLUX-mimic 和 FLUX 3 Action、FLUX 3 Image、FLUX 3 Dev 实际影响 * 早期评估显示 FLUX 3 Video 在头对头比较中优于多个竞品(如优于 Runway Gen‑4.5 77%、Luma Ray 3.2 93%) * 擅长捕捉面部表情、将声音与物理事件关联、在更长序列中保持角色一致性 * 为交互式图像/视频编辑、模拟、计算机使用和物理 AI 铺平道路 * 开放权重访问计划将为内容创作和动作预测提供多模态骨干 FLUX 3 x Mimic:视频动作模型在工业机器人上的应用 核心亮点 Mimic Robotics 获得 FLUX 3 早期访问权,结合其在机器学习和部署方面的专长,共同开发了 FLUX-mimic——一个基于 FLUX 3 骨干的视频动作模型。该模型能够联合预测视频帧和机器人动作。 关键特性 * 训练过程中加入动作预测后,视频生成质量初始下降最多10%,但经过3500步训练后完全恢复原有质量并新增动作预测能力 * 采用 Self-Flow 方法,使生成和表示学习在单一框架中统一,提升了世界模型质量和表示可解码性 * 基于 FLUX 3 骨干,在单个 NVIDIA RTX 5090 GPU 上可在80ms内完成输入到世界表示的计算 * 在真实工厂部署中(如Audi生产线),端到端反应时间达到101ms * 能够处理软体材料如密封件和电缆等传统自动化难以触及的任务 实际影响 * 动作解码器在冻结 FLUX 骨干的情况下仍优于以前的视觉-语言-动作模型 * 微调骨干和动作解码器后达到最先进的成功率 * 在Audi的实际应用中,解决了传统机器人难以处理的复杂软体操作任务 * 该方法表明一旦世界行为被内建在可解码表示中,教授机器人新任务只需学习任务映射而非世界运作方式 安全摄像头固件意外泄露GitHub管理员令牌 事件概述 安全研究员在 Hanwha Vision 摄像头固件中发现了硬编码的GitHub管理员访问令牌。该令牌在约30个固件文件中重复出现,具有对该组织数百个仓库的管理员权限。 背景脉络 * 令牌泄露源于构建过程:CI工作流的完整环境变量被写入构建时的UI变量中 * 研究员通过标准方法(HTW+型号解密)提取固件根文件系统后运行trufflehog发现该问题 * 固件中还包含一些指向美国国防部的IP地址环境变量(如SWARM_MASTER_NFS_ADDRESS、OTEL_ELASTIC_URL等),引发关于Hanwha与其姐公司Hanwha Defense USA关联的猜测 * 在对约500个摄像头固件的批量检查中,研究员成功提取了62%的固件,其中仅有3个包含相同的GitHub令牌 行业影响 * 研究员及时向Hanwha报告,公司在12小时内撤销了泄露的令牌 * 事件凸显了CI/CD环境中的环境变量泄露风险,特别是当构建过程不当地将敏感数据打包到客户端可访问的文件中时 * 提醒制造商需要审查固件构建流程,避免将构建环境的机密信息泄露到设备固件中 * 研究员指出此类错误频繁发生,强调需要更严格的安全实践来防止凭证意外暴露 尽管AI助手普及软件为何变得更糟 核心观点 作者认为尽管大语言模型等AI工具变得越来越强大和易用,但软件整体质量却在下降,这与人们预期的AI带来的生产力提升形成了反差。 论证逻辑 * 举出具体例子:银行应用需要多次FaceID登录才能看到确认视图、Slack窗口抢夺焦点导致误操作、LG冰箱保修申请表单提交失败、汽车娱乐系统更新后出现多种错误等 * 指出软件变得更脆弱的原因:虽然我们不断创建新的抽象、前端框架和基础设施复杂性,但“用户体验”的标准在提升而一切变得越来易碎 * 分析厂商动机:软件供应商长期关注KPI(关键绩效指标),而提高稳定性并不总是对数字有直接影响力,在演示中看起来不够激动人心 * 对比想象中的厂商态度:“本季度我们不会发布任何新功能,也没有重新设计任何东西的计划——我们将专注于修复bug。” 延伸思考 * 作者对未来持乐观态度:随着公司集体陷入AI债务,个别开发者有机会构建以前难以企及的软件 * 认为当前macOS和Windows状态下的“反叛行为”是希望的迹象,预示着这一趋势可能贯穿整个技术栈 * 强调解决方案不在于禁止AI工具,而在于改变厂商对稳定性的重视程度和开发者对工具的使用方式 相关链接: * Claude Opus 5 * Flux 3 * It's getting harder to focus every day * 98.css * India's first privately-developed rocket reaches orbit on debut launch * My security camera shipped a GitHub admin token in its login page * Flux 3 X Mimic: The Next Generation of Video-Action Models * Fields Medals 2026 * I regret migrating to Codeberg * If coding has been solved, why does software keep getting worse?
260722|英特尔EUV芯片,人工智能版权和解OverpAId – Fire your CEO. Hire the future 讽刺产品概念 OverpAId 声称用一台价值 $4,699 的 NVIDIA DGX Spark 替代 CEO,年成本从约 $2200 万美元降至几千美元。 核心功能 * 4 毫秒内完成战略决策,远超人类数周的“圈复”流程。 * 能完整阅读季报、分析师电话及股东信件,不依赖实习生制作的幻灯片。 * 不需要私人飞机、高管办公室或黄金 parachute,升级仅需更换硬件或更新日志。 实际影响 文章通过对比数据指出,若真按此方案执行,每位员工可年均获额外 $4.4 万美元奖金。评论区指出这正是对高管薪酬失衡的隐喻,提醒读者关注 CEO‑to‑worker 支付比例(约 290:1)及其对利润分配的影响。 LG to ban residential proxies from smart TV apps 事件概述 LG 宣布将暂停任何将电视变成常驻住宅代理节点的 webOS 应用,禁止开发者嵌入可将家庭网络流量出租给第三方的 SDK。 背景脉络 Spur 的研究显示,LG 商店中超过 42% 的应用和 Samsung Tizen 商店中超过 25% 的应用包含住宅代理 SDK,主要供应商为 Bright Data。这些 SDK 声称依赖用户同意和 KYC,但评论认为在电视这种非计算设备上埋藏的一键同意缺乏透明度。 行业影响 LG 的做法被视为对隐私侵犯的一次平台层面干预,评论者建议进一步在系统层面增加域名白名单或要求分层授权,以防止类似隐藏数据采集在其他消费电子产品中复现。 Intel Starts Shipping High-NA EUV Silicon 核心亮点 Intel 已在其 18A(相当于 N2)工艺上使用 ASML 第一台 High‑NA EUV 扫描仪,为 Panther Lake 笔记本处理器的部分层光刻提供支持。 关键特性 * 高数值孔径提升至 0.55,单次曝光可完成 anteriormente 需要两次或三次 Low‑NA 拼接的图案。 * 由于像场减半,完整掩模需分两半曝光并拼接,但吞吐量提升约 60%,达到约 175 片/小时。 * 单台设备成本约 3.8 亿美元,约为 Low‑NA 机器的 2‑3 倍。 实际影响 虽然目前仅用于部分层,但表明 High‑NA 已进入小批量生产,为未来更小节点(如 14A/10A)奠定基础。评论指出,若仅靠该工具替换足够多 Low‑NA 曝光,成本效益有望在 2030 前显现。 Original Apollo 11 Guidance Computer source code 项目定位 该仓库收录了阿波罗 11 号指令牌机(AGC)的原始汇编代码,分为指令舱 Comanche055 与登月舱 Luminary099 两部分,均来自硬件扫描件并经 Virtual AGC 项目校验。 核心能力 * 代码使用 yaYUL 汇编器,已在公共领域,可通过 Virtual AGC 项目编译运行。 * 提供完整的提交历史,支持社区通过 Pull Request 修正与原始扫描的出入。 * 已获超过 70k 颗星、1.4k watchers 及 7.9k 次分 fork,成为历史记载与教育资源。 使用场景 爱好者可在模拟器中重现登月任务的导航算法,教师可用其演示早期嵌入式系统与实时操作系统的设计原则,研究者则能对比当时的软件工程实践与现代安全开发流程。 Late.sh – a command-line Clubhouse for computer people 项目定位 late.sh 通过 SSH 提供一个基于终端的社交空间,用户只需 ssh late.sh 即可进入聊天、广播电台、协作 ASCII 画板等功能,身份由 SSH 公钥决定,无需密码或 OAuth。 核心能力 * 内置广播电台(chill radio、古典、嘉宾站台)、街机小游戏(2048、数独、非ogram、纸牌接龙)。 * 协作式 ASCII 画板(artboard)记录每像素贡献者并每日、每月快照,历史可在 https://late.sh/gallery 查看。 * 工作区展示在线人员的技能、状态及可接单情况,个人资料页可通过 i 键发布。 * 隐私方面仅存储公钥指纹,聊天记录存于 PostgreSQL 并与指纹绑定,支持一次性密钥以隔离风险。 使用场景 开发者可在晚间进行轻度社交、代码展示或即时协作绘图,也可作为远程面试的互动环节。评论区指出其低门槛(仅 SSH)和开源特性使其成为终端爱好者的聚集地。 Introduction to Formal Verification with Lean Part 1 问题背景 教程旨在让密码工程师通过 Lean 形式化验证经典的一次性密码(OTP)协议,以确保加密算法的正确性免受人工证明疏漏。 解决方案 * 定义比特串类型 BitString L := Vector (ZMod 2) L 以及逐位异或函数 xor。 * 证明异或的交换律、结合律、零元及自逆性,均通过 Vector.ext 逐位简化并在 ℤ₂ 上应用对应代数定理完成。 * 构造 ShannonCipher 结构体,包含加密、解密及正确性条件 ∀ k m, dec k (enc k m) = m。 * 将 One‑time Pad 实例化为 ShannonCipher,使用之前证明的异或性质验证正确性。 应用场景 读者可直接在 Lean 交互环境中跟随代码,掌握依赖类型、逐位向量操作及基本证明技巧,为后续形式化安全协议(如椭圆曲线签名)打基础。评论区认为此类教程降低了形式化工具的入门门槛,有助于将验证引入日常密码开发流程。 相关链接: * OverpAId – Fire your CEO. Hire the future * LG to ban residential proxies from smart TV apps * Intel Starts Shipping High-NA EUV Silicon * Original Apollo 11 Guidance Computer source code for command and lunar modules * Late.sh – a command-line Clubhouse for computer people * Introduction to Formal Verification with Lean Part 1 * Ten Steps Towards Happiness (2015) * Judge approves $1.5B Anthropic settlement for pirated books used to train Claude * Passkeys were invented by engineers with zero understanding of consumer brain * Show HN: Bento - An entire PowerPoint in one HTML file (edit+view+data+collab)
260721|美科巨头隐债1.65T,自制CPU跑Doom火爆谁在害怕中国模型? 核心观点 开放权重模型的成本不在于下载权重,而在于推理时的边际成本(COGS),这决定了在智能即将成为商品时谁能盈利。 论证逻辑 * R&D 是固定费用,与收入无关;只有推理费用随收入线性增长。 * 不同模型在达到相同答案时所需的 token 数不同,导致实际 COGS 差异。 * 当供应受限时,高价模型(如 Anthropic、OpenAI)获得溢价;当算力充足时,成本结构优势将决定市场份额。 延伸思考 作者认为目前的恐慌多源于算力瓶颈,待算力丰裕后,开源模型的成本优势才会显现。同时,网络安全层面的依赖中国模型才是真正的风险点。 Jellyfin 创始人 Andrew 离开团队 事件概述 Jellyfin 项目创始人 Andrew 宣布不再参与日常开发和决策。 背景脉络 Andrew 自项目 inception 负责技术方向和社区协调,近年来项目治理逐渐转向更广泛的维护者团队。 行业影响 创始人离开不代表项目停滞;社区强调治理已去中心化,后续版本仍由志愿者驱动。此事提醒开源项目关注领导梯度和知识传递。 人类数学家被 AI 反例击败 研究发现 大语言模型生成的反例成功推翻了长期未解的 Erdős Unit Distance 联想猜想及多个代数几何猜想(如雅可比猜想)。 方法简介 * 先由 ChatGPT 提出非正式证明,再由人工验证。 * 使用 Logical Intelligence 将自然语言证明自动转化为 Lean 形式化证明,随后由 Sol/Fable 模型进一步扩展并产出百万行 Lean 代码。 * 形式化证明在 mathlib 库中通过审查,验证无误。 意义与局限 AI 辅助证明将数学家的角色从发现证明转向解释和洞察生成。随之而来的问题是:如何审阅巨量机器生成代码、训练成本以及对传统数学直觉的潜在侵蚀。 五家美国科技巨头隐性债务飙升至 1.65 万亿美元 事件概述 Nikkei 调研显示,Meta、Oracle 等公司因 AI 基础设施租赁和 GPU 长期采购形成的表外负债在四年内增长八倍,达到约 1.65 万亿美元。 背景脉络 这些义务主要来自数据中心租约和芯片供应合同,计入利润表之前不计入传统负债,导致公开财报低估真实杠杆。 行业影响 投资者难以仅凭资产负债表评估风险;随着 AI 投入继续扩大,表内与表外债务的差距将进一步扩大,财务透明度成为监管和市场关注点。 Incremental:增量计算库 项目定位 Incremental 是一个 OCaml 库,提供自增量调整计算的抽象,使程序在输入变化时能够局部更新输出。 核心能力 * 依赖图自动追踪,只重新计算受影响的节点。 * 支持批处理、缓存和并发调度,适用于 GUI 视图、电子表格式计算以及源数据派生的同步任务。 使用场景 * 构建对数据变化敏感的大型表格引擎。 * 在图形应用中维护随源数据同步的视图层。 * 实现需要实时反馈的过滤或映射转换,保证派生数据始终与源数据保持一致。 在自研 CPU 上跑 Doom 并走红 项目背景 作者用 FPGA 实现了一个五级流水线 RISC‑V 风格 CPU,最初仅使用片上 BRAM,后引入外部 DDR3 并加入指令/数据缓存以隐藏延迟。 关键优化 * 时钟从 100 MHz 提升至 125 MHz,帧率提升约 20%。 * 修复取样阶段重复 ICache 请求,帧率提升至 ~2.5 FPS。 * 加入 RV32I‑ZMMUL 乘法指令,再提升一帧。 * 将写屏路径直接绑定到 VGA BRAM 并将缓存命中延迟从两周期减为一周期,帧率达 ~6.7 FPS。 * 将硬件计时器 MMIO 指针标记为 volatile,防止编译器优化掉,最终实现 15–20 FPS 的可玩帧率。 应用场景 该展示表明在严格资源约束下,通过缓存流水线和编译器配合仍可实现交互式图形应用,为教育或爱好者提供了可复现的硬件软件协同案例。 相关链接: * Who's afraid of Chinese models? * Jellyfin founder Andrew leaves team * Human mathematicians are being outcounterexampled * Five US tech giants' hidden debts soar to $1.65T on opaque AI funding * Incremental – A library for incremental computations * Running Doom on Our Custom CPU and Going Viral * Flock Credibility Lost as It Repeatedly Lies to City Councils, Police, & Public * Show HN: Immersive Gaussian Splat tour of grace cathedral, San Francisco * I wrote an bash enumerator because I was sick of xargs * The Psychology of Software Teams
260720|雅可比猜想被破,噪声变答案Hacker News今日精选呈现机器人基础模型突破、隐私浏览器更新以及跨学科技术话题。 Xiaomi-Robotics-1 研究发现:无具身预训练突破数据限制 Xiaomi-Robotics-1 利用 100,000 小时 embodiment-free UMI 轨迹进行大规模预训练,覆盖 1,700 多种真实世界场景。这种方法无需收集特定机器人数据,避免了 Embodiment 依赖的瓶颈,为策略模型提供了广泛的基础表示。 方法:两阶段训练范式 预训练阶段使用自动标注管道将长视频分割为片段,由视觉语言模型描述场景状态转换,使模型学习从语言描述生成动作。后训练阶段通过真实机器人数据进行具身对齐(匹配特定机器人物理形式)和指令对齐(将自然语言指令映射到动作执行),将预训练的通用能力转移到具体机器人任务。 意义:可扩展的机器人基础模型 随着预训练数据和模型规模增加,真实机器人成功率稳步提升,显示出清晰的扩展定律。该模型能从少量数据(平均每任务不到10小时演示)适应新任务,并在四个主流仿真基准上达到状态最优,证明了具身无关预训练后真实机器人微调的有效性。 The Zen of Parallel Programming 核心观点:协调能力决定实际产出 增加算力本身不会自动产生更多有用工作;关键在于如何协调已有的计算资源。就像人类智力、情感和身体各部分需诚实沟通才能协同工作,否则内部争执会导致效率低下甚至倦怠。 论证逻辑:从并行编程到人类禅思 并行编程要求任务被分解为能通信、同步和共享负载的部分;任何处理器过载或资源争夺都会降低整体效率。这类似于禅宗“整心活动”概念——让经历被完整感知和处理,而非执着于未完成的“残留过程”,后者如同未终止的后台进程消耗注意力。 延伸思考:内部协同是瓶颈 也许我们的根本限制不是算力不足,而是内部资源分裂。无论是多核处理器还是人类心智,真正的瓶颈在于各组成部分之间的协调效率,而非单纯的资源量。 Orion Browser by Kagi 核心亮点:速度、隐私与扩展兼容性三者兼得 Orion 是一款从零开始构建的网页浏览器,原生使用 WebKit 引擎,承诺零遥测、内置广告拦截和防追踪,同时不收集 AI 数据或进行隐藏监视。它旨在提供卓越性能、广泛的扩展支持以及绝对用户隐私。 关键特性:真正的跨浏览器扩展支持与深度定制 Orion 是唯一同时支持 Safari、Chrome 和 Firefox 扩展的浏览器,团队已精选 20 款保证可用的扩展以减少使用麻烦。浏览器支持几乎无限的自定义,远超主题更改,允许用户配置每一个细节;内置 Kagi 服务实现搜索、翻译和浏览工具的无缝集成。 实际影响:跨平台可用且社区驱动 目前提供 macOS、iOS/iPadOS 和 Linux(Beta)版本;Windows 版正处于 Alpha 开发阶段。媒体评价称其在 macOS 上比 Safari 更快更省电,资源占用少同时支持多浏览器扩展。为保持独立开发,Orion 完全由用户资助,不含广告或第三方交易,用户可通过订阅或一次性购买终生许可证支持发展。 Claude Fable produced a counterexample to the Jacobian Conjecture 研究发现:AI 生成的多项式映射反驳经典猜想 Claude Fable(AI 系统)构造了一个从 ℂ³ 到 ℂ³ 的多项式映射 F(x,y,z)=((1+xy)³z + y²(1+xy)(4+3xy), y+3x(1+xy)²z+3xy²(4+3xy), 2x−3x²y−x³z),其雅可比行列式恒为 -2(非常数常数),却将三个不同点 (0,0,−¼),(1,−3/2,13/2) 和 (−1,3/2,13/2) 映射到同一图像 (−¼,0,0)。由于该映射不是单射,它直接违背了雅可比猜想——该猜想断言雅可比行列式处处非零的多项式映射必须存在多项式逆映射。 方法简介:基于梯度的局限性思考 正如 HN 评论者 Grok 所指出的,这个反例有效是因为雅可比行列式只捕捉局部信息:梯度-based 方法可能无法检测到由非单射映射引起的“全局碰撞”,其中语义不同的输入可能被映射到相同输出,除非训练数据中显式包含了不同目标。这也为理解 LLM 幻觉提供了视角——训练中的局部梯度更新可能合并了本应区分的概念。 意义与局限:引发更广泛的数学讨论 该反例于 2026 年 7 月 19 日被添加到维基百科雅可比猜想页面后得到确认。虽然有些评论讨论其对 Dixmier 假设(关于 Weyl 代数单纯性)或 Poisson 假设(关于 polynomial Poisson 映射)的潜在影响,但雅可比猜想在此领域中研究更深入。构造方法是否与 Zhang 涉及素数小间距的工作相关仍是开放问题,但 AI 能这么快反驳一个 150 年旧猜想凸显了自动化数学发现的潜力。 Moonshine: Lets you stream games from your PC to any device running Moonlight 项目定位:Linux 专属的 GameStream 流媒体服务器 Moonshine 让你从 PC 向任何运行 Moonlight(NVIDIA GameStream 协议的开源客户端)的设备流式传输游戏,键盘、鼠标和控制器输入会被发回主机,实现远程游玩体验,如同坐在电脑前。 核心能力:隔离会话与硬件加速支持 每个流媒体会话在独立的合成器中运行,完全隔离于桌面环境,因此主机 PC 在流媒体期间仍可用于其他任务。无需物理监视器——可在无头服务器上工作,无需 HDMI 虚拟插头。支持 H.264、H.265 和 AV1(实验性)硬件视频编码,真实 10-bit HDR 流媒体,完整的鼠标、键盘和游戏控制器输入(含运动、触控板和触觉反馈),以及低延迟 Opus 编码的立体声和环绕声(5.1/7.1)音频流。 使用场景:从远程游戏到专业流媒体 适用于在头less Linux 系统上流媒体游戏;通过 Tailscale、WireGuard 或 ZeroTier 等 VPN 进行互联网流媒体(因底层 GameStream 协议缺乏完整应用级加密)。安装简化:通过 AUR 在 Arch Linux 上获取,或从源码编译依赖项如 Rust、Vulkan 等。配置通过 TOML 文件管理应用程序对及其隔离会话。 Talk: The Art of Braiding Algorithms 核心观点:弦 figures 作为算法艺术的框架 弦 figures——用线编织出的图案——可以被视为算法艺术。本次研讨会探讨了 braid groups(描述辫子结构的代数工具)如何用于分析弦 figure 算法,强调了符号系统(notation)在将直觉操作形式化中的作用。 论证逻辑:从动手实践到理论反思 参与者使用真实线进行动手探索,结合引用的 Birman 和 Menasco(1992)论文“Studying links via closed braids”,该工作在最高 generality 层面回答了生成所有可能弦 figures 所需的基本动作。讨论延伸到数学符号如何塑造我们的思考:清晰的 notation 不仅记录过程,还能揭示底层结构,正如闭合辫子在链接理论中的应用所示。 延伸思考:notation 在数学创造中的角色 研讨会促使反思:我们多少次因为符号系统的限制而近似或简化概念?就像弦 figures 需要特定记号才能被分析一样,数学进步往往依赖于能精准捕捉现象的表示法。这也暗示了跨学科潜力——将编织艺术的直觉形式化可能启发其他领域的建模方法。 Biggest Probabilistic Computer Turns Noise into Answers 事件概述:18 块 FPGA 构建百万 p-bits 机器 研究人员将十八个现场可编程门阵列(FPGA)互连,创建了截至目前规模最大的概率计算机,拥有一百万个概率位(p-bits)。该机器能够以每秒超过一万亿次的速度翻转这些 p-bits,展示了概率计算的潜力。 背景脉络:从小规模到可扩展的挑战 概率计算机使用 p-bits——在 0 和 1 之间以可调概率翻转的位——来处理概率问题,如优化任务,同时避免量子计算的硬件复杂性。之前的尝试受限于单芯片设计(例如 2019 年的 8 p-bits 或 2023 年的 7,200 p-bits),因为将多个芯片网络化时,在导线上同步概率波动具有挑战性,引发了对规模扩展性的质疑。 行业影响:可预测的互连规则铺平扩展之路 新研究发现了一条直接可用的设计原则:概率计算机中不同芯片之间数据交换的速率必须高于某个阈值,才能使整个系统表现为单一协调单元。低于此阈值时,速度和准确性会出现权衡。这一发现意味着概率计算机可以像传统计算机一样,通过增加芯片数量实现任意规模扩展,未来路径包括使用专用硬件如磁通隧道结(更节能)或 CMOS 与磁阻随机访问存储器(MRAM)的组合。 When can a power company take your land for data center infrastructure? 事件概述:征用权在数据中心扩张中的适用性 文章探讨了在美国,电力公司何时可以使用征用权(政府为公共用途夺取私有财产的权力,需提供公平补偿)来为数据中心基础设施获取土地,特别是架设输电线路以满足不断增长的能源需求。 背景脉络:数据中心增长与社区阻力 美国已有超过 3,000 个数据中心,另有 1,500 个在建设中;根据 Pew Research Center 分析,这些中心在 2024 年消耗了全国总电量的 4% 以上,且需求持续上升。社区普遍反对数据中心建设,原因包括更高的公用事业账单、污染、噪音和绿地损失。为支持这些中心,输电线路常需跨越私人土地,引发土地所有者的反对。 行业影响:公共使用标准的解释与限制 虽然美国最高法院在 Kelo v. City of New London 案中宽松地解释了“公共使用”(允许经济开发作为依据),但多个州最高法院(如密歇根、俄亥俄和俄克拉荷马)通过自身宪法更严格地限制了征用权,禁止仅为了经济发展而将财产转让给另一方私人实体。然而,当输电线路旨在改善州内电网可靠性并直接服务于本地客户时,法院更可能支持征用行动;若线路跨州且不惠及本州用户(如 1984 年密西西比州案例),则可能被否决。因此,数据中心相关的征用案件结果取决于其是否真正服务于当地公众利益。 LoRA Speedrun – a public wall-clock leaderboard for fine-tuning techniques 项目定位:标准化微调技术比较平台 LoRA Speedrun 是一个公开的壁钟时间排行榜,旨在为基于 LoRA(低秩适应)的微调方法提供公平竞技场。它借鉴了 modded-nanogpt 速run 的模式,使用冻结任务、固定硬件(单个 NVIDIA L40S GPU 通过 Modal 沙盒)和可验证流程,确保结果仅因算法差异而异。 核心能力:双轨道设计与严格验证 两个独立轨道防止过拟合:Track 1 要求将 Qwen2.5-1.5B 模型在 GSM8K 基准上推至 ≥57.0% 精确匹配率;Track 2 要求将 SmolLM2-1.7B 在 SQuAD v1.1 上推至 ≥75.5% 精确匹配率。只有同时在这两个轨道上表现优异的方法才被视为通用。可验证流程包括:提交 PR 经过静态检查和 Claude 安全筛除;维护者触发三次 fresh seed 运行在受阻 Modal 环境中;官方时间为三次测量的平均壁钟时间,同时审计适配器参数数量和数据哈希以防篡改。 使用场景:推动可重复的微调研究 研究者可通过克隆仓库、配置 Modal 并在本地或云端运行验证脚本参与。排行榜当前纪录显示:Track 1 最佳为 6 分 05 秒(通过序列打包和仅损失掩码);Track 2 最佳为 11 分 08 秒(基准 LoRA 在首 20k 样本上)。该平台揭示了未被探索的优化空间,如数据挖掘、注意力打包技巧或交叉熵融合,促使社区在算法效率和内核优化上公开竞争。 Korg PS-3300 is back 核心亮点:传奇合成器的手工復刻 Korg PS-3300 合成器——原版在 1977 至 1981 年间产量不足 50 台,被视为音乐史上的稀有“幽灵” Instruments——如今以忠實復刻版回归。由原创作者 Fumio Mieda 领衔,并借助 Korg 在 ARP 2600 FS 等项目上的经验,新版本在保留原作音色灵魂的同时融入现代可靠性。 关键特性:完整复刻的模块化架构与调音仪式 每台单元均在日本手工打造,核心由三个 PSU-3301 声音生成器组成,每个包含电压控制振荡器(VCO)、电压控制滤波器(VCF)、电压控制放大器(VCA)和包络发生器(EG),辅以两个低频振荡器(LFO)、三个可调带通滤波器(共振器)和十二个独立微调旋钮。音色塑造工具包括三带共振器(可通过 LFO 调制实现 phaser、wah 等效果)。独有的“调音仪式”允许用户连接外部调音器,在演奏前稳定音高——致敬原作对温湿度敏感的特性。 实际影响:限量发行的音乐历史载体 新 PS-3300 将分批次在英国发放,每台配备定制硬壳盒及滚轮,确保安全存储与运输。其丰富的音色板——相当于 144 台 MS-20 单元的组合——以及实验调音能力,为合成器爱好者提供了探索前卫声音设计的渠道。尽管产量极低,但结构复杂(组件数量约为 KRONOS 的十倍)和手工艺的确保了每台unit 作为可收藏的音乐科技制品的价值。 相关链接: * Xiaomi-Robotics-1 * The Zen of Parallel Programming * Orion Browser by Kagi * Claude Fable produced a counterexample to the Jacobian Conjecture * Moonshine: Lets you stream games from your PC to any device running Moonlight * Talk: The Art of Braiding Algorithms * Biggest Probabilistic Computer Turns Noise into Answers * When can a power company take your land for data center infrastructure? * LoRA Speedrun – a public wall-clock leaderboard for fine-tuning techniques * Korg PS-3300 is back