今日精选内容聚焦于前沿AI模型发布与软件质量反思。Anthropic 与 Black Forest Labs 接连发布强大模型,而一个摄像头固件安全事件与一篇关于AI时代软件质量的反思文章则提供了重要的警示与思考。
Claude Opus 5 发布:思考深入且成本更优
核心亮点
Anthropic 发布 Claude Opus 5 大语言模型,定位为“思考深入且主动”的模型。在多项基准测试中接近更强但成本更高的 Claude Fable 5 的智能水平,而价格仅为其一半。
关键特性
- 在代码和知识工作评测(如 Frontier‑Bench 和 GDPval‑AA)上成为新的 state‑of‑the‑art
- 在 Frontier‑Bench v0.1(代码工程基准)上表现超过所有其他模型
- 在 OSWorld 2.0(电脑使用基准)上,任何给定成本下均优于其他模型
- 在生命科学评测中,有机化学任务比 Opus 4.8 高出 10.2 个百分点,蛋白质功能预测任务高出 7.7 个百分点
- 自动行为审计显示总体错位行为得分最低(2.3),遵守 Claude Constitution 程度优于其他模型
实际影响
- 取代 Opus 4.8 成为 Claude Max 的默认模型和 Claude Pro 的最强模型
- 定价保持不变:输入 token 5 美元/百万,输出 token 25 美元/百万
- 早期用户反馈显示其能自主构建计算机视觉管道进行3D重建,进行真实Bug根因分析,构建实时行情馈送等
- 企业及研究者可通过 Cyber Verification Program 获得限制较少的版本进行受限的网络安全工作
FLUX 3 多模态基础模型发布:统一图像视频音频理解
核心亮点
Black Forest Labs 发布 FLUX 3,这是一个单一架构联合训练于图像、视频和音频的多模态基础模型。它学习世界的统一表示:物体如何结合、事物如何运动以及事件如何发声。
关键特性
- 基于 Self-Flow 方法并扩大计算和数据规模
- 视频能力:生成最多20秒带原生音频的视频片段,包括文本到视频、图像到视频等多种模式
- 图像能力:跨风格、宽高比分辨率合成和编辑图像,处理复杂提示和多语言文本生成方面有所改进
- 动作能力:通过两条路径扩展世界理解到动作预测:(1)FLUX 3 原生动作预测,(2)使用预训练视频骨干作为动力学感知基础用于专门动作模型
- 发布计划:分阶段推出 FLUX 3 Video、FLUX-mimic 和 FLUX 3 Action、FLUX 3 Image、FLUX 3 Dev
实际影响
- 早期评估显示 FLUX 3 Video 在头对头比较中优于多个竞品(如优于 Runway Gen‑4.5 77%、Luma Ray 3.2 93%)
- 擅长捕捉面部表情、将声音与物理事件关联、在更长序列中保持角色一致性
- 为交互式图像/视频编辑、模拟、计算机使用和物理 AI 铺平道路
- 开放权重访问计划将为内容创作和动作预测提供多模态骨干
FLUX 3 x Mimic:视频动作模型在工业机器人上的应用
核心亮点
Mimic Robotics 获得 FLUX 3 早期访问权,结合其在机器学习和部署方面的专长,共同开发了 FLUX-mimic——一个基于 FLUX 3 骨干的视频动作模型。该模型能够联合预测视频帧和机器人动作。
关键特性
- 训练过程中加入动作预测后,视频生成质量初始下降最多10%,但经过3500步训练后完全恢复原有质量并新增动作预测能力
- 采用 Self-Flow 方法,使生成和表示学习在单一框架中统一,提升了世界模型质量和表示可解码性
- 基于 FLUX 3 骨干,在单个 NVIDIA RTX 5090 GPU 上可在80ms内完成输入到世界表示的计算
- 在真实工厂部署中(如Audi生产线),端到端反应时间达到101ms
- 能够处理软体材料如密封件和电缆等传统自动化难以触及的任务
实际影响
- 动作解码器在冻结 FLUX 骨干的情况下仍优于以前的视觉-语言-动作模型
- 微调骨干和动作解码器后达到最先进的成功率
- 在Audi的实际应用中,解决了传统机器人难以处理的复杂软体操作任务
- 该方法表明一旦世界行为被内建在可解码表示中,教授机器人新任务只需学习任务映射而非世界运作方式
安全摄像头固件意外泄露GitHub管理员令牌
事件概述
安全研究员在 Hanwha Vision 摄像头固件中发现了硬编码的GitHub管理员访问令牌。该令牌在约30个固件文件中重复出现,具有对该组织数百个仓库的管理员权限。
背景脉络
- 令牌泄露源于构建过程:CI工作流的完整环境变量被写入构建时的UI变量中
- 研究员通过标准方法(HTW+型号解密)提取固件根文件系统后运行trufflehog发现该问题
- 固件中还包含一些指向美国国防部的IP地址环境变量(如SWARM_MASTER_NFS_ADDRESS、OTEL_ELASTIC_URL等),引发关于Hanwha与其姐公司Hanwha Defense USA关联的猜测
- 在对约500个摄像头固件的批量检查中,研究员成功提取了62%的固件,其中仅有3个包含相同的GitHub令牌
行业影响
- 研究员及时向Hanwha报告,公司在12小时内撤销了泄露的令牌
- 事件凸显了CI/CD环境中的环境变量泄露风险,特别是当构建过程不当地将敏感数据打包到客户端可访问的文件中时
- 提醒制造商需要审查固件构建流程,避免将构建环境的机密信息泄露到设备固件中
- 研究员指出此类错误频繁发生,强调需要更严格的安全实践来防止凭证意外暴露
尽管AI助手普及软件为何变得更糟
核心观点
作者认为尽管大语言模型等AI工具变得越来越强大和易用,但软件整体质量却在下降,这与人们预期的AI带来的生产力提升形成了反差。
论证逻辑
- 举出具体例子:银行应用需要多次FaceID登录才能看到确认视图、Slack窗口抢夺焦点导致误操作、LG冰箱保修申请表单提交失败、汽车娱乐系统更新后出现多种错误等
- 指出软件变得更脆弱的原因:虽然我们不断创建新的抽象、前端框架和基础设施复杂性,但“用户体验”的标准在提升而一切变得越来易碎
- 分析厂商动机:软件供应商长期关注KPI(关键绩效指标),而提高稳定性并不总是对数字有直接影响力,在演示中看起来不够激动人心
- 对比想象中的厂商态度:“本季度我们不会发布任何新功能,也没有重新设计任何东西的计划——我们将专注于修复bug。”
延伸思考
- 作者对未来持乐观态度:随着公司集体陷入AI债务,个别开发者有机会构建以前难以企及的软件
- 认为当前macOS和Windows状态下的“反叛行为”是希望的迹象,预示着这一趋势可能贯穿整个技术栈
- 强调解决方案不在于禁止AI工具,而在于改变厂商对稳定性的重视程度和开发者对工具的使用方式
相关链接:
- Claude Opus 5
- Flux 3
- It's getting harder to focus every day
- 98.css
- India's first privately-developed rocket reaches orbit on debut launch
- My security camera shipped a GitHub admin token in its login page
- Flux 3 X Mimic: The Next Generation of Video-Action Models
- Fields Medals 2026
- I regret migrating to Codeberg
- If coding has been solved, why does software keep getting worse?
