EP.81 · 7×24 全球AI速报 · 2026-09-02(周三)

EP.81 · 7×24 全球AI速报 · 2026-09-02(周三)

7分钟 ·
播放数25
·
评论数0

Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1,Fable 5.1 在 Artificial Analysis 智能指数登顶,缓存读取降价 75%,整体成本最多降 45%,Terminal-Bench-Science 得分 52.6,已上线 Claude Code、Claude 平台、Google Agent Platform 和 OpenRouter。[1]

OpenAI 评定未发布模型 Astra 达到 Preparedness Framework 下的 Critical 网络安全能力阈值,是首个被评定为该级别的模型,可在少人干预下发现未知安全缺陷并构建利用方案,部分发布和开发被推迟以加强安全措施。[2]

Google DeepMind 为 Gemini 3.7 Flash 等模型推出 agentic 视频理解功能,模型动态扫描视频片段而非固定帧率,token 消耗最多降 88%,成本降 66%,准确率最多提升 7%。[3]

Meta 发布首个流式语音转写模型 Muse Voice Transcribe,在 Artificial Analysis AA-WER Streaming 榜单登顶,字错率 3.1%,语音结束后 0.16 秒出结果。[4]

NVIDIA 季度营收指引达 1080 亿美元,首次突破单季千亿大关;2027 财年半年报归母净利润 1180.1 亿美元,同比增长 161.1%;亚马逊将英伟达芯片订单增至三倍,新增 200 万颗 GPU。[5]

World Labs 发布多模态世界模型 Atlas,支持像素级相机控制与 3D 重建,被认为领先于现有评测基准。[6]

华为开源编码 Agent 工具 openJiuwen,在 SWE-bench Verified 达 82.6%,Terminal-Bench 2.1 达 87.19%,分别超过最强官方榜单成绩 3.4 和 3.39 个百分点。[7]

路透社调查显示美国 AI 数据中心出现大量虚假用电需求,用电申请超过 700 吉瓦,约为实际用电量的十倍,得州等多州出手整治。[8]

Qwen 团队发布 E-Commerce Bench,让 LLM 智能体在模拟 365 天中运营在线商店,评测 18 个前沿模型七维度表现,无单一模型全面领先。[9]

## Sources

[1] www.anthropic.com — Anthropic Claude Fable 5.1 与 Mythos 5.1 发布

[2] openai.com — OpenAI Astra Critical 级别评定

[3] deepmind.google — Gemini Agentic Video 理解

[4] x.com — Meta Muse Voice Transcribe

[5] www.ithome.com — NVIDIA 季度营收指引与财报

[6] x.com — World Labs Atlas 世界模型

[7] x.com — 华为 openJiuwen 编码 Agent

[8] www.ithome.com — 美国 AI 数据中心虚假用电

[9] x.com — Qwen E-Commerce Bench