Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1,Fable 5.1 在 Artificial Analysis 智能指数登顶,缓存读取降价 75%,整体成本最多降 45%,Terminal-Bench-Science 得分 52.6,已上线 Claude Code、Claude 平台、Google Agent Platform 和 OpenRouter。[1]
OpenAI 评定未发布模型 Astra 达到 Preparedness Framework 下的 Critical 网络安全能力阈值,是首个被评定为该级别的模型,可在少人干预下发现未知安全缺陷并构建利用方案,部分发布和开发被推迟以加强安全措施。[2]
Google DeepMind 为 Gemini 3.7 Flash 等模型推出 agentic 视频理解功能,模型动态扫描视频片段而非固定帧率,token 消耗最多降 88%,成本降 66%,准确率最多提升 7%。[3]
Meta 发布首个流式语音转写模型 Muse Voice Transcribe,在 Artificial Analysis AA-WER Streaming 榜单登顶,字错率 3.1%,语音结束后 0.16 秒出结果。[4]
NVIDIA 季度营收指引达 1080 亿美元,首次突破单季千亿大关;2027 财年半年报归母净利润 1180.1 亿美元,同比增长 161.1%;亚马逊将英伟达芯片订单增至三倍,新增 200 万颗 GPU。[5]
World Labs 发布多模态世界模型 Atlas,支持像素级相机控制与 3D 重建,被认为领先于现有评测基准。[6]
华为开源编码 Agent 工具 openJiuwen,在 SWE-bench Verified 达 82.6%,Terminal-Bench 2.1 达 87.19%,分别超过最强官方榜单成绩 3.4 和 3.39 个百分点。[7]
路透社调查显示美国 AI 数据中心出现大量虚假用电需求,用电申请超过 700 吉瓦,约为实际用电量的十倍,得州等多州出手整治。[8]
Qwen 团队发布 E-Commerce Bench,让 LLM 智能体在模拟 365 天中运营在线商店,评测 18 个前沿模型七维度表现,无单一模型全面领先。[9]
## Sources
[1] www.anthropic.com — Anthropic Claude Fable 5.1 与 Mythos 5.1 发布
[2] openai.com — OpenAI Astra Critical 级别评定
[3] deepmind.google — Gemini Agentic Video 理解
[4] x.com — Meta Muse Voice Transcribe
[5] www.ithome.com — NVIDIA 季度营收指引与财报
[6] x.com — World Labs Atlas 世界模型
[7] x.com — 华为 openJiuwen 编码 Agent
[8] www.ithome.com — 美国 AI 数据中心虚假用电
[9] x.com — Qwen E-Commerce Bench
