## 今日精讲
OpenAI 正式发布 GPT-5.5:百万上下文,终端基准夺回前沿王座
今日头条:OpenAI 在 4 月 23 日发布 GPT-5.5,这是首个支持 1M token API 上下文的前沿模型,也是 ChatGPT 和 Codex 的新默认模型。官方基准表格里,GPT-5.5 在 Terminal-Bench 2.0 拿到 82.7%(GPT-5.4 75.1%、Claude Opus 4.7 69.4%、Gemini 3.1 Pro 68.5%),GDPval 胜平率 84.9%,FrontierMath Tier 4 35.4%,OSWorld-Verified 78.7%。更关键的是它保持了和 GPT-5.4 持平的 per-token 延迟,同时在 Codex 任务上使用显著更少的 token,真正兼顾了智能跃升和服务成本。发布配套 200 家早期伙伴红队评测和 cybersecurity / biology 专项测试,Plus / Pro / Business / Enterprise 计划先推,API 稍后跟上。
来自 OpenAI Blog
Core Memory EP67:Altman 与 Brockman 首次联合上播客,讲清「OpenAI 的大重置」 [视频]
精讲:Ashlee Vance 和 Kylie Robison 在 Core Memory EP67「The Great Reset At OpenAI」请来 Sam Altman + Greg Brockman,这是两人多年来首次一起上播客。Greg 几周前重新接管产品,这期是公开的战略重述:Sora 被砍、Social Network 关停、聚焦 Agent 基础设施 + Codex 面向全民。Greg 把大模型比作「大脑」、把产品层比作「身体」,强调「模型从产品之上的薄软件层变成厚软件层」;Sam 直接给出两个未来情景——底线抬升 10 倍 + 约 10 位万亿富翁(不平等加剧),或者繁荣缩减 + 不平等较低,并明言 OpenAI 会亲自造机器人包括执行器,因为「美国除了 AI 加机器人没有第二条赶超路径」。Techmeme 概要还透露他们谈到 Anthropic 对 Mythos 的「fear-based marketing」。如果你想读懂今天 OpenAI 系列发布背后的长期逻辑,这 90 分钟不能跳。
来自 Core Memory Podcast
Anthropic 公开 Claude Code 三个 bug 根因复盘,4-20 全部修复并重置订阅额度
精讲:过去一月「Claude Code 变笨」的投诉被追溯到三件独立事件,Anthropic Engineering 官方罕见地公开全部根因:一、3-4 把默认 reasoning 从 high 降到 medium 减少 UI 冻结感,用户反馈变笨后 4-7 回滚,Opus 4.7 现在默认 xhigh,其他模型默认 high;二、缓存 bug——本应一次性清理的 thinking history 被每轮都清一遍,导致健忘、重复、工具选择奇怪;三、4-16 Opus 4.7 发布当日加的 25/100 词冗余上限,后续消融测试证实让编码质量掉了 3%。三个问题都在 4-20(v2.1.116)修复,4-23 给所有订阅用户重置使用额度作补偿。在 OpenAI 密集发布的同一天公开复盘 + 真金白银赔付,这种透明度和 OpenAI 的产品侧节奏形成了今天最有张力的对照。
来自 Anthropic Engineering
## 速览
更多值得关注的内容
· 腾讯云开发者:从第一性原理思考 Agentic Engineering 的工程纪律 — 腾讯云开发者
· YC 总裁 Garry Tan 公开 Claude Code 日常工作流:并发测试与对抗式设计评审 [视频] — Y Combinator
· Lenny 对话 Cat Wu:Anthropic 把 Claude Code 发布周期从 6 个月压到 1 天 [视频] — Lenny's Podcast
· 纳德拉宣布 Office Copilot 智能体模式正式商用,全线计划默认开启 — Satya Nadella(@satyanadella)
· Pragmatic Engineer:Meta 单月烧 60 万亿 Token,内部「Token Legend」排行榜被舆论骂到下架 — The Pragmatic Engineer
· 腾讯研究院《AI Coding 观察报告 2.0》:丰饶之后,AI Coding 进入下半场 — 腾讯研究院
· Latent Space 现场盘点欧洲 AI 工程大会:Agent Labs 押注下一轮竞争的四大变量 — Latent Space
## 更多推荐
今天额外值得一读的六条
· 使用 MCP 构建接入生产系统的 Agent(Claude Blog) — Claude Blog
· Google DeepMind:Decoupled DiLoCo 实现跨区域 + 混合硬件训 12B Gemma — Google DeepMind Blog
· 通义:Qwen3.6-27B 发布,不走 MoE 路由也能拿到旗舰级编程能力 — 通义大模型
· Google:Agent Platform 的 Agents CLI,从创建到生产一个 CLI 搞定 — Google Developers Blog
· Simon Willison:LiteParse 让浏览器本地提取 PDF 文本 — Simon Willison's Weblog
· freeCodeCamp:AI 功能 A/B 测试为什么会失效,以及如何用 Python 双重差分修复 — freeCodeCamp.org
## 相关链接
· OpenAI 正式发布 GPT-5.5:百万上下文,终端基准夺回前沿王座:www.bestblogs.dev
· Core Memory EP67:Altman 与 Brockman 首次联合上播客,讲清「OpenAI 的大重置」 [视频]:www.bestblogs.dev
· Anthropic 公开 Claude Code 三个 bug 根因复盘,4-20 全部修复并重置订阅额度:www.bestblogs.dev
· 腾讯云开发者:从第一性原理思考 Agentic Engineering 的工程纪律:www.bestblogs.dev
· YC 总裁 Garry Tan 公开 Claude Code 日常工作流:并发测试与对抗式设计评审 [视频]:www.bestblogs.dev
· Lenny 对话 Cat Wu:Anthropic 把 Claude Code 发布周期从 6 个月压到 1 天 [视频]:www.bestblogs.dev
· 纳德拉宣布 Office Copilot 智能体模式正式商用,全线计划默认开启:www.bestblogs.dev
· Pragmatic Engineer:Meta 单月烧 60 万亿 Token,内部「Token Legend」排行榜被舆论骂到下架:www.bestblogs.dev
· 腾讯研究院《AI Coding 观察报告 2.0》:丰饶之后,AI Coding 进入下半场:www.bestblogs.dev
· Latent Space 现场盘点欧洲 AI 工程大会:Agent Labs 押注下一轮竞争的四大变量:www.bestblogs.dev
· 使用 MCP 构建接入生产系统的 Agent(Claude Blog):www.bestblogs.dev
· Google DeepMind:Decoupled DiLoCo 实现跨区域 + 混合硬件训 12B Gemma:www.bestblogs.dev
· 通义:Qwen3.6-27B 发布,不走 MoE 路由也能拿到旗舰级编程能力:www.bestblogs.dev
· Google:Agent Platform 的 Agents CLI,从创建到生产一个 CLI 搞定:www.bestblogs.dev
· Simon Willison:LiteParse 让浏览器本地提取 PDF 文本:www.bestblogs.dev
· freeCodeCamp:AI 功能 A/B 测试为什么会失效,以及如何用 Python 双重差分修复:www.bestblogs.dev
· BestBlogs: bestblogs.dev

