## 今日精讲
OpenAI 官宣 ChatGPT Images 2.0:从画图工具到会思考的视觉合作伙伴 [视频]
OpenAI 给 ChatGPT Images 2.0 定了个大胆定位——如果 DALL-E 是洞穴壁画、Imagen 1 是古代艺术,那么这次是图像生成的「文艺复兴」。模型第一次具备「思考」和联网搜索能力,能基于实时信息生成复杂系统图、数学证明配图,也能一次性生成一整本连贯的杂志、一套完整的装修设计,或一部保持角色一致的漫画;多语言文字渲染突破让中日韩印地孟加拉排版第一次真正可用;最高 2K 分辨率,跨 ChatGPT / Codex / API 同步开放。官方视频值得和 OpenAI 推文、宝玉解读、lmarena 竞技场数据一起看。
来自 OpenAI
Google DeepMind 发布 Deep Research × 2:研究 Agent 进入 MCP 时代
和 OpenAI 同一天出手。基于 Gemini 3.1 Pro 的研究 Agent 拆成两档:标准 Deep Research 主打低延迟互动、Max 版靠更多测试时计算迭代推理。Max 版在 DeepSearchQA 上从 66.1% 跃升到 93.3%,Humanity's Last Exam 从 46.4% 提到 54.6%,是研究型 Agent 的一次阶跃。更关键的是原生 MCP 支持,Google 已经和 FactSet、S&P、PitchBook 合作设计 MCP 服务器,意味着专业金融数据可以直接进研究工作流。配合宝玉、Philipp Schmid 的分析一起看。
来自 Google DeepMind(@GoogleDeepMind)
Sander Dieleman 揭秘 Veo 与 Nano Banana:把扩散模型看作「谱自回归」 [视频]
Google DeepMind 十年老将 Sander Dieleman 第一次系统讲述他在 Veo、Nano Banana、Imagen 背后的研究方法论。核心观点:数据筛选比调模型更重要(学术界反倒不鼓励这么做);不要把像素直接喂给 Transformer,用自编码器学潜在空间才能把 30 秒 1080p 视频从几 GB 压到可训练规模;他个人把扩散模型总结为「谱自回归」——从低频粗粒度开始生成,逐步加入高频细节,和自回归本质是同一类迭代细化;引导机制能让模型「爆发出远超自身参数体量的效果」,这就是为什么图像扩散模型参数量不大也能打。整场演讲密度极高,是理解今天 Top 1 产品背后原理的最佳配套。
来自 AI Engineer
## 速览
更多值得关注的内容
· Gergely Orosz 揭开 Token Maxing:大厂正在把 AI 使用量变成新的「代码行数」 [视频] — AI Engineer
· 腾讯 LEGO Harness Engineering:AI 能不能在「出事会炸」的亿级系统里写代码 — 腾讯技术工程
· 阿里云开发者:从玩具到生产力——AI Agent 的 Harness Engineering 四象限 — 阿里云开发者
· Vercel CTO Malte Ubl:新的应用层——AI 工程是 Web 开发的合法继承者 [视频] — AI Engineer
· Intercom 资深工程师 Brian Scanlan:9 个月把工程团队吞吐量翻倍的 Claude Code 实践手册 [视频] — How I AI
· Claude Cowork 上线 Live Artifacts:AI 搭建的仪表盘每次打开都会刷新数据 — Claude(@claudeai)
· 商汤 Solution Agent 实战:一张电影票的 Token 成本换 10 万字投标方案 — InfoQ 中文
## 更多推荐
今天额外值得一读的六条
· freeCodeCamp 硬核实测:PostgreSQL 能不能同时当缓存、队列和搜索引擎 — freeCodeCamp.org
· Google Developers Blog:重构 AI Agent 单体架构的 5 个教训 — Google Developers Blog
· DoorDash:如何把 LLM 织进深度个性化的「动态时刻」 — InfoQ
· Google DeepMind 发布 Gemma 4 开放模型家族:20 亿到 320 亿参数全覆盖 [视频] — AI Engineer
· AI Engineer 研讨会:用 MCP + Gemini 1.5 Pro 从零构建深度研究 Agent [视频] — AI Engineer
· 腾讯云开发者全方位对比 Hermes vs OpenClaw:可写运行时能否打败生态集成 — 腾讯云开发者
## 相关链接
· OpenAI 官宣 ChatGPT Images 2.0:从画图工具到会思考的视觉合作伙伴 [视频]:www.bestblogs.dev
· Google DeepMind 发布 Deep Research × 2:研究 Agent 进入 MCP 时代:www.bestblogs.dev
· Sander Dieleman 揭秘 Veo 与 Nano Banana:把扩散模型看作「谱自回归」 [视频]:www.bestblogs.dev
· Gergely Orosz 揭开 Token Maxing:大厂正在把 AI 使用量变成新的「代码行数」 [视频]:www.bestblogs.dev
· 腾讯 LEGO Harness Engineering:AI 能不能在「出事会炸」的亿级系统里写代码:www.bestblogs.dev
· 阿里云开发者:从玩具到生产力——AI Agent 的 Harness Engineering 四象限:www.bestblogs.dev
· Vercel CTO Malte Ubl:新的应用层——AI 工程是 Web 开发的合法继承者 [视频]:www.bestblogs.dev
· Intercom 资深工程师 Brian Scanlan:9 个月把工程团队吞吐量翻倍的 Claude Code 实践手册 [视频]:www.bestblogs.dev
· Claude Cowork 上线 Live Artifacts:AI 搭建的仪表盘每次打开都会刷新数据:www.bestblogs.dev
· 商汤 Solution Agent 实战:一张电影票的 Token 成本换 10 万字投标方案:www.bestblogs.dev
· freeCodeCamp 硬核实测:PostgreSQL 能不能同时当缓存、队列和搜索引擎:www.bestblogs.dev
· Google Developers Blog:重构 AI Agent 单体架构的 5 个教训:www.bestblogs.dev
· DoorDash:如何把 LLM 织进深度个性化的「动态时刻」:www.bestblogs.dev
· Google DeepMind 发布 Gemma 4 开放模型家族:20 亿到 320 亿参数全覆盖 [视频]:www.bestblogs.dev
· AI Engineer 研讨会:用 MCP + Gemini 1.5 Pro 从零构建深度研究 Agent [视频]:www.bestblogs.dev
· 腾讯云开发者全方位对比 Hermes vs OpenClaw:可写运行时能否打败生态集成:www.bestblogs.dev
· BestBlogs: bestblogs.dev

