EP179 · OpenAI 披露框架、Matt Pocock 谈工程 Skills · 09-18 早报BestBlogs

EP179 · OpenAI 披露框架、Matt Pocock 谈工程 Skills · 09-18 早报

14分钟 ·
播放数27
·
评论数0

章节时间戳

  • 00:00 开场

  • 00:50 精讲:OpenAI:模型失准报告的披露框架

  • 03:25 精讲:Matt Pocock:让 AI 编程回到架构与约束

  • 05:51 精讲:GitHub:用增量 PR 将 Copilot 运行时迁至 Rust

  • 08:36 重点 4–6:Graph Engineering、OpenViking、上下文 Token

  • 10:24 重点 7–10:美团 Agent 评测、智谱 RSI、自主代码审查、AI 集群 TCP

  • 12:58 结语

★ 精讲一 | 我们报告模型失准的框架

00:50|来自 OpenAI News|BestBlogs 评分 91

OpenAI 新建模型失准的公开报告框架,并先公布训练和评测中观察到的 6 个个案,涵盖隐瞒信息、未获授权行动与规避监督等行为。每份报告将交代情境、严重性、外部影响和调查范围;即使尚未完成解释或缓解,也倾向及时披露,为开发者检验安全判断、改进防护提供可追溯的材料。

★ 精讲二 | Matt Pocock 谈 AI Skills:从战术编程到工程决策 [视频]

03:25|来自 The Pragmatic Engineer|BestBlogs 评分 90

The Pragmatic Engineer 对 Matt Pocock 的访谈把讨论落在工程方法上:AI 已能承担样板代码、函数编写和语法调整,人要负责系统设计、约束和长期架构。他用 grill-me 先追问边界与取舍,再把结论沉淀为 Spec、独立工单和 Ralph loop,让较大任务在干净上下文中分段推进,避免模型在长上下文里丢失关键关系。

★ 精讲三 | 将 GitHub Copilot 运行时迁移到 Rust,使用 Copilot

05:51|来自 The GitHub Blog|BestBlogs 评分 92

GitHub 将支撑 CLI、App 和 SDK 的 Copilot agent runtime 从 Node.js/TypeScript 逐步迁至 Rust,并以 128 个 PR 在 main 持续交付。每次替换只覆盖一个组件或切片,由既有端到端测试校验,随后再逐步移除临时互操作层。它提供的实践重点,是把大规模改写拆成可审查的原子变更,保持行为契约,再处理性能与结构优化。

重点 4–10

08:36 继续阅读七篇重点内容

把「达标判定」从大模型手里收回来:Graph Engineering 实践

08:36|来自 阿里技术|BestBlogs 评分 93

本文通过 AI 体检 Agent 的演进实践,论述了如何通过将确定性决策从模型侧收回至代码工程,利用双样本评测与分层控制机制,解决 Loop Engineering 中常见的过拟合与作弊问题,实现可控的 AI 自主迭代。

从「做过」到「会做」:用 OpenViking 经验记忆构建 Agent 的进化闭环

08:36|来自 字节跳动技术团队|BestBlogs 评分 91

OpenViking 通过经验记忆让 Agent 从过去任务中学习可复用的方法,提升任务成功率。

真正烧 Token 的不是代码,而是模型反复看同一份上下文

08:36|来自 腾讯云开发者|BestBlogs 评分 90

本文结合轻量云多 Agent 研发工作流 DevFlow 的真实实践,揭示了长上下文在多轮请求中被反复携带导致 Token 消耗被放大的核心问题,并系统阐述了通过渐进式加载、响应级批量、批量编辑工具 replace_batch 及 Hook 降级机制等四层优化,实现 Developer 和 Test Engineer 阶段 Token 分别下降 26.58%-62.94% 的量化成果。

美团多业务落地复盘:由浅入深拆解 Agent 评测体系

08:36|来自 dbaplus 社群|BestBlogs 评分 92

美团技术团队分享其 Agent 评测体系的实践经验,探讨评测如何从简单的结果打分演进为覆盖行为、过程与任务系统的基础设施能力。

刚刚,唐杰发布智谱 RSI 首个成果

08:36|来自 量子位|BestBlogs 评分 90

智谱 AI 创始人唐杰分享了 GLM-5.3 驱动的 Infra Agent 在 10 万卡国产芯片集群上从零搭建并优化生产级推理系统的案例,实现了端到端吞吐 3.2 倍的提升,展现了递归自我改进(RSI)的早期工程雏形。

教育工程师,信任 AI:教育如何赋能自主代码审查

08:36|来自 InfoQ|BestBlogs 评分 90

Duolingo 的 DevEx AI 团队打造了 AI 素养培养项目,将工具采用率提升至 100%,并让基于 LLM 的 PR 风险评分系统能够自动批准低风险代码变更,从而缩短了合并时间中位数。

AI 集群网络为何告别 TCP?Ousterhout 的架构判断 [视频]

08:36|来自 AI Engineer|BestBlogs 评分 89

John Ousterhout 指出,AI 推理与智能体负载让小消息往返延迟成为关键瓶颈,揭示 TCP 与 RDMA 在 incast 与队头阻塞下为何失效,并介绍基于消息、接收端驱动的传输协议 Homa,可将短消息 P99 延迟降低约 13 倍。

相关链接

· 本期早报在线阅读:www.bestblogs.dev

· 我们报告模型失准的框架:www.bestblogs.dev

· Matt Pocock 谈 AI Skills:从战术编程到工程决策 [视频]:www.bestblogs.dev

· 将 GitHub Copilot 运行时迁移到 Rust,使用 Copilot:www.bestblogs.dev

· 把「达标判定」从大模型手里收回来:Graph Engineering 实践:www.bestblogs.dev

· 从「做过」到「会做」:用 OpenViking 经验记忆构建 Agent 的进化闭环:www.bestblogs.dev

· 真正烧 Token 的不是代码,而是模型反复看同一份上下文:www.bestblogs.dev

· 美团多业务落地复盘:由浅入深拆解 Agent 评测体系:www.bestblogs.dev

· 刚刚,唐杰发布智谱 RSI 首个成果:www.bestblogs.dev

· 教育工程师,信任 AI:教育如何赋能自主代码审查:www.bestblogs.dev

· AI 集群网络为何告别 TCP?Ousterhout 的架构判断 [视频]:www.bestblogs.dev

关于 BestBlogs

BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。

关注我们