EP128 · Opus 5、Agent 控制系统、超级团队 · 07-25 早报BestBlogs

EP128 · Opus 5、Agent 控制系统、超级团队 · 07-25 早报

13分钟 ·
播放数36
·
评论数0

章节时间戳

  • 00:00 开场

  • 00:43 精讲:Anthropic 用任务成本解释 Opus 5 的能力增量

  • 02:57 精讲:腾讯 WorkBuddy 拆解 Agent 的上下文与控制系统

  • 05:32 精讲:袁晓辉分析个人提效为何未转化为组织加速

  • 07:39 速览:Kimi K3、FLUX 3、Agent 评测、AMD、算力公平

  • 10:25 补充阅读:Harness 降本、HumanLayer、ModelExpress、llm-d、LUNAR

  • 12:04 结语

★ 精讲一 | Anthropic 发布 Claude Opus 5 新一代旗舰模型

00:43|来自 Anthropic News

Anthropic 将 Opus 5 作为 Max 默认、Pro 最强模型发布:Frontier-Bench 得分超过前代两倍,ARC-AGI 3 是次优模型三倍,OSWorld 以约三分之一成本超过 Fable 5 最佳成绩。它还展示了自建视觉管线和测试工具修复复杂任务的案例;但这些数据多来自厂商测试,网络安全能力仍落后 Mythos 5。

★ 精讲二 | 腾讯 WorkBuddy 实践:如何把 Agent 做成可用产品

02:57|来自 腾讯技术工程

WorkBuddy 团队把 Agent 可靠性拆成上下文、工具、权限、验证与反馈系统:稳定规则放 System Prompt,项目知识和 Skill 按需加载;危险动作由沙箱与审批约束,确定性错误优先交给 linter、测试等程序信号纠正。文章还区分可版本化的 Skill 与长期 Memory,帮助读者判断模型能力何时才能变成可控的产品能力。

★ 精讲三 | 袁晓辉:AI 让每个人都变强了,但为什么公司没跑得更快?

05:32|来自 腾讯研究院

腾讯研究院袁晓辉解释了个人提效为何没有等比例变成组织产出:流程中未被优化的环节限制整体加速,瓶颈转移到跨部门协作、方案判断和反馈闭环。文章给出的判断框架是,人负责选择与创造,Agent 承担执行,同时用共享上下文、知识沉淀和持续反馈连接各节点。

速览

07:39 更多值得关注的内容

· 分解一座冰山:后端系统「AI 知识库体系」建设实践(长文干货) — 阿里技术

· Kimi K3 重绘开放前沿,Muse Spark 1.1 打响低价竞争 — The Batch | DeepLearning.AI

· FLUX 3 x mimic:视频-动作模型的下一代 — Hacker News

· 评测与提示词如何塑造智能体行为 [视频] — AI Engineer

· 火山引擎开源 Agent 驱动的搜索自迭代技术 — 字节跳动开源

· AMD 挑战英伟达全栈壁垒|一文读懂 AMD AAI 2026 — 腾讯科技

· 科技爱好者周刊(第 405 期):资源,社会公平与算力 — 阮一峰的网络日志

补充阅读

10:25 今天额外值得一读的几条

· Token 降本 50%:Harness 工作流的成本优化实践 — 腾讯云开发者

· 面向编码智能体的高级上下文工程(wsff.md)— humanlayer/advanced-context-engineering-for-coding-agents — Hacker News

· ModelExpress:以光速分发模型制品 — NVIDIA Technical Blog

· 打造 Claude Design 的产品设计师如何用它 | Claude by Anthropic — Claude Blog

· 介绍 llm-d 中的强化学习协作式时间分片 — Google Cloud Blog

· 红队测试 LLM 遗忘机制:LUNAR「被遗忘」的知识仍然可恢复 —— LessWrong — LessWrong

相关链接

· 本期早报在线阅读:www.bestblogs.dev

· Anthropic 发布 Claude Opus 5 新一代旗舰模型:www.bestblogs.dev

· 腾讯 WorkBuddy 实践:如何把 Agent 做成可用产品:www.bestblogs.dev

· 袁晓辉:AI 让每个人都变强了,但为什么公司没跑得更快?:www.bestblogs.dev

· 分解一座冰山:后端系统「AI 知识库体系」建设实践(长文干货):www.bestblogs.dev

· Kimi K3 重绘开放前沿,Muse Spark 1.1 打响低价竞争:www.bestblogs.dev

· FLUX 3 x mimic:视频-动作模型的下一代:www.bestblogs.dev

· 评测与提示词如何塑造智能体行为 [视频]:www.bestblogs.dev

· 火山引擎开源 Agent 驱动的搜索自迭代技术:www.bestblogs.dev

· AMD 挑战英伟达全栈壁垒|一文读懂 AMD AAI 2026:www.bestblogs.dev

· 科技爱好者周刊(第 405 期):资源,社会公平与算力:www.bestblogs.dev

· Token 降本 50%:Harness 工作流的成本优化实践:www.bestblogs.dev

· 面向编码智能体的高级上下文工程(wsff.md)— humanlayer/advanced-context-engineering-for-coding-agents:www.bestblogs.dev

· ModelExpress:以光速分发模型制品:www.bestblogs.dev

· 打造 Claude Design 的产品设计师如何用它 | Claude by Anthropic:www.bestblogs.dev

· 介绍 llm-d 中的强化学习协作式时间分片:www.bestblogs.dev

· 红队测试 LLM 遗忘机制:LUNAR「被遗忘」的知识仍然可恢复 —— LessWrong:www.bestblogs.dev

关于 BestBlogs

BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。

关注我们