章节时间戳
开场
精讲:Anthropic 用任务成本解释 Opus 5 的能力增量
精讲:腾讯 WorkBuddy 拆解 Agent 的上下文与控制系统
精讲:袁晓辉分析个人提效为何未转化为组织加速
速览:Kimi K3、FLUX 3、Agent 评测、AMD、算力公平
补充阅读:Harness 降本、HumanLayer、ModelExpress、llm-d、LUNAR
结语
★ 精讲一 | Anthropic 发布 Claude Opus 5 新一代旗舰模型
|来自 Anthropic News
Anthropic 将 Opus 5 作为 Max 默认、Pro 最强模型发布:Frontier-Bench 得分超过前代两倍,ARC-AGI 3 是次优模型三倍,OSWorld 以约三分之一成本超过 Fable 5 最佳成绩。它还展示了自建视觉管线和测试工具修复复杂任务的案例;但这些数据多来自厂商测试,网络安全能力仍落后 Mythos 5。
★ 精讲二 | 腾讯 WorkBuddy 实践:如何把 Agent 做成可用产品
|来自 腾讯技术工程
WorkBuddy 团队把 Agent 可靠性拆成上下文、工具、权限、验证与反馈系统:稳定规则放 System Prompt,项目知识和 Skill 按需加载;危险动作由沙箱与审批约束,确定性错误优先交给 linter、测试等程序信号纠正。文章还区分可版本化的 Skill 与长期 Memory,帮助读者判断模型能力何时才能变成可控的产品能力。
★ 精讲三 | 袁晓辉:AI 让每个人都变强了,但为什么公司没跑得更快?
|来自 腾讯研究院
腾讯研究院袁晓辉解释了个人提效为何没有等比例变成组织产出:流程中未被优化的环节限制整体加速,瓶颈转移到跨部门协作、方案判断和反馈闭环。文章给出的判断框架是,人负责选择与创造,Agent 承担执行,同时用共享上下文、知识沉淀和持续反馈连接各节点。
速览
更多值得关注的内容
· 分解一座冰山:后端系统「AI 知识库体系」建设实践(长文干货) — 阿里技术
· Kimi K3 重绘开放前沿,Muse Spark 1.1 打响低价竞争 — The Batch | DeepLearning.AI
· FLUX 3 x mimic:视频-动作模型的下一代 — Hacker News
· 评测与提示词如何塑造智能体行为 [视频] — AI Engineer
· 火山引擎开源 Agent 驱动的搜索自迭代技术 — 字节跳动开源
· AMD 挑战英伟达全栈壁垒|一文读懂 AMD AAI 2026 — 腾讯科技
· 科技爱好者周刊(第 405 期):资源,社会公平与算力 — 阮一峰的网络日志
补充阅读
今天额外值得一读的几条
· Token 降本 50%:Harness 工作流的成本优化实践 — 腾讯云开发者
· 面向编码智能体的高级上下文工程(wsff.md)— humanlayer/advanced-context-engineering-for-coding-agents — Hacker News
· ModelExpress:以光速分发模型制品 — NVIDIA Technical Blog
· 打造 Claude Design 的产品设计师如何用它 | Claude by Anthropic — Claude Blog
· 介绍 llm-d 中的强化学习协作式时间分片 — Google Cloud Blog
· 红队测试 LLM 遗忘机制:LUNAR「被遗忘」的知识仍然可恢复 —— LessWrong — LessWrong
相关链接
· 本期早报在线阅读:www.bestblogs.dev
· Anthropic 发布 Claude Opus 5 新一代旗舰模型:www.bestblogs.dev
· 腾讯 WorkBuddy 实践:如何把 Agent 做成可用产品:www.bestblogs.dev
· 袁晓辉:AI 让每个人都变强了,但为什么公司没跑得更快?:www.bestblogs.dev
· 分解一座冰山:后端系统「AI 知识库体系」建设实践(长文干货):www.bestblogs.dev
· Kimi K3 重绘开放前沿,Muse Spark 1.1 打响低价竞争:www.bestblogs.dev
· FLUX 3 x mimic:视频-动作模型的下一代:www.bestblogs.dev
· 评测与提示词如何塑造智能体行为 [视频]:www.bestblogs.dev
· 火山引擎开源 Agent 驱动的搜索自迭代技术:www.bestblogs.dev
· AMD 挑战英伟达全栈壁垒|一文读懂 AMD AAI 2026:www.bestblogs.dev
· 科技爱好者周刊(第 405 期):资源,社会公平与算力:www.bestblogs.dev
· Token 降本 50%:Harness 工作流的成本优化实践:www.bestblogs.dev
· 面向编码智能体的高级上下文工程(wsff.md)— humanlayer/advanced-context-engineering-for-coding-agents:www.bestblogs.dev
· ModelExpress:以光速分发模型制品:www.bestblogs.dev
· 打造 Claude Design 的产品设计师如何用它 | Claude by Anthropic:www.bestblogs.dev
· 介绍 llm-d 中的强化学习协作式时间分片:www.bestblogs.dev
· 红队测试 LLM 遗忘机制:LUNAR「被遗忘」的知识仍然可恢复 —— LessWrong:www.bestblogs.dev
关于 BestBlogs
BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。


